更新日期:2026 年 8 月 27 日
适用对象:大模型部署、vLLM、云 GPU、Agent 应用开发者

2026 年 8 月 27 日,Qwen 新增开放权重的是 Qwen3.8-Flash-Next 和官方 FP8 量化版。先说结论:这是同一个模型的两种权重格式,FP8 权重仍有 172.78 GiB,不能把“每个 Token 激活 6B 参数”理解成“一张消费级显卡就能跑”。

今天到底开放了哪些 Qwen3.8?

截至 2026 年 8 月 27 日,Qwen 官方模型页可以确认:

模型 本次新增 权重规模 许可证 适合场景
Qwen/Qwen3.8-Flash-Next BF16 约 335.28 GiB Qwen Community 1.0 高端多卡、架构研究
Qwen/Qwen3.8-Flash-Next-FP8 172.78 GiB Qwen Community 1.0 多卡推理、服务部署
Qwen/Qwen3.8-27B 否,8 月 14 日已发布 27B Dense 以模型页为准 单卡或双卡部署
Qwen/Qwen3.8-2.4T-A95B 否,8 月 12 日已发布 2.4T、激活 95B 以模型页为准 超大规模推理集群

严格来说,本文使用“开放权重”比笼统称为“开源”更准确。Flash-Next 模型权重页显示的许可证为 qwen-community-1.0,不要与 Qwen GitHub 仓库的 Apache-2.0 许可证混为一谈。

官方来源:Qwen3.8-Flash-Next 模型页FP8 模型页Qwen3.8 官方仓库

为什么激活参数只有 6B,显存要求仍然很高?

Flash-Next 的结构包含:

  • 125B 主模型参数,每个 Token 激活约 6B;
  • 额外的 51B N-gram Embedding;
  • 约 4B MTP 参数;
  • 262,144 Token 原生上下文,可通过 YaRN 扩展至 100 万 Token;
  • 视觉编码器,支持文本和图像输入。

MoE 的“激活参数少”主要降低单次计算量,并不会让未激活权重凭空消失。模型加载时仍要考虑全部权重、KV Cache、CUDA Kernel、运行时缓存和并发空间。

根据 vLLM 官方部署配方

版本 权重大小 官方验证配置
FP8 172.78 GiB GB300 最低 TP2,推荐 TP4;H200 使用 TEP8
BF16 335.28 GiB 验证配置约占每张 GB300 190 GiB
N-gram CPU Offload 额外要求 至少准备 51 GB 主机内存及运行余量

所以,RTX 4090、RTX 5090、A100 80G 都不是 Flash-Next 官方首发配方中的单卡部署设备。尤其不要看到“激活 6B”就直接按 6B 模型估算显存。

路线一:按官方配置部署 Flash-Next FP8

目前比较稳妥的是使用 vLLM 提供的专用镜像,而不是直接执行普通的 pip install vllm

docker pull vllm/vllm-openai:qwen38-flash-next

以官方验证的 8×H200 配置为例:

vllm serve Qwen/Qwen3.8-Flash-Next-FP8 \
  --tensor-parallel-size 8 \
  --enable-expert-parallel \
  --moe-backend triton \
  --gpu-memory-utilization 0.85 \
  --max-num-seqs 256 \
  --enable-prefix-caching \
  --no-enable-flashinfer-autotune \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_xml \
  --reasoning-parser qwen3

这里有一个容易踩坑的点:官方配方明确指出,H200 上不能直接使用普通 TP8 加载该 FP8 权重,需要启用专家并行,即 TEP8。

如果加载阶段 OOM,可以依次检查:

  1. 是否使用了 Flash-Next 专用 vLLM 镜像;
  2. 是否误把原生上下文直接扩到 100 万 Token;
  3. 是否需要启用 N-gram Embedding CPU Offload;
  4. 是否给主机内存预留了至少 51 GB 加运行余量;
  5. 是否需要提高 TP 数量或降低 --max-model-len

路线二:想在算家云(suanjiayun.com) 尽快跑起来,先部署 Qwen3.8-27B

如果目标是今天完成 Qwen3.8 API 验证,而不是研究 Flash-Next 架构,更现实的选择是 Qwen3.8-27B

vLLM 官方配方已经验证:

  • 2×RTX 5090 可以运行 Qwen3.8-27B 的 FP8 或 NVFP4 版本;
  • 1×RTX 5090 可以运行 NVFP4,但需要降低上下文并增加 --enforce-eager
  • 双卡配置更适合保留长上下文和 KV Cache 空间。

算家云当前官网列出了 32GB 显存的 RTX 5090。实际库存、区域和可选卡数会动态变化,应以创建实例页面为准。

在算家云创建实例后,先检查运行环境:

nvidia-smi
python -V
python -c "import torch; print(torch.__version__, torch.cuda.is_available())"

如果创建页面提供双 RTX 5090,可以参考以下 FP8 启动方式:

vllm serve Qwen/Qwen3.8-27B-FP8 \
  --tensor-parallel-size 2 \
  --max-model-len 262144 \
  --kv-cache-dtype fp8 \
  --reasoning-parser qwen3 \
  --enable-auto-tool-choice \
  --tool-call-parser qwen3_coder

启动后验证 OpenAI 兼容接口:

curl http://127.0.0.1:8000/v1/chat/completions \
  -H "Content-Type: application/json" \
  -d '{
    "model": "Qwen/Qwen3.8-27B-FP8",
    "messages": [
      {"role": "user", "content": "用 Python 实现一个带重试的异步 HTTP 客户端"}
    ],
    "temperature": 1.0,
    "top_p": 0.95,
    "max_tokens": 1024
  }'

如果服务只返回 <think> 内容,或者答案被推理过程挤占,需要确认启动参数中包含:

--reasoning-parser qwen3

算家云适合放在哪个环节?

算家云更适合承担“按需准备 GPU 环境、下载权重、启动推理服务、完成 API 验收”这段工程流程。

平台支持 SSH、JupyterLab、VS Code 等连接方式;按量实例开机开始计算算力费用,关机结束实例算力计费,不足一小时的使用时段按秒计费。模型权重、数据盘等关联资源是否继续计费,则要分别查看对应规则。

对于 Qwen3.8,建议这样选:

目标 建议路线
快速验证 Qwen3.8 对话、代码和工具调用 双 RTX 5090 + Qwen3.8-27B-FP8
单卡实验 RTX 5090 + 27B NVFP4,缩短上下文
研究 Flash-Next 新架构 选择官方验证的 H200、B200、GB300 等多卡配置
生产级高并发 先压测吞吐、首 Token 延迟和 KV Cache,再决定 TP/TEP
只是调用模型能力 直接使用托管 API,避免维护推理基础设施

FAQ

Qwen3.8-Flash-Next 是 6B 模型吗?

不是。它的主模型为 125B 参数,每个 Token 激活约 6B,此外还有 51B N-gram Embedding 和 MTP 参数。

一张 RTX 5090 能运行 Flash-Next FP8 吗?

不能按官方 FP8 权重直接加载。FP8 checkpoint 为 172.78 GiB,远超单张 RTX 5090 的 32GB 显存。

为什么推荐在算家云先跑 Qwen3.8-27B?

因为 27B 已有双 RTX 5090 的 vLLM 验证记录,工程门槛明显低于 Flash-Next,更适合快速完成 API 和业务效果验证。

Flash-Next 能直接使用 100 万 Token 上下文吗?

原生上下文是 262,144 Token。扩展至 100 万 Token 需要显式启用 YaRN,并重新评估显存占用和短上下文质量。

这篇命令是实测结果吗?

不是。模型规格和启动参数来自 Qwen、vLLM 官方资料;算家云 RTX 5090 规格来自平台页面。正式部署前仍需按实时库存和当前推理框架版本验证。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐