三款热门「Flash」模型对比分析:DeepSeek-V4-Flash vs GLM-5.3-Flash vs Qwen3.8-Flash

2026 年 8 月下旬,三家国产大模型厂商几乎在同一时间窗口放出了各自的「Flash」档位模型。它们都把总参数做大、激活参数做小,用稀疏/状态空间注意力把长上下文成本压到接近极限。本文基于官方文档、技术报告与开源权重/推理框架的实测配置,对三款模型在参数量、激活量、专业能力、成本、部署要求与实际体验上做一次系统性对比。

一 一句话结论

模型总参数激活参数定位
DeepSeek-V4-Flash284B13B极致性价比的文本/Agent 主力,1M 上下文标配
GLM-5.3-Flash320B18B首个「稀疏+线性」混合注意力的开源多模态模型
Qwen3.8-Flash125B6B超稀疏 MoE + N-gram Embedding,Qwen4 架构预览

三款都不是单纯「小模型」,而是大 MoE 的稀疏激活版。激活参数从 6B 到 18B,意味着单 token 推理成本都远低于同档稠密模型。

二、架构与参数:谁把「算力杠杆」用到了极致

2.1 总参数与激活参数

指标DeepSeek-V4-FlashGLM-5.3-FlashQwen3.8-Flash
总参数284B320B125B(+51B n-gram +4B MTP)
激活参数13B18B6B
MoE 专家256 routed + 1 shared288 routed + 1 shared512 experts, 10 routed + 1 shared
层数4548
上下文(原生)1M1M262K(可 YaRN 扩到 1M)
最大输出384K128K131K
推理框架vLLM / SGLangvLLM / SGLang / TokenSpeedvLLM / SGLang / TokenSpeed

关键差异在「效率杠杆」:

  • Qwen3.8-Flash 的 6B 激活参数是三者最低,且引入了 51B 的 N-gram Embedding(用双/三元组索引直接在 embedding 层扩参,几乎不增加计算、可 CPU offload)。它继承了 Qwen3-Next 的 Gated DeltaNet + Gated Attention,但把 Gated Attention 换成了 Qwen Sparse Attention (QSA)——在 micro-block 级别做稀疏选择,而不是逐 token 选。此外还有 Gated Residual按权重类别混用 Muon/AdamW 的定制训练配方

  • GLM-5.3-Flash 是业内首个开源前沿模型采用稀疏注意力 + 线性注意力混合架构:线性注意力用状态建模捕获局部依赖,稀疏注意力用轻量索引器召回全局上下文。还引入 IndexPool(把索引器 4 个 KV 向量加权池化成 1 个)和 Manifold-Constrained Hyper-Connections (mHC)。相比兄弟模型 GLM-5.3,注意力计算量降 3.01×、KV 缓存降 4.44×

    • 稀疏注意力是指不再让每个 token 都和序列里所有其他 token 计算 attention,而是只保留一部分“重要”的连接。
    • 线性注意力是另一类降低 attention 复杂度的方法。它把 softmax attention 改写成线性核函数形式,使得 Q K T QK^T QKT 可以先和 VV 相乘,从而把复杂度从 O ( n 2 ) O(n^2) O(n2) 降到 O ( n ) O(n) O(n),并能像 RNN / 状态空间模型(SSM)一样用递推或卷积处理超长序列。
  • DeepSeek-V4-Flash 主打 Token-wise 压缩 + DSA(DeepSeek Sparse Attention),官方宣称 1M 上下文为默认标准,且专注 Agent 场景的 Code/工具调用。

⚠️ 版本说明:DeepSeek 侧有两个的版本——deepseek-v4-flash(模型版本 DeepSeek-V4-Flash-0731,纯文本/Agent 主力)与 deepseek-v4-flash-vision-exp多模态实验版,2026-08-21 上线)。官方明确声明 Vision-Exp 在纯文本能力上与 0731 正式版持平,它是给"文本基础上加视觉理解"的多模态版本,而非"更强的 0731"。因此本横评主体的 DeepSeek 文本/Coding/Agent 数据采用 0731 正式版口径;仅多模态基准列标注为 Vision-Exp 口径。DeepSeek 官方不存在名为 deepseek-v4-flash-exp 的模型。

2.2 谁更「吃显存」?

三者的 FP8 权重体积直接影响自建部署门槛:

模型FP8 权重官方推荐部署
DeepSeek-V4-Flash~284GB4×H100(短上下文)/ 4×H200(1M)
GLM-5.3-Flash~306GBvLLM TP4 (GB200) 或 TP8 (H100/H200/MI355X)
Qwen3.8-Flash172.78 GiB(BF16 为 335 GiB)vLLM 4×GB300 / 8×H200(TEP8)/ 4×MI355X

Qwen3.8-Flash 的 51B n-gram 表可 offload 到 CPU(VLLM_PLE_CPU_OFFLOAD=1,需 ≥51GB 主机内存),这让它在显存受限场景(如 4 卡 MI355X、或 262K 上下文)比前两者更灵活。


三 专业能力:Agent / Coding / 多模态 都是抢分点

3.1 Coding 与 Agent 能力

官方公开的可比基准(分数越高越好,-- 表示未披露):

基准DeepSeek-V4-Flash(-0731)GLM-5.3-FlashQwen3.8-Flash
DeepSWE v1.154.463.458.7
Terminal Bench 2.182.784.3
NL2Repo54.256.348.1
SWE-bench Pro56.062.5
SWE-bench Multilingual81.0
Toolathlon Verified70.378.473.5
Agents’ Last Exam (Pass@1)25.226.324.3
AutomationBench25.148.8
HLE33.855.3(带工具)35.9

解读:

  • GLM-5.3-Flash 在 Coding/Agent 类基准上整体领先,DeepSWE v1.1(63.4 vs 46.2)和 AutomationBench(48.8 vs 26.2)相比 GLM-5.2 大幅提升,官方称其「接近 Claude Opus 4.8」。
  • Qwen3.8-FlashSWE-bench Pro / Multilingual 这类「真实工程修复」上最强,且以 6B 激活打出了接近 13B-18B 激活模型的成绩;但 NL2Repo 上略逊。
  • DeepSeek-V4-Flash 是三者中「最稳」的 Agent 通用件,DeepSWE/NL2Repo/Toolathlon 都处于第一梯队,且并发上限最高(2500)。

3.2 多模态(视觉 / 视频)

基准DeepSeek-V4-Flash(-Vision-Exp)GLM-5.3-FlashQwen3.8-Flash
Chartography (w/ tools)64.378.0
CharXiv Reasoning80.489.484.6
AndroidWorld84.5
OSWorld 2.0 (partial)52.3
Vision2Web64.0
MVBench69.477.8
MMVU72.780.5

📌 口径提示:此表 DeepSeek 数据来自 Z.ai(GLM-5.3-Flash 博客)引用的 DeepSeek-V4-Vision-Exp。注意各家厂商对 DeepSeek 的具体版本取样有别——Z.ai 用 Vision-Exp,Qwen 模型卡用 DeepSeek-V4-Flash-0731,因此 DeepSeek 在「Coding 表」和「多模态表」的数值不可直接同列比较。

关键区别:

  • DeepSeek 的视觉是「后补」的:V4-Flash 本体纯文本,V4-Flash-Vision-Exp 在 8 月 21 日才上线,共享同一套结构参数,纯文本能力与正式版持平,视觉 Agent 能力接近 Opus-4.8。它的多模态只在 API 侧,开源权重本身不带 vision encoder。
  • GLM-5.3-Flash原生多模态(图片/视频/文件),视觉直接融入 Coding 循环——能自主「观察」界面、渲染结果与交互反馈并迭代。这也是它的核心卖点。
  • Qwen3.8-Flash 同样是原生多模态(图/视频),在 AndroidWorld/OSWorld/Vision2Web 等「真实使用/复刻」类任务上突出,适合 CUA(Computer Use)场景。

四 成本:谁能用一分钱买到一分「高级智能」

4.1 API 定价对照(人民币,百万 tokens)

统一换算成¥/M,缓存命中数据也已收录:

项目DeepSeek-V4-FlashGLM-5.3-Flash(限时5折→原价)Qwen3.8-Flash(海外)
输入(未命中,高峰)3.00.8 → 0.4
输入(未命中,闲时)1.5
输出(高峰)9.02.8 → 1.4
输出(闲时)4.5
输入(缓存命中)0.10(高峰)/0.05(闲时)0.23 → 0.115$0.016
备注峰谷定价,工作日高峰打折 50%5 折限时两周$0.15 输入 / $0.47 输出

注:DeepSeek 采用峰谷定价(工作日 9:00-12:00、14:00-18:00 为高峰,其余闲时);GLM 国内价 5 折限时两周;Qwen3.8-Flash 国内走阿里云百炼(DASHSCOPE),海外 QwenCloud 上 $0.15/$0.47

直观结论(按人民币折算成美元,~7 ¥/USD):

模型输入(峰值)输出(峰值)相对成本
DeepSeek-V4-Flash~$0.43~$1.29
GLM-5.3-Flash~$0.11(限时)/ $0.15(海外)~$0.20 / $0.50最低
Qwen3.8-Flash~$0.15~$0.47

GLM-5.3-Flash 和 Qwen3.8-Flash 在输出侧都做到了 $0.47-0.50/M,而 DeepSeek-V4-Flash 输出要 $1.29(高峰),成本约是前二者的 2.5×

4.2 开源 + 自建成本

三者均提供开源权重(MIT License 或等同):

模型生命周期自建门槛
DeepSeek-V4-Flash权重已开源(HF / ModelScope),1M 上下文4×H100 起,1M 需 4×H200,约 284GB FP8
GLM-5.3-Flash权重已开源(HuggingFace zai-org/GLM-5.3-Flash),MIT约 306GB FP8,TP4(GB200)/TP8(H100/H200)
Qwen3.8-Flash权重已开源(HF / ModelScope),Qwen3.8-Flash-Next约 180GB,4×GB300 / 8×H200 / 4×MI355X;n-gram 可 offload

五 实际体验与生态

维度DeepSeek-V4-FlashGLM-5.3-FlashQwen3.8-Flash
默认思考模式有(thinking/non-thinking)仅思考(thinking only)默认思考(xhigh/medium/low)
思考强度控制low/high/max 三档reasoning_effort(low/high/max 近似)xhigh/medium/low
API 兼容OpenAI + Anthropic + ResponsesOpenAI(智谱风格,兼容)OpenAI + Anthropic + Responses
工具/Agent 适配Claude Code、OpenCode、CodexZCode/BUA/CUA、大量生态工具Claude Code、Codex
并发上限25005015K RPM / 2M TPM
强项场景通用 Agent、代码补全、长文档视觉 Coding、Office/金融交付、国产芯片计算机/移动端操控、高并发生产

体验层面的几个值得注意的点:

  1. Qwen3.8-Flash 的 preserve_thinking:默认保留历史所有思考块,牺牲一部分 token 换取 Agent 场景的决策一致性和 KV 复用,实测在长程任务上更稳。
  2. GLM-5.3-Flash 的思考模式是「强制开启」thinking.type 只能 enabled),不支持关闭;官方建议 temperature=1, top_p=0.95, reasoning_effort=max,流式同时开 stream + tool_stream
  3. DeepSeek 的峰谷定价:闲时(晚上/周末)价格砍半,适合把批处理任务挪到非高峰的团队,能再省一截。
  4. 并发:Qwen3.8-Flash 给到 15K RPM / 2M TPM,远超 DeepSeek 的 2500,适合高并发在线服务;DeepSeek 的 2500 并发更适合大模型 Agent 编排的墙钟调用。

七 怎么选

你的场景首选
需要极致低成本 + 原生多模态 + Coding 闭环GLM-5.3-Flash(输出 $0.50/M,视觉 Coding 最强,国内 5 折更划算)
需要 6B 激活、超稀疏架构、高并发 API + 多模态 CUAQwen3.8-Flash(6B 激活、$0.47 输出、15K RPM)
需要 1M 默认上下文 + 通用 Agent 稳定 + 峰谷省钱DeepSeek-V4-Flash(1M 标配、并发 2500、闲时半价)
想彻底自建、避开云依赖三者都开源;显存紧选 Qwen(n-gram offload),要长上下文 1M 选 DeepSeek 或 GLM
国产芯片 / 信创环境GLM-5.3-Flash(官方已在国产加速芯片集群跑通,MI355X 有官方 recipe)

八 局限与风险提示

  • 三家厂商各自的基准都用自家评测框架(DeepSeek Harness、Z.ai Code Bench、Qwen 自家 Cowork/RecreationBench),不同厂商横评不能直接 pk 分数,只能看相对趋势。
  • GLM-5.3-Flash 国内 0.4/1.4 元是限时 5 折,两周后恢复 0.8/2.8 元;海外 $0.15/$0.50 是稳定价。
  • Qwen3.8-Flash-Next 是「架构预览」版本(262K 原生),生产接入请用 API 版 qwen3.8-flash(1M 默认、内置工具)。
  • DeepSeek 的 deepseek-chat / deepseek-reasoner 旧模型名已于 2026-07-24 停止使用,需迁移到 deepseek-v4-flash
  • 三方都在快速迭代,基准数字会随版本变化,落地前请核对官方文档。

参考资料

官方来源(首选):

部署与专业延伸:

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐