最近把 Qwen 开源的一款超大 MoE 模型——Qwen3.8-2.4T-A95B 的参数、架构、硬件门槛和真实成本整理出来。分享给同样在关注大模型选型和 MoE 部署的同学。

首先 有三个问题可以帮你定位
读这篇文章之前,可以先问自己三个问题:

你知道 MoE 和普通密集大模型最大的区别是什么吗?
(答案是“每次只激活一部分参数,但全部知识都存储在模型中”)

如果给你 50 张 A100,你确定能把它跑起来吗?
(很可能不能,因为除了卡数,互联带宽和推理引擎适配更关键)

MoE 部署最难的地方是算法还是工程?
(是工程。专家负载均衡、跨卡通信、显存碎片管理,每一关都能卡住大部分人)

如果你对这三个问题有疑惑,和我一起看看学习吧

一、先搞清楚:这到底是什么级别的模型?

一句话:

用大约 95B 参数的计算成本,调用 2.4T 参数的知识储备。

每次推理只激活约 950 亿参数做计算,但模型总容量达到 2.4 万亿。好比一家公司有 2.4 万名员工,但处理任何单子只出动最对口的 950 人——知识面极广,但单次推理成本可控。

核心参数如下:

模型名称:Qwen3.8-2.4T-A95B
总参数量:2.4T(2.4万亿)
激活参数量:~95B(单次推理实际计算量)
稀疏度:≈3.96%
架构:细粒度 MoE(混合专家)
专家配置:每层 512 个路由专家 + 1 个共享专家,每个 token 激活 10 个路由专家 + 1 个共享专家
注意力机制:全注意力 + 线性注意力 交替使用
上下文窗口:原生 262K Token,可扩展至 1M Token
权重许可:完全开放,可私有化部署
推荐部署平台:NVIDIA GB300 NVL72

对比一下,GPT-3 是 175B。Qwen3.8-2.4T-A95B 的 2.4T 相当于 13 个 GPT-3 拼在一起,但每次激活的 95B 比 GPT-3 还少
——这就是 MoE 架构的核心价值:知识装得下,算力花得少。

二、架构上有哪些关键设计?

MoE 模型不少,但这款做了几个关键升级。

  1. 细粒度 MoE:动态组队,按需调用
    传统 MoE 大多是固定的“Top-2 专家”机制——不管什么问题,都强行调用两个专家。简单问题也是俩人,复杂问题也是俩人,灵活性不够。

Qwen3.8-2.4T-A95B 采用细粒度设计:

每层 512 个路由专家,分工更细

每个 token 激活 10 个路由专家 + 1 个共享专家

实际按问题难度动态组合,不机械固定

打个比方:传统 MoE 像“不管什么病都挂专家号”,细粒度 MoE 更像“小毛病挂普通号,大毛病自动转专家会诊”——算力真正用在刀刃上。

  1. 混合注意力:交替使用,兼顾质量与成本
    纯全注意力机制有个硬伤:文本长度翻倍,算力翻四倍(平方级增长)。10 万 token 以上的文本基本跑不动。

该模型的方案是 全注意力 + 线性注意力 交替使用:

全注意力负责保证推理质量

线性注意力负责控制长文本算力开销

两者交替运作,百万级 token 的上下文才变得现实——这也是它能处理整本书、整个代码仓库的技术底气。

  1. 可配置推理强度:按场景分配算力
    模型支持切换推理模式:

日常问答 → 轻量推理(快、省)

数学 / 代码 / 复杂规划 → 深度推理(慢、准)

业务中可以按请求难度动态分配算力,不用一刀切。

三、部署门槛到底有多高?(重点)

这部分是大多数人最关心的——跑起来到底要多少钱?

显存需求
实际部署主要看 INT8 / FP8 量化(FP16 太费卡,很少直接用):

INT8 / FP8 量化:≈ 2.4 TB
实际部署时,KV Cache、激活值、通信缓存还要额外占显存,总需求高于 2.4TB。

硬件配置
直接劝退个人开发者和中小团队:

最低配置(INT8 / FP8 量化下):

  • GPU:30+ 张 A100/H100 80GB
  • 互联:NVLink(必须,普通以太网是带宽瓶颈)
  • 系统内存:≥512GB(生产建议 1TB)
  • 存储:≥5TB NVMe SSD
  • 推理引擎:vLLM 或 TensorRT-LLM(需二次开发)
    简单算一下:2.4TB ÷ 80GB = 30 张卡,只多不少。

官方推荐直接上 NVIDIA GB300 NVL72 完整集群——72 张卡,面向头部大厂和国家级算力中心。

根据 NVIDIA 官方披露,GB300 NVL72 平台上 FP8 推理性能可达 每 GPU 超 4,000 tokens/秒,单用户约 350 tokens/秒。这个数据可以作为性能参考。

成本估算

30 张 H100 裸卡 ≈ 90 万美元(价格因采购渠道、地区浮动)

加服务器、互联、散热、运维 → 首年总投入千万人民币级别

真实感受:国内能稳定跑起这个模型的团队,可能两只手数得过来。

四、适合干什么?和 DeepSeek-V3 怎么选?

✅ 真正适合的场景
1、超长文档处理(合同、研报、技术手册) 百万级上下文 + 混合注意力
2、复杂推理(数学、代码生成) 2.4T 容量 = 更强推理潜力
3、私有化知识库(数据不能出内网) 开放权重 = 本地部署
作为教师模型做蒸馏 2.4T 知识迁移到小模型
❌ 完全不合适的场景

1、简单问答、短文本分类、日常闲聊、高并发实时业务
这些活 7B/70B 密集模型干得挺好,上 2.4T MoE 是典型的大炮打蚊子。

和 DeepSeek-V3 怎么选?

总参数: Qwen3.8-2.4T-A95B 2.4T DeepSeek-V3 671B

激活参数: Qwen3.8-2.4T-A95B ~95B DeepSeek-V3 ~37B

稀疏度 Qwen3.8-2.4T-A95B3.96% DeepSeek-V3 5.5%

混合注意力Qwen3.8-2.4T-A95B ✅ 交替使用 DeepSeek-V3 ❌ 纯全注意力

部署门槛: Qwen3.8-2.4T-A95B 极高 DeepSeek-V3高

选型建议:
追求技术上限、有充足算力预算 → Qwen3.8-2.4T-A95B 更值得投入
追求落地性价比、想尽快上线 → DeepSeek-V3 更现实

总结:几点真实收获

整理完这些资料,最深的三个体会:

  1. MoE 是超大模型的必经之路。 稠密模型算力成本已接近天花板,往后想继续提升容量,稀疏 MoE 几乎是唯一可行的技术路线。

  2. 开源 ≠ 人人可用。 模型权重确实开放了,但 30 张 H100 的硬件门槛直接把绝大多数人挡在门外。开源的意义,更多是为学术研究和大厂技术储备提供基础。

  3. MoE 真正的难点是工程,不是算法。 路由不均衡、跨卡通信慢、显存碎片化——这些才是卡住落地进度的真实瓶颈。模型效果本身反而不是问题。

参考资料

通义千问官方技术文档

NVIDIA 技术博客(GB300 NVL72 推理性能数据)

Switch Transformer / GShard 论文

vLLM MoE 分布式部署方案

📌 个人学习整理,如有不对的地方欢迎留言指正,互相学习。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐