Qwen3.8-Max 发布两周了。这两周里,2.4T 权重和 27B 稠密版先后开源,DeepSeek 的涨价方案也刚好在今天生效。热搜退了,账该补上了。这次上秤的是史上最重的权重,尺子还是第一篇那把,每成功任务成本。

回看发布日:2.4 万亿参数,API 输入 12 元、输出 36 元,官方同时宣布权重开源。千问历史上第一次,把 Max 级旗舰放出来给所有人下载。

金字塔尖免费送,当时是全行业的狂欢。但这个系列只认一条铁律:免费的图纸,不等于便宜的工厂

照旧拆三本账:API 怎么买才不亏、2.4T 谁真正部署得起、阿里把旗舰免费送出去,到底在图什么。

一、一张成绩单,一份价目表

规格表和成绩单,先原样摆上桌。

维度 Qwen3.8-Max 备注
总参数 / 激活参数 2.4T / 95B 基于 Qwen3.5 底座的 MoE 稀疏结构
上下文窗口 ~1M token 对标 V4-Flash 的长上下文赛道
核心能力 编程 + 专业办公 + 长周期任务 数百类真实职业场景强化学习优化
代表战绩 自主连续编程 16 天;电商模拟 2000+ 轮交互,10 万本金做到 41.6 万 Arena 三个分项国产前列
API 定价(国内) 输入 12 元 / 输出 36 元 / 缓存命中 1.5 元(每百万 token) 国际版输入 $2 / 输出 $6
权重开源 已落地(8 月 12 日夜 2.4T 权重先行上线、8 月 14 日 27B 稠密版) 千问首次开源 Max 级权重;Max 用专属许可,27B 用 Apache 2.0

这张表不长,但有三个地方值得停下来看看。

第一,它对标的是“干活”,不是“聊天”。 连续 16 天不眠不休自主写代码;电商经营模拟里泡了 2000 多轮交互,拿 10 万本金做到 41.6 万——清一色的长程 Agent 任务。法务一周的文档审阅压到 1 小时、一条指令搭出量化交易工作流,把这些宣传话术翻译成大白话就一句:这一代旗舰卖的,是“每干成一件事”的本事,不是“每回一句话”的聪明。这个口径,恰好就是第一篇立下的“每成功任务成本”。连厂商自己,都开始拿任务成功率讲故事了。

第二,性能涨了一代,价格一分没动,而且赶在全行业涨价的当口。 上一代 Qwen3.7-Max 原价就是输入 12 元、输出 36 元,眼下限时 5 折,6 元 / 18 元清场;新一代原地接棒原价位。这两周行业发生了什么:智谱年内三次上调 API 价格,Kimi K3 定价较上代翻 3-4 倍,腾讯云年内两轮调价,混元 API 单轮最高涨了 463%,DeepSeek 今天正式执行新价——而千问按兵不动。放到国际口径看更有意思:按美元计价,输入输出分别只有 Opus 5 的 40% 和 24%。别人在涨,它在锚。

第三,也是最炸的一条:旗舰权重真开源了,而且已经到手。 8 月 12 日深夜,2.4T 权重以 Qwen3.8-2.4T-A95B 之名先行上线 HuggingFace,13 日魔搭同步开放:512 个专家、92 层结构、原生 262K 上下文可扩展到约 1M,这是千问第一次开放 Max 级旗舰权重。两天后的 8 月 14 日,27B 稠密版跟进——开源史上,第一次有 2T 俱乐部的成员主动开门。不过有两个细节值得琢磨:一是节奏,“先开 Max、再补 27B”,跟官宣时的“同步”略有出入;二是口径,开源版只给文本输入、强制开思考、默认上下文 262K,视觉和满血 1M 留在 API 版;许可证也不是 Apache 2.0,而是专属的 Qwen3.8-Max License——下载、部署自由,但商业产品月活过亿或月收入超 2000 万美元要署名,做 MaaS 或 AI 办公助手业务、集团任意连续 12 个月合计收入超 5000 万美元的,商用前需另拿授权。免费是真免费,只是边界写得明明白白。

成绩单说完,开始算账。第一本是人人都会算的 API 账,但丑话得说在前面:盯着单价算 API 账单,是 Agent 时代最容易犯的错

二、API账:DeepSeek 涨价之后,牌桌重排了

先把最新的价目表拉到一起(每百万 token,折合人民币)。DeepSeek 在 8 月 13 日官宣调价,今天(8 月 17 日)零时正式生效,还引入了峰谷两档:高峰是每日 9-12 点、14-18 点,闲时价格为高峰的一半。

模型 输入(未命中) 输出 缓存命中输入 定位
DeepSeek V4-Flash(8/17 新价,闲时/高峰) 1.5 / 3 元 4.5 / 9 元 0.05 / 0.1 元 开源经济版,告别白菜价
DeepSeek V4-Pro(8/17 新价,闲时/高峰) 4.5 / 9 元 13.5 / 27 元 0.15 / 0.3 元 开源旗舰,高峰输出涨 350%
Qwen3.7-Max(限时 5 折) 6 元 18 元 1.2 元 上一代旗舰清场价
Qwen3.8-Max(原价未动) 12 元 36 元 1.5 元 新一代旗舰
Opus 5(海外,折合) ~35 元 ~180 元 海外闭源旗舰

这张表跟两周前最大的不同,是 DeepSeek 涨价之后,它和千问之间的价差结构全变了。V4-Flash 高峰输出 9 元,较原价 2 元涨了 350%,已经够到 Qwen3.7-Max 5 折价的一半;V4-Pro 高峰输出 27 元,一只脚踩进了 Qwen3.8-Max 的价位。原来“经济版 vs 旗舰”的对比,现在成了“前旗舰 vs 新旗舰”——价格锚自己往上走了,锚价没动的那个,反而成了价值洼地

但只看单价下结论,错得离谱。Agent 任务不是聊天,一次长程任务——代码仓库级修改、多轮工具调用、文档审阅——输出动辄 10-30 万 token。把第一篇那把尺子套上各家的闲时/非高峰输出单价:每成功任务成本 = 单次尝试 token 消耗 × 单价 ÷ 任务成功率

模型 单次长程任务成本(10-30 万输出 token) 不亏本的成功率门槛
V4-Flash(闲时) 0.45-1.35 元 基准
V4-Pro(闲时) 1.35-4.05 元 成功率需达 Flash 的 3 倍
Qwen3.8-Max 3.6-10.8 元 成功率需达 Flash 的 8 倍
Opus 5 18-54 元 成功率需达 Flash 的 40 倍

门道在门槛的变化上:涨价前,3.8-Max 相对 Flash 的门槛是 18 倍;DeepSeek 这一涨价,门槛直接降到 8 倍,旗舰和经济版的价差,被对手亲手抹掉了一大半。纸面上,3.8-Max 成功率做到 Flash 的 8 倍,每干成一件事才刚刚打平。而这把尺子一旦量到法务审阅、金融工作流、长程编程这些“专业办公”场景,门槛几乎自动失效——经济版在这些场景里经常不是“干得慢”,而是“干不成”。干不成,成本就是无穷大,这种差距根本没法用“倍”来算。

所以我的判断不绕弯:Qwen3.8-Max 是“特种兵”,不是“主食”。不过 DeepSeek 涨价之后,“经济版打底”的底盘也变了:日常问答、内容生成、简单工具调用,继续交给经济模型;单件价值高、搞砸代价大的硬活,才轮到旗舰出场。高频 Agent 团队现在值得重新算一遍“涨价后的经济版打底 + 3.8-Max 攻坚”的组合,价差比两周前小得多。

价目表上还有两处不起眼的小字,外行容易划过去,干计费的一眼就会盯住。

第一处:缓存命中 1.5 元,只有输入价的 1/8。 DeepSeek 新价闲时的折扣是 1/30,千问的 1/8 看着更激进,而且不分峰谷,DeepSeek 高峰时段的缓存命中价是要翻倍的。但我得说句公道话:这 1.5 元对应的是“隐式缓存”——用户什么都不用做,平台自动识别重复上下文。命中率没人能保证,风险全在平台自己肩上。你的 Agent 如果反复带着同一份系统提示词和知识库上门,命中率天然就高;如果流量全是冷启动长文档,这个折扣就当它不存在。下单之前,先估估自己的缓存命中率,这比磨单价有用得多。

第二处:峰谷定价成了行业新常态。 DeepSeek 新价高峰是闲时的 2 倍,千问的 Token Plan 夜间调用 5 折,方向一样,都是削峰填谷的价格信号。第一篇里 DeepSeek 旧价搞高峰翻倍,如今全行业都在跟进。能把批处理任务挪到半夜的团队,旗舰的实际输出单价就是 18 元,一脚踩回 Qwen3.7-Max 的原价位。不会错峰的团队,等于自愿多交一倍税。

API 的账算完,下一本才是这个系列的主场。2.4T 的权重已经躺在 HuggingFace 上,问题就一个:谁部署得起?

三、部署账:2.4T 的三道坎

先给 2.4T 称个体重。权重 8 月 12 日就上了 HuggingFace 和魔搭,下载零门槛,但下载和部署是两回事。MoE 模型的显存账就两本:权重,由总参数决定;KV cache,由上下文和并发决定。

显存项 规模 说明
FP8 权重 ~2.4 TB 2.4T 参数 × 1 字节
FP4 权重 ~1.2 TB 若官方放量化版
KV cache 随并发与上下文膨胀 1M 上下文场景下为 TB 级预留
激活参数 95B / token 决定带宽与互联压力

2.4TB 是什么概念?拿眼下企业私有化的主力 H200(141GB)来比划:光是把 FP8 权重装进去就要 17 张卡,再给 KV cache 和调度留 30% 余量,现实配置就是 4 节点 32 卡起步。折算成钱,按 2026 年中的行情,H200 长租常规价约 6-6.6 万/卡·月,现货机位紧的时候能冲到 8 万以上,下面按偏保守的 8 万/卡估:

口径 配置 成本量级
租赁 32×H200 约 256 万/月,加 15%-20% 隐性成本逼近 300 万/月
采购 32×H200(单卡约 17.5 万)+ 网络存储配套 一次性 700 万级

不过,钱只是第一道坎。第一篇讲过的互联墙、第二篇拆过的效率墙,碰上 2.4T 这个体重,只会更高:

第二道坎,互联墙。 95B 激活参数听着不大,可专家散在几十张卡上,每生成一个 token、每过一层,卡间都得来一次 all-to-all 通信。第二篇拆过:671B 的 V3 在 400G InfiniBand 上,光“送病历”就把每词生成锁死在 15 毫秒。2.4T 专家更多、分布更宽,跨节点通信占比只升不降。没有 NVLink + 高速 RDMA 的整机柜级互联,稀疏激活的红利会被通信原路吃回去。

第三道坎,也是最致命的一道:效率墙。 权重已经到手,但第二篇的结论一个字都不用改——通用框架朴素部署,效率系数 η 只有 0.3 上下,等于同样扛 3 倍的 GPU 成本。开源版默认 262K 上下文,真把 1M 场景跑起来,KV cache 只会比这张表更凶。2.4T 把试错的绝对金额放大了:671B 时代 η 低 10 个点,一个月多亏几十万;到了 2.4T,同样 10 个点,就是多亏上百万。图纸越重,工厂的门槛越高

那到底谁有资格部署?看一眼硬件清单就明白了:300 万/月的租金、整机柜互联、专职推理引擎团队——这是 Token 工厂的配置单,不是企业的配置单。至于昇腾 950 超节点那种 1024 卡、256TB 统一内存的大家伙,本来就是冲着万亿级 MoE 去的——第一篇埋下的“芯模联动”伏笔在这里第二次应验。对了,许可证里还藏着一行小字:拿开源权重做 MaaS,集团任意连续 12 个月合计收入超 5000 万美元要另拿授权。图纸免费,但拿它开大工厂的,阿里要另外谈。

三种角色,可以摊开对号入座了。

四、三种角色,三个决策

和前面一样,不拿月 token 量说事,按角色和月任务量给建议。这张表建议直接截图:

角色 建议方案 月度成本量级 判断依据
个人开发者 API 混用:经济版打底 + 3.8-Max 攻坚;27B 开源版本地玩 < 3,000 元 2.4T 与个人无关;两天后跟进开源的 27B 稠密版才是给个人的礼物,量化后单卡即可跑
中小企业 API 为主,夜间 5 折跑批 + 做高缓存命中率 0.3-3 万元 任何自建方案的折旧都远超 API 账单;旗舰只在高价值任务上出场
企业私有化 仅合规刚需才碰 2.4T;否则私有化 27B / 其他开源中档模型 项目制,百万级起 第四篇说过,合规账不是成本账——但 2.4T 的项目体量比 671B 时代再翻一档
云厂商 Token 工厂 η 做不到 0.7 就别接;接就按整机柜 + 自研 serving 栈规划 300 万/月起 第二篇的死亡螺旋在 2.4T 上只会转得更快

表格之外,还有两件事值得单独说。

先说盯着 27B 的个人和小团队:这次真正改变游戏规则的不是 2.4T,是 8 月 14 日跟进开源的 27B 稠密版。原生多模态,整体水平超过 Qwen3.7-Plus,用 Apache 2.0 放出来;稠密架构意味着没有 MoE 的互联墙,量化后约 17GB 显存就能跑,单卡可部署,数据完全自控——它是“合规 + 低成本”交集里难得的甜点。旗舰开源制造新闻,小模型开源制造生态,阿里这一手是组合拳。

再说云厂商同行:旗舰开源不是机会,是筛选。2T 级权重会让 MaaS 的效率差距以更贵的绝对金额兑现——η 0.3 和 η 0.7 之间,差的是每月近百万的真金白银。第三篇给的优化路径(SGLang、PD 分离、自研算子)一条都不用改,只是入场券更贵了。

三本账过完,还剩一个局内人的问题:阿里图什么? 旗舰 API 明码标价 12/36,转头又把权重免费送出去,这两件事不打架吗?

五、内部视角:旗舰开源,到底在卖什么

这两件事非但不打架,还是同一套账本的左右手。我干计费系统这些年,“双轨发布”见得越多越笃定:API 卖的是变现速度,开源卖的是生态锁定期限

左手,API 加速 Token 变现。 12/36 的定价看似比 DeepSeek 贵了一个数量级,但它锚定的压根不是 DeepSeek,是 Opus 5——“国际价 4 折、能力第一梯队”,这是给企业级专业任务的定价,赚的是“干成一件事值多少钱”的钱,不是“一个 token 值多少钱”的钱。再叠上老一代 5 折清场、夜间 5 折削峰、缓存命中 1.5 元,一套完整的三级价格歧视,把价格敏感型、稳定型、高价值型客户一网打尽。这是计费设计教科书级的操作,我在内部评审会上见过无数次同款。

右手,开源锁定私有化客户。 第四篇拆过:数据主权场景的客户对价格不敏感,合同是项目制的。这批客户过去只有 DeepSeek 系开源旗舰可选,现在多了一个 2.4T 的千问选项。但要注意,选了权重,就得选配套的算力、部署服务和云资源。开源权重是鱼饵,私有化合同和 IaaS 消耗才是鱼。连许可证里都埋着钩子:拿开源权重做 MaaS,集团任意连续 12 个月合计收入超 5000 万美元要另拿授权,大厂早把这一手算进去了。阿里自己的通稿里,那句话已经说得够透了:“API 加速 Token 变现,开源权重锁定企业级私有化部署的长期客户。”

再看总账,还是第四篇那套大厂算法:百炼平台上百余款模型、千问办公 Agent 产品同日推出、美股闻声涨超 5%——MaaS 这一层赚不赚钱不重要,重要的是它把客户钓进了整个云生态。中小厂商没有这本总账可算,所以旗舰开源对你是筛选,不是红利。

再往行业里看一步,我的判断是:Qwen3.8-Max 开源,标志着“旗舰开源”时代的开始。当 2T 俱乐部的模型都走上开源路线,竞争就彻底从“谁的权重更强”转入第四篇讲过的那个战场——谁能把权重变成又便宜又稳定的推理服务,谁才有资格谈护城河。图纸越来越重,工厂越来越贵,这个系列从头讲到尾的就是这件事。

六、结语:图纸送到手,工厂自己建

回到开篇那句话:免费的图纸,不等于便宜的工厂。Qwen3.8-Max 把这个道理推到了新的量级:

  • API 账——别看单价看“每成功任务成本”,旗舰是特种兵不是主食,缓存命中率和夜间错峰才是砍价刀;

  • 部署账——2.4T 的 FP8 体重 2.4TB,32×H200 起步、月租 300 万级,外加互联墙和效率墙,权重已在手,但这是 Token 工厂的入场券;

  • 战略账——API 变现 + 开源锁定,双轨发布是一本总账;旗舰开源对中小厂商是筛选,对个人开发者的真礼物是那个 27B。

建议还是按角色对号入座:个人开发者,API 混用,27B 权重已经上线,直接上手验;企业,经济版打底、旗舰攻坚,合规刚需再谈 2.4T 私有化;云厂商同行,先把 η 的账算到 0.7,再决定接不接这张 2.4T 的图纸。

27B 稠密版上线三天了,很多人都叫它“给个人的礼物”,量化后约 17GB 显存就能跑。但这份礼物真有那么好捡吗?量化到什么精度、跑出多少吞吐、月任务量到多少时自建才开始比 API 便宜,每一项都得拿真金白银验过才算数。

下一篇预告:《27B 本地部署账:这份免费礼物,到底要花多少钱捡?》

关注本系列,下篇继续拆。 觉得有用的话,转发给你身边正在做大模型部署决策的朋友。

本文为「开源大模型部署」系列第五篇。 系列开篇《能力涨6倍,Token烧3倍:V4-Flash正式版的真实账本》确立了“每成功任务成本”这把尺子;第二篇《成本陷阱(上):开源模型的蜜糖,Token工厂的砒霜!》拆了效率系数 η 与 MaaS“死亡螺旋”;第三篇《成本陷阱(中):Token工厂难以直面的投产账》给出六大优化举措;第四篇《成本陷阱(下):Token工厂的三本账》讲了生态、聚合、合规三本账。

文中数据基于 2026 年 8 月 17 日各平台公开信息整理;DeepSeek 新价自当日零时生效(8 月 13 日官宣)。模型定价和硬件行情迭代很快,具体数字请以最新披露为准。欢迎同行交流拍砖

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐