深度 | DeepSeek V4 上国芯 120 天:Day-0 名单时代结束,国产算力进入「验收季」
DeepSeek V4 上国芯 120 天:Day-0 名单时代结束,国产算力进入「验收季」
核心观点:V4 上国芯四个月,三个新信号把竞争的考场换了——950DT 提前上云、MiniMax H3 复制 Day-0、国测首次给 AI 训推芯片发准生证。适配名单不再值钱,接下来考的是运行质量与现金流。
证据等级:[A] 官方/一手 [B] 2+可靠来源 [C] 单一来源 [D] 个人判断

一、上期的判断,要被三个新证据往前推
8 月 14 日的深研我给 V4 上国芯定过三个判断:推理侧国产化走通了、训练侧没有、分水岭在产能。四个月过去,方向没变,但三个新证据把赛道本身换了。
供给端:昇腾 950DT 原本规划 Q4 量产,现在提前到 8 月上线华为云,昇腾 384 超节点商用部署超过 750 套,DeepSeek 拿到 1.6 万张 950 卡 [B]。生态端:8 月 3 日 MiniMax H3 开源,当天十家国产芯片厂商 Day-0 适配 [B]。标准端:5 月 26 日国测首次单独设立「人工智能训练推理芯片」品类,昇腾 310/910、平头哥真武、壁仞 166、海光 DCU-3G、天数智芯、沐曦 MXC600、摩尔线程 PH100,9 款国产芯片过 I 级 [A]。
三个信号叠起来就一句话:Day-0 名单不再值钱。名单决定能不能进门,接下来考的是跑得好不好、赚不赚钱。
二、四个月后,「跑得怎么样」有了答案
V4 靠 CSA+HCA 压缩注意力把单 token 推理算力压到 V3.2 的 27%、KV 缓存压到 10%,1.6T 参数的 V4-Pro 才可能在国产 NPU 上部署 [B]。这层「省」是适配的技术前提。
实测水位:910C 推理约为 H100 的 60%,910B 在 batch=8 时约为 H100 的 68%、功耗约 55%;华为口径超节点自测 V4-Pro 约 4700 tok/s。关键在这些数字全部是厂商自测——120 天过去,任何独立机构都还没放出昇腾的非自报 benchmark。英伟达的每个数字能被 Phoronix 独立复现,昇腾的数字只能靠信任,这条沟比算力差距更深。
训练侧也清楚了。华为联合哈工大(深圳)用 1000 颗 910C 完成了 V4-Pro 的全参数后训练(SFT,即用现成数据做微调,不是从零预训练),算力利用率 MFU >30% [B]。但 DeepSeek 官方措辞是「在 NVIDIA GPU 与华为昇腾 NPU 上同时验证」——验证不是替换,多个来源确认预训练仍主要跑在英伟达 H800/H100 上 [B]。
还有个常被忽略的事实:V4 用 mxFP4 存权重、显存减半,但 FP4 存储不等于 FP4 计算,现役硬件矩阵乘仍是 FP8/BF16,FP4 的算力红利这代吃不到 [B]。
软件侧的账更难看。CANN 宣称 95% CUDA 接口兼容,表层替换已趟出成熟路径;但 V4 的动态稀疏注意力算子在 CANN 原生算子库里不存在,深度耦合 warp 调度的代码转换后要么编译失败要么运行时崩溃——两套执行模型的差距,翻译工具处理不了。

上图:四个月后国产算力跑 V4 的技术水位——推理侧有自测数字、训练侧只有后训练实证、预训练仍在英伟达,全链条缺独立第三方基准。
三、Day-0 从「荣誉」变成「门槛」
MiniMax H3 的十家 Day-0 先证伪了「V4 是一次性政治动作」——国产芯片软件生态在真实变好。但同一事实的背面是:适配名单正在通货膨胀。当十家都能 Day-0,首发适配只是参赛资格。
国测把这事制度化。9 款过 I 级,政企采购 AI 算力有了硬性及格线;信创 2027 收官倒逼 2026 年集中招标 [B]。对采购方,入围是入场券;对芯片厂商,入围只是起跑线——下一轮竞争发生在入围之后:被真实采购、被稳定部署、被续约、现金流转正。
| 厂商 | Day-0 | 训练能力 | 运行质量信号 | 现金流信号 |
|---|---|---|---|---|
| 华为昇腾 | V4+H3 双 Day-0 | 1000 卡 SFT 实证 | 950DT 8 月上云、超节点 750+ 套 | 未上市 |
| 寒武纪 | vLLM Day-0 开源 | 弱 | H1 营收 +108% | 存货 82 亿、现金流 3.11 亿 |
| 海光 | Day-0 | 全 FP16 训练 | DTK 即取即用 | 数据可见 |
| 摩尔线程 | V4+H3 Day-0 | 弱 | 原生 FP8 | 港股 IPO 推进 |
| GPU 四小龙 | Day-0 | 弱 | 无锚点模型 | 依赖融资 |
最扎眼的一行是寒武纪:营收净利双高增长,但 82.48 亿存货超过半年营收、经营现金流仅 3.11 亿、同比 -65.8%,市值从高位回落至 7000 亿一线 [A]。存货可以解释为锁产能的备货,但能不能在 H2 转成收入,是叙事的验票点。还有个细节:燧原始终没出现在任何已适配名单里 [D]。

上图:2026 年国芯跑千亿模型的关键节点——适配正从「新闻」变成「流程」。
四、政策给门槛,资本给验票
政策端三股力量合流:国测把国产化变成采购条款,信创 2027 收官倒逼 2026 集中招标,政治局 4 月 28 日把算力网列入「六张网」、相关投入预估超 7 万亿 [B]。需求侧,阿里、字节、腾讯为 V4 云服务提前向华为下数十万颗订单,芯片涨价约 20%。落地案例从适配声明变成私有化部署:中国银联、国泰海通、6 家券商、中铝全在昇腾生态内——国产算力第一波真实业务落地,是华为一家的独舞 [B]。
三道天花板没有松动:中芯 N+2 产能缺口约 40%、HBM 缺口约 160 万颗、先进封装国产化率低于 10% [B]。950DT 提前上云提前的是产品节奏,不是产能。
资本端开始验票。寒武纪是第一张冷数据;DeepSeek 6 月完成首轮融资约 510 亿元、估值近 4000 亿元,7 月曝出乌兰察布 1GW 智算中心计划但芯片方案未定 [C]。1GW 相比美国动辄 3-5GW 的项目还差一个数量级。DeepSeek 拿 1.6 万张 950 卡、建智算中心、融资——它比任何券商都更早用真金白银为国产算力投票,但投票投的是昇腾。

上图:政策、标准、需求合流成传导链——门槛决定订单,订单落到交付,现金流决定下一轮扩张。
五、四个玩家分别要面对什么
对模型厂商:国产适配从可选项变必修课,但成本是真的——V4 迁移昇腾重写 200+ CUDA 算子、10 万+ 精度一致性测试、约 30 人年 [B]。MiniMax H3 能复制 Day-0,是因为 V4 把路蹚出来了。
对芯片厂商:名单时代结束。真正的洗牌在采购、部署、续约、现金流四个环节。华为靠产能和软件栈领先,寒武纪用现金流风险换订单规模,GPU 四小龙拿不到锚点模型就可能看不到规模化收入。
对采购方:国测是及格线,及格线不等于竞争力。私有化部署要一起验收模型能力、芯片吞吐、软件栈支持。对投资者:高估值和现金流的剪刀差是最大的雷,寒武纪的存货能不能在 H2 转成收入,是国产算力叙事继续的验票点。
六、我的判断
我判断,120 天前「Day-0 破壁」叙事战的输赢不重要了,重要的是竞争的考场换了。从 2026 H2 开始,国产算力不再考「谁上了名单」,考「谁的卡跑得稳、谁的账转得正」。
三个具体判断。其一,2026 H2 会有一批验收式采购落地,但第一轮交付之后才是真正的考验:故障率、模型更新时的再适配速度、软硬件的长期绑定。其二,训练侧全栈国产化最早 2027——950DT 超节点 Q4 才上量,960 超节点要等 2027 Q4,在此之前任何「国产训练替代英伟达」的说法都把 SFT 当成了预训练。其三,国测是双刃剑——发准生证的同时把淘汰机制制度化,连续两轮被客户弃用比不入围更致命。
我需要三个数据才敢给这轮叙事定调:寒武纪 H2 存货去化速度、950DT 的真实出货量(不是「上线」的话术)、有没有独立机构放出昇腾的非自报 benchmark。在那之前,「全面替代」和「全是泡沫」都只是立场。先不下结论。
参考来源(部分)
- Yicai Global:China’s DeepSeek Unveils New AI Model Using Huawei Chips
- Yahoo Tech:Huawei-led team post-trains DeepSeek’s 1.6T model on 1,000 Ascend 910C chips
- 星岛日报:内地首将 AI 训练推理晶片纳国测,9 款齐入围
- 新浪财经:寒武纪市值退守7000亿,82亿存货与算力平衡木
- 雷锋网:DeepSeek V4 首发适配背后——昇腾为什么坚持不做 CUDA 兼容层
- arXiv 2607.08215:昇腾非 GPU 加速器大模型推理限制实地研究
AI 辅助深度研究,人工视角解读。 每日更新。
更多推荐


所有评论(0)