数据周期:2026-04-24 ~ 2026-09-04 | 案例模型:DeepSeek V4、GLM-5.3、Qwen3.8-Max 系列续篇:上一篇《AI 编码半年没质变?强项在涨,短板在露》聊的是能力怎么变,这篇往回退一步,问能力从哪来。

9 月 2 日,Qwen3.8-Max-0902 登上了 Arena 真人盲评榜 Code Arena: WebDev 的榜首。这不是一个新模型——qwen3.8-max 八月三日就发布了,当时排第四,落后 Claude Opus 5 Max 大约 37 分。一个月后,同一个模型,一个参数没加,1691 分反超 Opus 5(1688 分),还顺手把价格摆上台面:Opus 一百万 token 混合计价 20 美元,它 5 美元,还站在了同价位段的帕累托前沿上。

阿里的解释是:针对编码和长程智能体任务做了一轮定向强化学习(据 TechTimes 报道)。翻译成大白话:后训练。

这个剧本我们见过。7 月 31 日,DeepSeek V4-Flash 正式版上线,官方更新日志原话是"模型结构、尺寸和预览版保持一致,仅重新进行了后训练"——就这一句"仅重新后训练",智能指数从 40 拉到 50。8 月 13 日,V4-Pro 正式版上线,架构不动,智能体基准全线大涨。8 月 14 日,智谱发布 GLM-5.3,官方说得更直白:"全部能力提升都来自后训练 Scaling"。9 月 2 日,千问跟上。

四个模型,同一个动作,四份成绩单。这不是巧合,是行业在换挡。这篇就聊聊:后训练到底是什么,为什么它这半年突然这么能打,以及——它的边界在哪。

一、模型的一生,分两段

先把概念掰开。一个大模型的诞生分两步,两步干的事完全不同。

第一步,预训练。 拿几万亿 token 的网页、代码、书籍,让模型做一件事:预测下一个词。这一步过后,模型什么都"读过"——全世界的开源代码、技术文档、论坛吵架帖都在它的参数里。但它只是读过,不一定会干。你让它修一个 bug,它可能给你背一段教科书,然后半路把文件删了。

第二步,后训练。 基座冻结之后的一切加工。早期是指令微调和人类反馈强化学习,教模型"好好说话、别答非所问"。这两年的主角换成了 RLVR——可验证奖励的强化学习:把模型扔进海量真实任务里反复跑,环境自动判卷,测试通过给分,漏洞复现成功给分,命令跑挂扣分。模型在犯错、挨罚、重试里,学会把一件事从头办到尾。

打个比方:预训练是上学,后训练是上岗培训。上学攒知识,上岗练的是"接到活怎么把它干完"。

二、四份成绩单

模型

动了什么

代表性结果

口径

V4-Flash-0731(7/31)

仅重做后训练

智能指数 40→50;DeepSWE 7.3→54.4

第三方独立评测

V4-Pro-0813(8/13)

架构不动

DeepSWE 12.8→62.7;Terminal-Bench 72.1→87.9

社区流出,未进官方日志

GLM-5.3(8/14)

同基座,零新参数

编程能力 +50%;DeepSWE 46.2→66.9

官方自报

Qwen3.8-Max-0902(9/2)

同模型快照

Code Arena 1669→1691,登顶

真人盲评

四份单子里,含金量最高的是两头:DeepSeek 那格"40→50"是第三方评测机构 Artificial Analysis 的独立复评,Qwen 那格是真人在 Arena 上盲投出来的——不经过任何厂商自报,模型的实际表现说话。中间两格是官方口径,看看趋势就好,等独立复现。

有意思的是各家暴涨的项目:DeepSWE、Terminal-Bench、CyberGym、Code Arena——全是写代码、跑终端、挖漏洞、做网页这一类。没有一家宣称后训练让模型诗写得更好了。这不是疏忽,是线索。

三、为什么效果这么好

我认为是三层原因,一层比一层硬。

第一层:考试终于对齐了。 预训练的考题是"预测下一个词",人类想要的考试是"把活干完",中间隔着一条鸿沟。模型学会了世界的知识,但没人教它把知识组织成行动:什么时候读代码,什么时候调工具,报错了往哪回退,长任务里怎么不丢目标。后训练直接把训练目标对准"干成事"本身。同一个学生,以前天天考奥赛,现在直接练上岗——练什么,出什么成绩。

第二层:代码是天然的完美考场。 强化学习有个死穴:奖励从哪来?对话、写作、审美这类任务,判卷靠人,贵且慢,没法规模化。代码不一样:测试能不能跑通、漏洞能不能复现、任务能不能端到端交付,全是机器自动出分的客观信号。出题机器(任务环境)和批卷机器(验证器)一齐,练习量就不再稀缺,可以无限刷。回头看四个案例的暴涨项,清一色落在可验证领域——魔法边界就在"机器能不能自动判卷"这条线上。

第三层:军备重心从数据搬到了环境。 预训练时代拼语料,后训练时代拼"任务环境"。智谱官方说得很实在,GLM-5.3 的提升来自三样:数十倍的长程任务环境、更丰富的环境类型、更长的训练时间。而为了让这些环境跑得起,GLM-5.3 的技术家底里躺着推理加速框架 IndexShare——在 30B 实验模型上砍掉 75% 的索引计算,推理提速近一倍——和异步强化学习框架 Slime。这些技术不直接增加智能,但决定了模型能在同样的算力里经历多少、多长的任务。环境即数据,这是这轮竞赛的新护城河。这条路线研究侧早有铺垫:Reasoning Gym 把"出题机器+批卷机器"做成了程序化环境库,100 多个可验证环境难度可调、可以无限刷;更新的 Terminal-Universe 走得更远,从 agent 的历史轨迹里逆向重建出 3.7 万个可执行环境,还给出一个关键消融——在重建环境里让模型重新解题,效果好过直接模仿原始轨迹。环境比轨迹值钱。

还有一笔账:预训练一轮要几个月、亿美元级投入;后训练单位能力提升的成本低得多。智谱创始人唐杰在业绩会上说得很坦白——这是权衡边际收益后的主动选择,"参数规模并非 Scaling 的唯一变量",资源现在向后训练倾斜。

四、两个流行说法,各对一半

聊到模型提升,最常见的说法是两条:参数越大越博学;后训练越极致,某个领域越厉害。两句各对一半,拆开看。

"参数越大自然越博学"——对了一半。 准确的说法是:参数决定博学的上限,数据决定你摸没摸到上限。容量再大,语料不够多不够好,照样装不满。经典证据是 Chinchilla:同样的算力预算,700 亿参数的模型配 4 倍数据,打赢了 2800 亿参数的大模型——后者不是输在脑容量,是输在没吃饱。顺带一提,"参数"这个词本身也在变模糊:V4 Pro 总参数 1.6 万亿,每次推理只激活 490 亿。比"多大"更关键的是"多厚地用"。

"训练越极致,某个领域越厉害"——偏差更大。 RLVR 这条路练的不是某个领域的知识,是"把已有知识组织成行动"的通用能力。两个证据:其一,GLM-5.3 只在编程上做强化学习,结果网络安全能力"意外涌现",CyberGym 从 77.2% 涨到 84.5%,压过了 GPT-5.6 Sol——如果后训练只是往脑子里灌领域知识,不该跨域长出新东西。其二,Artificial Analysis 对 V4-Flash-0731 的独立评测显示,准确率一格没动(37%),幻觉率降了 11 个百分点(95%→84%)——知识没变,行为变了。它没变博学,是变靠谱了。

研究侧也有对应:两篇 RLVR 机制论文(Beyond the 80/20、OPSA)从不同路径得出同一个结论——RL 训练几乎不动承载知识的 token,增益全部集中在少数高熵"分叉点"上。前者只对约 20% 的高熵 token 施加梯度,成绩反而比全量训练更高;后者更彻底,拆掉蒸馏的 teacher、只压制低概率 token,性能不降反升。后训练动的不是知识,是行为。

所以更准的图景是:预训练决定"知道什么",后训练决定"会做什么"。 而"会做"是通用的——拆任务、调工具、看报错、失败回退,这套"办事学"在代码、网安、智能体上是同一套功夫,所以才会跨域迁移。真正"往一个领域猛灌"是早年期微调的玩法,代价是一处灌狠了别处退化,那是老路线的问题,不是现在的主流。

再补两条常被漏掉的轴:架构效率——IndexShare 没加一个参数就把推理提速近一倍,它是后训练烧得起的前提;推理时算力——DeepSeek 的 low/high/max 思考档位、各家测试时多算几步的策略,同一副参数,当场多想十分钟,分数就不一样。

所以完整的画面不是两条路,是四层:参数乘以数据决定矿有多深,后训练决定能挖出多少,架构效率决定挖矿成本,推理时算力决定当场使多大力。四层之间的关系是上下游,不是平行选项——后训练的天花板由基座决定,知识不在基座里,后训练变不出博学。基座挖井,后训练装抽水机;井里没水,抽水机再好也白搭。

五、泼半盆冷水

"效果这么好"这个前提,值得拆一下,不然容易变成新神话。

有几项提升是变谨慎,谈不上变聪明。 幻觉率 95%→84%,但准确率 37% 纹丝不动——模型只是少编了,知识没多。矿还是那个矿,是挖得干净了。

红利集中在可验证领域。 代码、智能体、网安暴涨;写作、审美、开放问答没有对应暴涨。RLVR 的魔法出不了"机器能自动判卷"这个圈。这个圈的边界研究侧也看得见:RLSVR 想把可验证奖励扩到开放任务,办法是把任务先改造成"机器能判卷"的形状——圈子在扩大,但每一步都得先过这道门。圈内也未必稳,Reasoning Gym 测出过"难度悬崖":任务难度上一档,成绩断崖式下跌,最狠的掉幅超过 70%。

还有一个心照不宣的可能。 预览版本来就是后训练没做满的版本,"preview 到正式版的暴涨"里,或许有一部分只是口径差——这一条没有官方证据,纯属合理怀疑,但 DeepSeek 两次跳变的时间线跟它对得上。

头部玩家自己承认了极限。 唐杰的原话:后训练做到极致之后,下一个阶段的增长必须回到基座模型——智谱下一代基座已在推进。市场也已经在问"智谱是不是只会后训练",这个质疑本身,说明风向开始转了。

六、结尾

这轮后训练竞赛里,全行业疯狂挖矿,是因为年初那批基座(DeepSeek V4、GLM-5 基座、Qwen3.8)矿脉确实好,而后训练的工程化刚刚成熟。挖到边际收益递减那天,大家还是会回去造更大的钻机。

对普通人来说,更实际的变化是发布节奏:同一个基座连出多版,带日期后缀的"快照"成了主流命名。模型正在从"一个大版本"变成"一项持续更新的服务",榜单竞争从年度战争变成月度竞赛。这个节奏在发稿时现场上演了一次:9 月 2 日 Qwen3.8-Max-0902 登顶,9 月 4 日截取 Arena 实时榜时,Anthropic 的 Fable 5.1 Max 已经以 1765 分把榜首抢了回去,0902 落到第二(1688 分),对 Opus 5 Max 的领先缩水到 1 分。从登顶公告到王座易主,不超过 48 小时。上个月你还领先的模型,这个月——不,这两天——就可能被反超,这大概就是"后训练时代"最直观的体感。


参考资料

  1. DeepSeek 官方更新日志:https://api-docs.deepseek.com/zh-cn/updates

  2. Artificial Analysis 对 V4-Flash-0731 的独立评测(知乎转载):https://zhuanlan.zhihu.com/p/2067219668155347201

  3. DeepSeek V4 Pro 正式版发布(CSDN 社区转载):https://deepseek.csdn.net/6a805c2210ee7a33f29b65ef.html

  4. 智谱发布 GLM-5.3(网易):https://www.163.com/dy/article/L4CP0LK40556OXHR.html

  5. 智谱业绩会回应"只会后训练"质疑(搜狐·每日经济新闻):https://timeline.sohu.com/news/S8oNitws1R

  6. GLM-5.3 后训练技术解析(知乎):https://zhuanlan.zhihu.com/p/2072048332042670756

  7. Qwen3.8-Max-0902 登顶 Code Arena(TechTimes):https://www.techtimes.com/articles/326373/20260902/qwen38-max-0902-beats-claude-opus-5-coding-china-law-still-owns-every-call.htm

  8. Arena.ai 官方公告(X):https://x.com/arena/status/2094974637704913198

  9. DeepSeek V4 Pro 正式版上线(IT之家):https://www.ithome.com/0/989/423.htm

  10. DeepSeek V4 Pro 正式版深夜突袭(华尔街见闻):https://wallstreetcn.com/articles/3779306

论文佐证

  1. Beyond the 80/20 Rule: High-Entropy Minority Tokens Drive Effective RL for LLM Reasoning(NeurIPS 2025,RLVR 机制:增益集中在高熵 token):https://arxiv.org/abs/2506.01939

  2. Does On-Policy Distillation Really Distill? From Noisy Teacher to Self-Improvement(OPSA,on-policy 蒸馏实质是压制低概率 token):https://arxiv.org/abs/2608.31046

  3. REASONING GYM: Reasoning Environments for RL with Verifiable Rewards(NeurIPS 2025 Spotlight,程序化可验证环境库与跨域迁移实验):https://arxiv.org/abs/2505.24760

  4. Terminal-Universe: Turning Agent Trajectories into Scalable Terminal Environments(轨迹重建 3.7 万可执行环境,环境重解优于轨迹模仿):https://arxiv.org/abs/2609.04148

  5. From RLVR to RLSVR: Task Transformation Induces Self-Verifiable Rewards(开放任务的可验证奖励扩展):https://arxiv.org/abs/2607.23802

  6. ProRL: Prolonged Reinforcement Learning Expands Reasoning Boundaries(延长 RL 可发现基础模型采样不到的新策略):https://arxiv.org/abs/2505.24864

  7. Knowing When Not to Reuse: Conditional Experience Transfer in Autonomous LLM Post-Training(BCIT,阿里云,后训练经验复用的条件与风险):https://arxiv.org/abs/2608.26730

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐