评测背景

Qwen3.8-Max 于 2026 年 8 月 3 日正式发布,重点面向复杂推理、代码生成、智能体任务与通用能力提升等基准任务。

相比 Qwen3.7-Max,Qwen3.8-Max 在推理、代码、通用和智能体四项一级能力上均有提升,其中推理能力进步最为突出。本次我们基于晓天衡宇大语言模型榜单评测体系,从 Agentic、Coding、General、Reasoning 四个一级维度及 20+ 主流评测集,对 Qwen3.8-Max 进行了系统评测。

这篇解读不只关注 Qwen3.8-Max 的排名,更聚焦以下问题:

  • 与 GPT-5.5(xhigh)、GPT 5.6 Sol(Max)、Claude Fable 5 相比,它的优势和短板分别是什么?

  • 相比 Qwen3.7-Max,其进步主要体现在哪些方面?

榜单概览

点击跳转晓天衡宇评测社区,查看大语言模型 8 月榜单完整结果。

核心结论

结论一:综合得分 67.54,位列总榜第 6,较前代提升 7 个位次

Qwen3.8-Max 综合得分 67.54,在本次参评模型中位列第 6,在本次评测的国产模型中,仅次于 Kimi-K3(68.31),位列第 2。

距离 GPT-5.5(xhigh)仅 0.81 分,距离 Kimi-K3 仅 0.77 分;同时领先 Claude Opus 4.8(+0.15)、Grok 4.5(+1.79)和 Claude Sonnet 5(+2.00)。

在同一期榜单口径下,Qwen3.7-Max位列第13,Qwen3.8-Max较前代高7个位次。

结论二:较 Qwen3.7-Max 提升 3.22 分,四项一级能力全部上升

Qwen3.8-Max 较 Qwen3.7-Max 的综合得分从 64.32 提升至 67.54,增加 3.22 分。

提升并非来自单一维度:Agentic 增加 2.18 分,Coding 和 General 均增加 3.50 分,Reasoning 增加 4.21 分。四项一级能力同步上升,说明其综合能力较前代有明显增强。

结论三:Reasoning 以 78.23 分位列榜单第 3,是最突出的优势项

Reasoning 是 Qwen3.8-Max 能力结构中提升最快、也最靠前的一项,是它的相对优势所在。

Qwen3.8-Max 的 Reasoning 得分为 78.23,在本次榜单中位列第 3,比榜单前二的 Claude Fable 5 和 Claude Opus 5 分别只低 0.06 分、0.68 分。

与此同时,它的 Reasoning 得分高于 GPT 5.6 Sol(Max)(+1.43)、GPT-5.5(xhigh)(+1.73)和 Kimi-K3(+2.28)。

结论四:速度居中等,推理成本明显低于多数高分模型

Qwen3.8-Max 的推理速度为 44 Tokens/s,快于 Kimi-K3(38 Tokens/s),但低于 Claude Fable 5(64)、GPT 5.6 Sol(Max)(68)和 GPT-5.5(xhigh)(78.6),推理速度低于多数同分段高分模型,在该组模型中处于中等偏下水平。

成本方面,Qwen3.8-Max 的 API 价格为 18 元/百万 Tokens,本轮评测实际推理总成本为 14,400 元,约为 Kimi-K3 的 50.8%、Claude Opus 4.8 的 23.5%、GPT-5.5(xhigh)的 17.4%、Claude Fable 5 的 12.1%。

在综合得分接近的模型中,Qwen3.8-Max 以中低价格和相对可控的总成本,提供了接近总榜前列模型的综合能力,成本优势较为明确。

评测体系

本榜单基于智能体、代码、通用、推理四大能力维度进行综合评估,并根据各维度权重计算综合得分。

其中,智能体占比最高,为 35%;代码和推理各占 25%;通用占 15%。

完整评测体系及方法解读可点击查看👉🏻大语言模型榜单评测体系详解

深度解读

Qwen3.8-Max 与高分模型的差距在哪里?

从本次评测结果来看,Qwen3.8-Max 已经进入总榜前六,但它的能力结构并不是全面均衡,总体表现为:Reasoning 突出,Coding 接近部分高分闭源模型,Agentic 持续改善,General 仍有进一步提升空间。

Agentic:较前代提升,与 Kimi-K3 基本接近

Qwen3.8-Max 的 Agentic 得分为 54.66,较自身前代 Qwen3.7-Max 提升 2.18 分,与 Kimi-K3(54.98)仅差 0.32 分,并高于 Claude Opus 4.8(+0.30)、Grok 4.5(+1.55)和 Claude Sonnet 5(+1.90)。

不过与更高分模型相比,仍落后 GPT-5.5(xhigh)2.32 分、Claude Fable 5 2.72 分、GPT 5.6 Sol(Max)2.94 分、Claude Opus 5 4.97 分。

Agentic 是 Qwen3.8-Max 相对薄弱的环节,虽然能力对比前代已有改善,但距离本次榜单排名靠前的模型仍有一定追赶空间。

从二级维度看:

增长主要来自 Seal-Hard,从 29.10 涨到 33.70 ,已逼近榜首 Grok 4.5 的 35.40;

DeepPlanning(Shopping)涨至 54.40,BrowseComp-ZH 涨至 49.79,是Agentic维度中唯一高于 GPT-5.5(xhigh)的评测集;

短板在 TAU3-Bench 与 DeepPlanning:前者 80.74 与前代基本持平,比 Claude Opus 5 的 89.90 低 9 分;

后者虽有提升,仍低于 GPT-5.5(xhigh)的 61.70 和 Opus 5 的 62.60。作为权重最高的维度,这两项是后续最值得补的位置。

Coding:已进入高分梯队,接近 GPT-5.5(xhigh)和 Claude Opus 4.8

Qwen3.8-Max 的 Coding 得分为 73.99,较 Qwen3.7-Max 提升 3.50 分。

它与 Claude Opus 4.8(74.34)仅差 0.35 分,与 GPT-5.5(xhigh)(74.83)相差 0.84 分;同时高于 Grok 4.5(+0.60)、Claude Sonnet 5(+0.93)和 GLM-5.2(+3.23)。不过,Qwen3.8-Max 与 Kimi-K3(-3.68)、Claude Opus 5(-3.89)和 Claude Fable 5(-4.72)仍有明显差距。

从本次评测结果来看,Coding 已进入高分模型竞争区,是 Qwen3.8-Max 的较强能力项,但相较该维度头部模型,尚未形成领先优势。

从二级维度看:

SWE-Multilingual 从 72.88 跃至 88.10,是全部评测集中进步最大的一项;

Livecode-Bench-V6 涨至 94.75,与榜首 GPT-5.5(xhigh)的 95.40 仅差 0.65,已进入头部同一梯队;

短板集中在 ClawEval,74.21 分低于前代的 80.40,也落后 Claude Fable 5 的 85.98,是唯一出现回落的评测集;

SciCode 52.90 涨幅有限,Terminal-Bench-Pro 60.00 低于 Opus 5 的 66.95,两项都还有明显空间。

General:有所进步,但与高分模型仍有差距

Qwen3.8-Max 的 General 得分为 69.03,较 Qwen3.7-Max 的 65.53 提升 3.50 分。

它高于 Claude Sonnet 5(+0.57)、 Seed 2.1 Pro(+1.20)、Claude Opus 4.7(+1.86)和 GLM-5.2(+2.37),但对比 GPT-5.5(xhigh)(-1.44)、Kimi-K3(-2.08)、GPT 5.6 Sol(Max)(-2.23)和 Claude Fable 5(-6.89)仍落后。

可以看出,General 仍是 Qwen3.8-Max 与榜单高分模型拉开差距的主要维度之一。

从二级维度看:

五个子维度同步走高,其中知识增长最快,从 36.20 提到 41.40;

长上下文涨至 90.20、记忆涨至 76.90,指令遵循 84.30 明显高于 GPT-5.5 的 76.00。

短板是幻觉,虽有提升但仍是全篇差距最大的子维度,明显落后 Claude Opus 5;

知识和记忆的绝对分也低于 Claude Fable 5,事实性与长程记忆仍是这个维度的主要弱项。

Reasoning: 位列第 3,超过 GPT-5.5、GPT 5.6 Sol 和 Kimi-K3

Reasoning 是 Qwen3.8-Max 在本次评测中最突出的一级能力。

其得分 78.23,仅次于 Claude Opus 5(78.91)和 Claude Fable 5(78.29),与后者只差 0.06 分;同时超过 GPT 5.6 Sol(Max)(+1.43)、GPT-5.5(xhigh)(+1.73)、Kimi-K3(+2.28)和 Claude Opus 4.8(+2.01)。

与 Qwen3.7-Max 相比,Reasoning 得分从 74.02 提升至 78.23,增加 4.21 分,是四项一级能力中增幅最大的一项。由此来看,Qwen3.8-Max 的代际提升首先体现在更强的推理表现上。

从二级维度看:

场景推理增长最明显,从 47.10 提到 58.50,并小幅超过 Claude Opus 5,位列竞对第一;

数学推理和科学推理同步上行,科学推理达到 92.40,与头部模型的 94 分区间差距已很有限。

短板在逻辑推理,涨幅是四个子维度里最小的,与 Claude Fable 5、Claude Opus 5 仍有 1 到 2 分差距;

科学推理虽绝对分高,但头部模型在此高度密集,排名仅第 10。

效率与成本:能力提升伴随一定速度和消耗代价

推理速度:44 Tokens/s,较 Qwen3.7-Max 有所下调

Qwen3.8-Max 的推理速度为 44 Tokens/s。它快于 Kimi-K3(38 Tokens/s),但低于 Claude Opus 5(55.1)、Claude Fable 5(64)、GPT 5.6 Sol(Max)(68)、GPT-5.5(xhigh)(78.6)和 Grok 4.5(86)。

与 Qwen3.7-Max 的 50.5 Tokens/s 相比,Qwen3.8-Max 下降 6.5 Tokens/s。与前代相比,Qwen3.8-Max 的推理速度下降约 12.9% ,体现出其在能力提升与响应效率之间的权衡。

成本效率:API 价格与前代持平,推理总成本显著低于高分模型

Qwen3.8-Max 的 API 价格为 18 元,与 Qwen3.7-Max 持平。

注:本文中的 API 价格为输入与输出价格按 3:1 加权计算的综合单价,单位为元/百万 Tokens 。

Qwen3.8-Max 的 Token 消耗为 32 MTokens,较 Qwen3.7-Max 的 26 MTokens 增长约 23.1%,能力提升伴随一定消耗增加。

以 32 MTokens 的实测消耗计算,本轮评测实际推理总成本为 14,400 元。

在综合得分相近的模型中,Qwen3.8-Max 的总成本优势明确:仅为 Claude Opus 4.8 的 23.5%(综合分 +0.15)、Kimi-K3 的 50.8%(-0.77)、GPT-5.5(xhigh)的 17.4%(-0.81)、GPT 5.6 Sol(Max)的 20.3%、Claude Fable 5 的 12.1%。

在本次榜单 65 分以上的高分段模型中,Qwen3.8-Max 以显著更低的推理总成本拿到了总榜第 6 的位置。

综合判断

综合本次评测结果,Qwen3.8-Max 位列总榜第 6、国产模型第 2,与 Kimi-K3、GPT-5.5(xhigh)的综合分差均已收至 1 分以内,并超过 Claude Opus 4.8、Grok 4.5、Claude Sonnet 5 等模型。

从能力结构看,Reasoning 和 Coding 是 Qwen3.8-Max 表现相对较强的能力维度;Agentic 和 General 较 Qwen3.7-Max 均有进步,但与更高分模型的分差随不同对象而变化,例如对比 GPT-5.5(xhigh)分差主要来自 Agentic 维度;对比 Kimi-K3 则分差主要来自 Coding 维度,这些维度仍是后续迭代的关键突破口。

从代际升级看,Qwen3.8-Max 对比 Qwen3.7-Max 四项能力全面提升,推理能力提升最显著。

从效率结构看,Qwen3.8-Max 的速度和 Token 消耗虽无明显优势,但 API 价格足够低,在同分段模型中总成本相对可控。在本期榜单综合得分 65 分以上的高分模型中,Qwen3.8-Max 有明显的成本优势。

注:本文结论基于晓天衡宇本期评测体系与样本,反映模型在该评测框架下的相对表现,不代表所有业务场景中的绝对优劣。实际选型仍建议结合具体任务、成本预算与业务验证结果综合判断。

写在最后

最新大语言模型评测榜单已同步上线至晓天衡宇•评测社区官网,欢迎大家访问查看更详细的评测数据

👇关注晓天衡宇•评测社区官方账号,获取更多大模型相关知识~

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐