这篇文章是对当前开源/开放权重领域的三个国产万亿级(或准万亿级)稀疏混合专家模型(MoE)—— Kimi K3、DeepSeek V4 Pro 和 GLM-5.2 进行了横向对比。三者均具备 100 万的超长上下文窗口,但在模型参数、综合性能、开源许可和算力成本上面各具特色:
Moonshot AI 的 Kimi K3DeepSeek V4 Pro 和智谱 AI 的 GLM-5.2 都是稀疏混合专家 (MoE) 模型,拥有百万级上下文窗口。它们都面向长周期编码和智能体工作负载。
本文将从人工智能团队实际决策的三个维度对它们进行比较:可衡量的能力、许可条款和服务成本。“万亿参数”适用于 Kimi K3 (2.8T) 和 DeepSeek V4 Pro (1.6T)。GLM-5.2 总参数量为 744B,是三者中参数总量最小的。它之所以能占据一席之地,是因为在 K3 发布之前,它一直是轻量级芯片领域的佼佼者。


要点总结

  • Kimi K3 在人工智能分析智能指数中领先(约 57 分,总排名第 3),但直到 7 月 27 日仍仅提供 API 版本。
  • DeepSeek V4 Pro 是成本最低的:按标价计算,每项任务约 0.04 美元,每美元可产出约 115 万个 Token。
  • GLM-5.2 (744B) 是目前最小但速度最快(~168 Token/秒)且可自托管的 MIT 平台。
  • 这三家公司都提供 100 万 Token 上下文;目前只有 DeepSeek 和 GLM 提供开放权重。
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述
    在这里插入图片描述

数据来源:Moonshot AI、DeepSeek、智谱 AI、人工智能分析(已于2026年7月18日验证)。各厂商的基准测试数据使用不同的测试平台。• Marktechpost

三位竞争者

Kimi K3 是一个拥有 2.8 万亿个参数的稳定 LatentMoE 模型,每个 Token 激活 896 个专家中的 16 个。Moonshot 尚未公布确切的激活参数数量。K3 增加了原生视觉、100 万个 Token 的上下文窗口以及始终开启的推理功能。Moonshot 称其为首个开源的 3T 级模型。我们的发布报道在此处

DeepSeek V4 Pro 是一个拥有 1.6 万亿个参数的 MoE(多维数据集),其中包含 490 亿个活动参数,使用 384 个路由专家和一个共享专家。它拥有 100 万个 Token 的上下文窗口,最大输出为 38.4 万。较小的 V4 Flash 版本(总容量 284B,活动参数 130B)适用于成本较低的工作负载。权重信息请参见 Hugging Face

GLM-5.2 是一个拥有 7440 亿参数的 MoE 模型,其中约有 400 亿个活跃参数,上下文窗口大小为 100 万个 Token。智谱自带高推理模式和最大推理模式,并提供 API 接口。

规格 Kimi K3 DeepSeek V4 Pro GLM-5.2
总参数 2.8T 1.6T 744B(人工分析为 753B)
活动参数 未公开(16/896 位专家) 49B 约400亿
上下文窗口 100万 1M(最大输出 384K) 1M(最大输出 131K)
模态 文字 + 视觉 + 视频 文本 文本
发布时间 2026年7月16日 2026年4月24日 2026年6月13日

基准

厂商报告的评分使用不同的测试平台,因此各实验室的基准测试结果很少完全一致。中立的比较基准是 人工智能分析指数(Artificial Analysis Index) ,它使用同一套测试平台对这三款软件进行评分。

在该指数中, Kimi K3 得分约为 57 分 ,DeepSeek V4 Pro(Max 推理)得分为 44 分,GLM-5.2 得分为 51 分。K3 总体排名第三,仅次于 Claude Fable 5 和 GPT-5.6 Sol,与 Opus 4.8 和 GPT-5.5 相当。在 K3 发布之前,GLM-5.2 一直占据着开源人工智能领域的榜首位置。

编码基准测试的结果也类似,但也有一些例外。Moonshot 自己的测试表使用相同的测试环境运行 K3 和 GLM-5.2。结果显示,在所有共享的基准测试中,K3 都大幅领先于 GLM-5.2。

基准测试(月之暗面测试集) Kimi K3 GLM-5.2
DeepSWE 67.5 46.2
程序台 (ProcBench) 77.8 63.7
终端工作台 2.1 88.3 82.7
FrontierSWE 81.2 67.3
瑞典马拉松 (SWE-Marathon) 42.0 13.0
自动化测试台 30.8 12.9
GPQA-钻石 93.5 91.2

DeepSeek 并未出现在 Moonshot 的表格中,因此其数据来自单独的测试。 DeepSeek-V4-Pro-Max 在 SWE-bench Verified 测试中得分 80.6% ,是发布时开源软件的最高得分,与 Gemini 3.1 Pro 并列。它在 MRCR 1M 测试中也获得了 83.5 分,证实了其强大的长上下文处理能力。GLM-5.2 在 SWE-bench Pro 测试中得分 62.1 ,略高于 GPT-5.5 的 58.6 分。

因此,就实际性能而言,K3 是三者中最强的。DeepSeek V4 Pro 在独立编码任务方面具有竞争力。GLM-5.2 落后于 K3,但仍然是一款性能不错的开源软件。

许可

这三款模型均以开放权重模型的形式发售,但如今的实际应用情况却有所不同。

DeepSeek V4 Pro 采用 MIT 许可 ,自发布之日起便在 Hugging Face 上提供权重。 GLM-5.2 也采用 MIT 许可 ,在 zai-org 组织下,Hugging Face 上也提供完整的权重。两者现在都允许不受限制的商业用途、微调和自托管。

Kimi K3 是个例外。Moonshot 承诺在 2026 年 7 月 27 日前发布权重数据,预计将采用修改后的 MIT 许可协议。在此之前,K3 只能通过 API 和 Kimi 应用使用。Moonshot 最近修改后的 MIT 许可协议增加了一条归属条款,该条款仅在月活跃用户超过 1 亿时生效。

服务成本

API 列表定价将这些模式区分开来。

模型 输入(美元/M token) 输出(美元/M token) 缓存输入
Kimi K3 3.00 15.00 0.30
DeepSeek V4 Pro 0.435 0.87 约0.0036
GLM-5.2 1.40 4.40 0.26

DeepSeek V4 Pro 的价格优势非常明显。按标价计算,1 美元大约可以购买 115 万个 V4 Pro Token,22.7 万个 GLM-5.2 Token,以及 6.7 万个 K3 Token。

Artificial Analysis 对所有模型的定价均基于 7:2:1 的混合缓存/输入/输出比例,从而消除了厂商的定价差异。在此基础上,K3 的价格为每百万 Token 2.31 美元,GLM-5.2 为 0.90 美元,DeepSeek V4 Pro 为 0.18 美元。同一来源报告称,按任务计算, K3 为 0.94 美元,GLM-5.2 为 0.32 美元,DeepSeek V4 Pro 为 0.04 美元

速度方面也存在差异。Artificial Analysis 测得 GLM-5.2 的速度约为 168 个 Token/秒 ,远超 DeepSeek V4 Pro 和 Kimi K3 的 62 个 Token/秒左右。Moonshot 报告称,在编码工作负载中,缓存命中率超过 90%,这使得 K3 的有效输入成本降至每百万 0.30 美元。

自托管则面临不同的限制。GLM-5.2 的 744B 运算能力在 BF16 中需要超过 1TB 的显存,大约相当于 8 倍 FP8 的 H200 的显存容量。DeepSeek V4 Pro 的 1.6T 运算能力则需要更多显存。Kimi K3 的硬件占用最高:Moonshot 建议使用 64 个或更多加速器,这使得大多数团队无法实现本地部署。K3 使用 MXFP4 权重,并激活 MXFP8 以支持更广泛的硬件。


在这里插入图片描述
在这里插入图片描述
在这里插入图片描述

数据已于2026年7月18日验证 · Moonshot AI、DeepSeek、智谱AI、人工智能分析 • Marktechpost

哪种模型适用于哪种工作

如果想要以最低的 Token 成本获得高质量的代码,DeepSeek V4 Pro 无疑是最佳选择。它的权重数据可以下载,许可证清晰透明,而且输出价格低于竞争对手。

就测量能力而言,Kimi K3 领先,但其输出价格是 GLM-5.2 的 5 到 17 倍,而且要到 7 月 27 日才能下载重量数据。GLM-5.2 则介于两者之间:比 K3 便宜,比两个竞争对手都快,现在就可以自托管,而且其性能比其体积所暗示的要强。

如果您计划根据验证深度和许可清晰度进行选择,那么现在推荐 DeepSeek 和 GLM。而追求最高基准测试分数的买家,则应等待 K3 权重发布或支付 API 溢价。

原文内容:kimi-k3-vs-deepseek-v4-pro-vs-glm-5-2-open-trillion-scale-moe-models-compared-on-benchmarks-license-and-serving-cost

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐