Kimi K3实测:2.8万亿参数MoE架构,Arena前端编程全球第一(附GPT-5.6对比)

前言

7 月 16 日晚,月之暗面正式发布 Kimi K3——全球首个开源的 3 万亿参数级别模型。上线后即在 Arena 的 Code Arena 榜单拿下全球第一(1679 分),超过 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。

本文基于公开实测数据,从参数架构、性能基准、三场景对比、定价分析四个维度拆解 K3 的真实表现。


一、模型基本信息

属性 详情
参数量 2.8 万亿(MoE 架构,896 个专家,每次激活 16 个)
上下文窗口 100 万 token
多模态 原生视觉理解
开源 完整权重 7 月 27 日前开源,全球最大开源权重模型
上线平台 Kimi 网页端、App、Kimi Work 桌面端、Kimi Code、API
当前版本 默认 max 档深度思考,low/high 档后续更新
License 开源

架构创新

K3 的两个核心技术:

① Kimi Delta Attention(混合线性注意力机制)

让模型处理超长序列时不会被计算量拖死。传统注意力机制的复杂度随序列长度平方增长,Delta Attention 通过线性近似大幅降低长序列的计算开销。

② Attention Residuals(注意力残差)

有选择地跨深度检索信息,不是简单在各层均匀累积。可以理解为模型在不同深度层级之间建立了"信息高速公路",让深层能够直接访问浅层的关键信息。

配合 Stable LatentMoE 框架,官方称整体扩展效率相比 K2 提升约 2.5 倍。


二、性能基准

Arena 榜单成绩

榜单 K3 分数 排名 对比
Code Arena(前端编程) 1679 全球第一 超 Fable 5(1631)、GPT-5.6 Sol(1618)
Artificial Analysis Intelligence Index 57 第三 仅次于 Fable 5 和 GPT-5.6 Sol

Arena 的机制是公开盲测:同一道题交给两个匿名模型,用户实际体验后投票,投完才知道选的是谁。百万级用户参与,品牌影响被削弱。

前端细分领域

在七个前端细分领域中,K3 拿下六个第一,仅在游戏领域落后 Fable 5。

官方展示案例

K3 的长程 Agent 式执行能力大幅提升。以官方展示的 ASIC 行业 42 年研究网站为例:

  • 120+ 轮迭代
  • 2800+ 次网页搜索与抓取
  • 1100+ 次终端数据提取
  • 处理 87 份季度报告和 99 份原始 PDF
  • 最终生成包含定制图表、动画示意图和交互式可视化叙事的研究报告

官方品牌宣传视频也是 K3 自己剪辑的——56 段原始素材,完成选片、卡点、动作匹配和音频处理。


三、三场景实测对比:K3 vs GPT-5.6 Sol

以下数据来自凤凰科技评测,使用同一套提示词分别测试两个模型。

场景一:3D 迷宫游戏

任务:生成第一人称 3D 迷宫游戏,WASD + 鼠标控制,小地图、火炬照明、60 秒倒计时。

维度 GPT-5.6 Sol Kimi K3
生成速度 快,K3 还在加载时已可开始玩 慢,接近 Sol 的 2-3 倍
画面风格 写实常规,火炬和墙面中规中矩 像素风设计感,火炬和墙面纹理更有辨识度
可玩性 合格成品 更高,光线更暗更有氛围
结论 快、稳 慢但好看

场景二:杯子倒水物理仿真

任务:实现杯子装水和倒水的物理仿真,考察数学建模、物理直觉、图形学处理。

维度 GPT-5.6 Sol Kimi K3
第一次结果 装水不穿模,倒水符合物理规律,一次过关 翻车:水粒子穿透杯壁、水从杯底流出
修正后 符合要求,但修正速度也慢
结论 完胜 物理仿真未做到一次到位

场景三:3D 瀑布全景

任务:用 Three.js 创建尼亚加拉大瀑布全景,考察视觉审美和工程能力。

维度 GPT-5.6 Sol Kimi K3
功能完整性 完整,按钮命名忠实还原提示词 完整
视觉效果 “敷衍”——水像白色粒子糊在悬崖上 更精美,水渲染更接近真实瀑布水汽
彩虹(提示词要求) 缺失
耗时 较快 近半小时
结论 功能稳但审美弱 审美胜,但速度慢

三轮总结

  • 要又快又稳的成品 → 选 GPT-5.6 Sol
  • 要视觉上有辨识度的成品 → 选 K3,但需付出 2-3 倍时间成本

四、实测短板

1. 速度慢

同一场景生成时间约为 GPT-5.6 Sol 的 2-3 倍。瀑布场景近半小时,视频剪辑近两小时。

可能原因:

  • 2.8 万亿参数推理计算量大
  • max 档默认开启深度思考
  • 推理基础设施尚未充分扩容

后续开放 low 和 high 档位后可能改善。

2. 物理仿真偶翻车

杯子倒水测试第一次生成存在硬伤(水穿壁、水从底漏)。官方在介绍中特别强调了视觉理解与空间推理的结合提升,但至少在这道题上,物理仿真还没做到一次到位。

3. 简单问题过度发挥

官方坦诚承认:训练偏向长程高难任务,面对简单的日常问题时容易替代用户做决定。

4. 官方承认的三个局限

月之暗面在官方博文中坦诚写了:

  • 对历史思考内容敏感,中途切换模型可能导致输出质量明显下降
  • 训练偏向长程高难任务,面对简单日常问题时容易替代用户做决定
  • 与 Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有差距

五、API 定价分析

模型 输入(/百万 token) 输出(/百万 token)
Kimi K3 ¥20(约 $2.8) ¥100(约 $14)
GPT-5.6 Sol ¥36(约 $5) ¥216(约 $30)
Claude Fable 5 ¥72(约 $10) ¥360(约 $50)

K3 比海外旗舰便宜——输出单价不到 Fable 5 的三分之一。

但对比自家 K2.6:

  • 输入价格涨了 3 倍多
  • 输出价格涨了 近 4 倍

会员等级限制:

会员档位 月费 上下文长度
Andante ¥49 不支持调用
Moderato ¥99 256K
Allegretto ¥199+ 完整 1M

六、总结

K3 的核心价值:证明国产开源模型已经能在盲测中正面击败海外闭源旗舰。Code Arena 全球第一,不是"国产第一"——这俩概念差了一个太平洋。

K3 的核心短板:能力追上了,体验没跟上。速度慢、物理仿真翻车、简单问题过度发挥——这些不是能力问题,是工程化问题。

适用场景推荐

  • 前端编程 / 3D 交互生成 / 视觉设计 → K3 有明显优势
  • 需要快速得到可用成品 → GPT-5.6 Sol 更稳
  • 物理仿真 / 工程可靠性要求高 → 暂时不推荐 K3
  • 简单日常问答 → K3 会过度发挥,性价比不高

月之暗面正在筹备港股 IPO,K3 不只是一次产品更新,更像一次上市前的能力宣示。但 IPO 最终检验的不是榜单成绩,而是 3 亿美元 ARR 能否持续、客户是否留存、推理成本能否控制。


Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐