Kimi K3实测:2.8万亿参数MoE架构,Arena前端编程全球第一
Kimi K3实测:2.8万亿参数MoE架构,Arena前端编程全球第一(附GPT-5.6对比)
前言
7 月 16 日晚,月之暗面正式发布 Kimi K3——全球首个开源的 3 万亿参数级别模型。上线后即在 Arena 的 Code Arena 榜单拿下全球第一(1679 分),超过 Claude Fable 5(1631 分)和 GPT-5.6 Sol(1618 分)。
本文基于公开实测数据,从参数架构、性能基准、三场景对比、定价分析四个维度拆解 K3 的真实表现。
一、模型基本信息
| 属性 | 详情 |
|---|---|
| 参数量 | 2.8 万亿(MoE 架构,896 个专家,每次激活 16 个) |
| 上下文窗口 | 100 万 token |
| 多模态 | 原生视觉理解 |
| 开源 | 完整权重 7 月 27 日前开源,全球最大开源权重模型 |
| 上线平台 | Kimi 网页端、App、Kimi Work 桌面端、Kimi Code、API |
| 当前版本 | 默认 max 档深度思考,low/high 档后续更新 |
| License | 开源 |
架构创新
K3 的两个核心技术:
① Kimi Delta Attention(混合线性注意力机制)
让模型处理超长序列时不会被计算量拖死。传统注意力机制的复杂度随序列长度平方增长,Delta Attention 通过线性近似大幅降低长序列的计算开销。
② Attention Residuals(注意力残差)
有选择地跨深度检索信息,不是简单在各层均匀累积。可以理解为模型在不同深度层级之间建立了"信息高速公路",让深层能够直接访问浅层的关键信息。
配合 Stable LatentMoE 框架,官方称整体扩展效率相比 K2 提升约 2.5 倍。
二、性能基准
Arena 榜单成绩
| 榜单 | K3 分数 | 排名 | 对比 |
|---|---|---|---|
| Code Arena(前端编程) | 1679 | 全球第一 | 超 Fable 5(1631)、GPT-5.6 Sol(1618) |
| Artificial Analysis Intelligence Index | 57 | 第三 | 仅次于 Fable 5 和 GPT-5.6 Sol |
Arena 的机制是公开盲测:同一道题交给两个匿名模型,用户实际体验后投票,投完才知道选的是谁。百万级用户参与,品牌影响被削弱。
前端细分领域
在七个前端细分领域中,K3 拿下六个第一,仅在游戏领域落后 Fable 5。
官方展示案例
K3 的长程 Agent 式执行能力大幅提升。以官方展示的 ASIC 行业 42 年研究网站为例:
- 120+ 轮迭代
- 2800+ 次网页搜索与抓取
- 1100+ 次终端数据提取
- 处理 87 份季度报告和 99 份原始 PDF
- 最终生成包含定制图表、动画示意图和交互式可视化叙事的研究报告
官方品牌宣传视频也是 K3 自己剪辑的——56 段原始素材,完成选片、卡点、动作匹配和音频处理。
三、三场景实测对比:K3 vs GPT-5.6 Sol
以下数据来自凤凰科技评测,使用同一套提示词分别测试两个模型。
场景一:3D 迷宫游戏
任务:生成第一人称 3D 迷宫游戏,WASD + 鼠标控制,小地图、火炬照明、60 秒倒计时。
| 维度 | GPT-5.6 Sol | Kimi K3 |
|---|---|---|
| 生成速度 | 快,K3 还在加载时已可开始玩 | 慢,接近 Sol 的 2-3 倍 |
| 画面风格 | 写实常规,火炬和墙面中规中矩 | 像素风设计感,火炬和墙面纹理更有辨识度 |
| 可玩性 | 合格成品 | 更高,光线更暗更有氛围 |
| 结论 | 快、稳 | 慢但好看 |
场景二:杯子倒水物理仿真
任务:实现杯子装水和倒水的物理仿真,考察数学建模、物理直觉、图形学处理。
| 维度 | GPT-5.6 Sol | Kimi K3 |
|---|---|---|
| 第一次结果 | 装水不穿模,倒水符合物理规律,一次过关 | 翻车:水粒子穿透杯壁、水从杯底流出 |
| 修正后 | — | 符合要求,但修正速度也慢 |
| 结论 | 完胜 | 物理仿真未做到一次到位 |
场景三:3D 瀑布全景
任务:用 Three.js 创建尼亚加拉大瀑布全景,考察视觉审美和工程能力。
| 维度 | GPT-5.6 Sol | Kimi K3 |
|---|---|---|
| 功能完整性 | 完整,按钮命名忠实还原提示词 | 完整 |
| 视觉效果 | “敷衍”——水像白色粒子糊在悬崖上 | 更精美,水渲染更接近真实瀑布水汽 |
| 彩虹(提示词要求) | 缺失 | 有 |
| 耗时 | 较快 | 近半小时 |
| 结论 | 功能稳但审美弱 | 审美胜,但速度慢 |
三轮总结
- 要又快又稳的成品 → 选 GPT-5.6 Sol
- 要视觉上有辨识度的成品 → 选 K3,但需付出 2-3 倍时间成本
四、实测短板
1. 速度慢
同一场景生成时间约为 GPT-5.6 Sol 的 2-3 倍。瀑布场景近半小时,视频剪辑近两小时。
可能原因:
- 2.8 万亿参数推理计算量大
- max 档默认开启深度思考
- 推理基础设施尚未充分扩容
后续开放 low 和 high 档位后可能改善。
2. 物理仿真偶翻车
杯子倒水测试第一次生成存在硬伤(水穿壁、水从底漏)。官方在介绍中特别强调了视觉理解与空间推理的结合提升,但至少在这道题上,物理仿真还没做到一次到位。
3. 简单问题过度发挥
官方坦诚承认:训练偏向长程高难任务,面对简单的日常问题时容易替代用户做决定。
4. 官方承认的三个局限
月之暗面在官方博文中坦诚写了:
- 对历史思考内容敏感,中途切换模型可能导致输出质量明显下降
- 训练偏向长程高难任务,面对简单日常问题时容易替代用户做决定
- 与 Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有差距
五、API 定价分析
| 模型 | 输入(/百万 token) | 输出(/百万 token) |
|---|---|---|
| Kimi K3 | ¥20(约 $2.8) | ¥100(约 $14) |
| GPT-5.6 Sol | ¥36(约 $5) | ¥216(约 $30) |
| Claude Fable 5 | ¥72(约 $10) | ¥360(约 $50) |
K3 比海外旗舰便宜——输出单价不到 Fable 5 的三分之一。
但对比自家 K2.6:
- 输入价格涨了 3 倍多
- 输出价格涨了 近 4 倍
会员等级限制:
| 会员档位 | 月费 | 上下文长度 |
|---|---|---|
| Andante | ¥49 | 不支持调用 |
| Moderato | ¥99 | 256K |
| Allegretto | ¥199+ | 完整 1M |
六、总结
K3 的核心价值:证明国产开源模型已经能在盲测中正面击败海外闭源旗舰。Code Arena 全球第一,不是"国产第一"——这俩概念差了一个太平洋。
K3 的核心短板:能力追上了,体验没跟上。速度慢、物理仿真翻车、简单问题过度发挥——这些不是能力问题,是工程化问题。
适用场景推荐:
- 前端编程 / 3D 交互生成 / 视觉设计 → K3 有明显优势
- 需要快速得到可用成品 → GPT-5.6 Sol 更稳
- 物理仿真 / 工程可靠性要求高 → 暂时不推荐 K3
- 简单日常问答 → K3 会过度发挥,性价比不高
月之暗面正在筹备港股 IPO,K3 不只是一次产品更新,更像一次上市前的能力宣示。但 IPO 最终检验的不是榜单成绩,而是 3 亿美元 ARR 能否持续、客户是否留存、推理成本能否控制。
更多推荐



所有评论(0)