一、0.6B 凭什么和 8B、20B 同台?

“参数量差两个数量级,直接不用比了”——这是很多人的第一反应。但小思框架(Xiaothink)最新发布的 Xiaothink-T17-RWKV5-MLA-Instruct-Pro(≈0.6B)却在一次 6 领域盲测中和 8B 的 llama、20B 的 gpt-oss 甚至云端旗舰同台竞技,还在指令遵循这个硬指标上拿了全场第一。这篇文章把盲测实录完整摆出来,用数据说话。
模型在线Demo体验(首次进入若跳转到主页请重进链接)

二、盲测是怎么做的?

  • 裁判:DeepSeek-V4-Flash(开启深度思考),负责对照评分
  • 评测领域:6 个 1B 定制中文领域——古诗生成、古诗赏析、前端页面生成、通用知识、指令遵循、长文本处理
  • 题目数量:每个领域 3 题,共 18 题
  • 评分维度:准确性 30% + 关联性 30% + 创造性 40%;页面生成任务改用“样式艺术感 40% + 内容与功能丰富度 40%”
  • 评分方式:把本模型与所有静态模型对同一问题的回答匿名编号,一次性交给裁判对照打分,降低偏见
  • 本模型采样:温度梯度 [0.68, 0.92] 共 2 个梯度点 × 3 次重复 = 每题 6 次对照评分,取最高分;静态模型取平均分
  • 对照模型:Qwen3-0.6B、llama-3-8B-instruct、gpt-oss-20B、DeepSeek-V4-Flash

三、分领域成绩单

领域T17-Instruct-Pro(0.6B)Qwen3-0.6Bllama-3-8Bgpt-oss-20BDeepSeek-V4-Flash
古诗生成74.036.457.443.492.4
古诗赏析67.072.671.671.891.7
前端页面生成25.034.950.167.693.7
通用知识85.069.583.690.687.7
指令遵循90.778.289.780.677.5
长文本处理50.085.076.593.089.6
总体平均65.362.871.574.588.8

四、亮点逐条看

1. 指令遵循 90.7,全场第一。这个领域考的是“会不会听指令”:说输出一句话就一句话、说 30 字内就 30 字内。本模型 90.7 分,超过了 llama-3-8B(89.7)、gpt-oss-20B(80.6)、Qwen3-0.6B(78.2),甚至超过云端 DeepSeek-V4-Flash(77.5)。指令微调带来的格式服从能力,在 0.6B 上体现得相当扎实。

2. 通用知识 85.0,越过 8B。本模型 85.0,比 llama-3-8B 的 83.6 还高,逼近 20B 的 gpt-oss-20B(90.6),而 Qwen3-0.6B 只有 69.5。

3. 古诗生成 74.0,0.6B 级断档领先。Qwen3-0.6B 只有 36.4,差距明显;本模型甚至超过 llama-3-8B(57.4)和 gpt-oss-20B(43.4),仅次于 DeepSeek(92.4)。中文韵律和意象的建模能力是它的强项。

4. 总体 65.3,反超同尺寸 Qwen3-0.6B(62.8)。在同参数量级内做到了更好的中文综合表现。

五、也得实事求是一下

前端页面生成 25.0 是全部模型里最低的——原因很明确:这个模型是在 t17_rwkv5_mla_instruct_frontend 基础上继续微调的,微调重心放在了中文自然语言上,代价就是前端(WF)生成能力相比 frontend 版明显下降。需要前端页面生成请选用 t17_rwkv5_mla_frontend;需要自然语言对话、创作、指令任务,本模型是更合适的选择。这也是一次清晰的“能力再分配”实验。

六、总结

  1. T17-RWKV5-MLA-Instruct-Pro(0.6B) 在 6 领域盲测中总体 65.3,超过同尺寸 Qwen3-0.6B;
  2. 指令遵循 90.7 全场第一、通用知识 85.0 越过 8B、古诗生成 74.0 断档领先同尺寸;
  3. 前端生成 25.0 是微调取舍的代价,选型时按任务场景二选一。

数据来自真实的 DeepSeek-V4-Flash 对照盲测。欢迎交流讨论!

模型下载(ModelScope):Xiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐