0.6B 硬刚 8B/20B!Xiaothink-T17-RWKV5-MLA-Instruct-Pro 六领域盲测实录:指令遵循 90.7 全场第一
一、0.6B 凭什么和 8B、20B 同台?
“参数量差两个数量级,直接不用比了”——这是很多人的第一反应。但小思框架(Xiaothink)最新发布的 Xiaothink-T17-RWKV5-MLA-Instruct-Pro(≈0.6B)却在一次 6 领域盲测中和 8B 的 llama、20B 的 gpt-oss 甚至云端旗舰同台竞技,还在指令遵循这个硬指标上拿了全场第一。这篇文章把盲测实录完整摆出来,用数据说话。
模型在线Demo体验(首次进入若跳转到主页请重进链接)
二、盲测是怎么做的?
- 裁判:DeepSeek-V4-Flash(开启深度思考),负责对照评分
- 评测领域:6 个 1B 定制中文领域——古诗生成、古诗赏析、前端页面生成、通用知识、指令遵循、长文本处理
- 题目数量:每个领域 3 题,共 18 题
- 评分维度:准确性 30% + 关联性 30% + 创造性 40%;页面生成任务改用“样式艺术感 40% + 内容与功能丰富度 40%”
- 评分方式:把本模型与所有静态模型对同一问题的回答匿名编号,一次性交给裁判对照打分,降低偏见
- 本模型采样:温度梯度 [0.68, 0.92] 共 2 个梯度点 × 3 次重复 = 每题 6 次对照评分,取最高分;静态模型取平均分
- 对照模型:Qwen3-0.6B、llama-3-8B-instruct、gpt-oss-20B、DeepSeek-V4-Flash
三、分领域成绩单
| 领域 | T17-Instruct-Pro(0.6B) | Qwen3-0.6B | llama-3-8B | gpt-oss-20B | DeepSeek-V4-Flash |
|---|---|---|---|---|---|
| 古诗生成 | 74.0 | 36.4 | 57.4 | 43.4 | 92.4 |
| 古诗赏析 | 67.0 | 72.6 | 71.6 | 71.8 | 91.7 |
| 前端页面生成 | 25.0 | 34.9 | 50.1 | 67.6 | 93.7 |
| 通用知识 | 85.0 | 69.5 | 83.6 | 90.6 | 87.7 |
| 指令遵循 | 90.7 | 78.2 | 89.7 | 80.6 | 77.5 |
| 长文本处理 | 50.0 | 85.0 | 76.5 | 93.0 | 89.6 |
| 总体平均 | 65.3 | 62.8 | 71.5 | 74.5 | 88.8 |
四、亮点逐条看
1. 指令遵循 90.7,全场第一。这个领域考的是“会不会听指令”:说输出一句话就一句话、说 30 字内就 30 字内。本模型 90.7 分,超过了 llama-3-8B(89.7)、gpt-oss-20B(80.6)、Qwen3-0.6B(78.2),甚至超过云端 DeepSeek-V4-Flash(77.5)。指令微调带来的格式服从能力,在 0.6B 上体现得相当扎实。
2. 通用知识 85.0,越过 8B。本模型 85.0,比 llama-3-8B 的 83.6 还高,逼近 20B 的 gpt-oss-20B(90.6),而 Qwen3-0.6B 只有 69.5。
3. 古诗生成 74.0,0.6B 级断档领先。Qwen3-0.6B 只有 36.4,差距明显;本模型甚至超过 llama-3-8B(57.4)和 gpt-oss-20B(43.4),仅次于 DeepSeek(92.4)。中文韵律和意象的建模能力是它的强项。
4. 总体 65.3,反超同尺寸 Qwen3-0.6B(62.8)。在同参数量级内做到了更好的中文综合表现。
五、也得实事求是一下
前端页面生成 25.0 是全部模型里最低的——原因很明确:这个模型是在 t17_rwkv5_mla_instruct_frontend 基础上继续微调的,微调重心放在了中文自然语言上,代价就是前端(WF)生成能力相比 frontend 版明显下降。需要前端页面生成请选用 t17_rwkv5_mla_frontend;需要自然语言对话、创作、指令任务,本模型是更合适的选择。这也是一次清晰的“能力再分配”实验。
六、总结
- T17-RWKV5-MLA-Instruct-Pro(0.6B) 在 6 领域盲测中总体 65.3,超过同尺寸 Qwen3-0.6B;
- 指令遵循 90.7 全场第一、通用知识 85.0 越过 8B、古诗生成 74.0 断档领先同尺寸;
- 前端生成 25.0 是微调取舍的代价,选型时按任务场景二选一。
数据来自真实的 DeepSeek-V4-Flash 对照盲测。欢迎交流讨论!
模型下载(ModelScope):Xiaothink-T17-RWKV5-MLA-0.6B-Instruct-Pro
更多推荐


所有评论(0)