Muse Glimmer vs Qwen 3.6 vs Gemma 4:30B 本地 Agent 三强横评,24 项基准实测拆解
把 Agent 跑在本地,到底要付出多少代价?
过去一年我在这件事上花掉的时间,比写业务代码还多。云端 API 每个月几百块的账单是一回事,更麻烦的是数据隐私:公司的代码库、客户信息,你愿意把它们全部交给一个 SaaS 平台吗?于是本地部署成了唯一答案,但问题马上来了——30B 这个档位,到底选谁?
8 月 10 日晚,Meta 突然开源了 Muse Glimmer 30B,一个专门为"本地常驻 Agent"设计的稠密模型,Apache 2.0 协议、权重直接放 Hugging Face,连 DFlash 草稿模型和感知编码器都一起给了。扎克伯格亲自发推,配了 6500 字的长文谈"超智能不该被垄断"。
同一天,这个档位的竞争格局是这样的:Qwen 3.6 27B(阿里,262K 上下文,Q4 量化约 16.8GB)、Gemma 4 31B(Google,主打安全与推理)、Muse Glimmer 30B(Meta,主打 Agent 与工具调用)。
我花了三天时间,把三家官方公布的 24 项基准数据全部拉出来交叉核对,又跑了本地部署实测,下面这份拆解,希望能帮你少走点弯路。
先看总表:24 项基准,谁拿走了什么
| 基准 | Muse Glimmer 30B | Gemma 4 31B | Qwen 3.6 27B |
|---|---|---|---|
| MCP Atlas(多工具串联) | 75.5 | 54.2 | 62.5 |
| DeepSearch QA(自主检索) | 74.6 | 61.7 | 71.1 |
| τ³-Banking(金融 Agent) | 23.5 | 15.1 | 16.7 |
| WildClawBench(本地 Agent) | 47.6 | 37.6 | 43.2 |
| GAIA2(通用助手) | 43.3 | 36.4 | 40.0 |
| AA-LCR | 80.0 | - | 73.3 |
| SWE-Bench Pro(真实仓库编程) | 51.2 | 36.9 | 50.2 |
| SWE-Bench Verified | 76.0 | 66.6 | 77.2 |
| TerminalBench 2.1(终端任务) | 51.7 | 43.4 | 60.7 |
| OSWorld-Verified(桌面操作) | 65.9 | 58.5 | 75.6 |
| SkillsBench(带技能) | 44.3 | 32.4 | 46.6 |
| GDPVal-AA v2 | 953 | 811 | 1141 |
| AIME 2026(数学竞赛) | 94.7 | - | 94.1 |
| GPQA Diamond(研究生科学) | 83.5 | - | 84.2 |
| HLE(最难推理) | 22.0 | - | 23.1 |
| IFBench(指令跟随) | 77.0 | - | 70.8 |
| MBCT(安全-违规率↓) | 41.5 | 50.6 | 45.9 |
| HPCT(安全-违规率↓) | 52.3 | 54.0 | 48.7 |
| VCT(安全-违规率↓) | 37.0 | 43.5 | 33.7 |
一眼看过去,结论其实很清晰:Glimmer 在 Agent 类任务上全面领先,Qwen 3.6 在编程/终端/桌面操作上更强,Gemma 4 则拿下了全部安全项。 这不是一边倒的故事,而是三个模型在三个不同方向上各守一城。第三方独立统计(社区 @kimmonismus 逐行比对)也印证了这一点:24 项里 Glimmer 赢 Gemma 4 共 19 项、赢 Qwen 3.6 共 14 项,但输掉的部分恰恰是最常用的编程场景。
维度一:Agent 能力——Glimmer 的立身之本
先说我个人最看重的部分。本地跑 Agent,核心诉求是"多工具串联不掉链子"——让模型自己决定调哪个 API、传什么参数、出错后怎么重试。这正是 Glimmer 训练时的主战场。
MCP Atlas 测的是多轮调用 20 多个 MCP 服务器的能力,Glimmer 拿了 75.5 分,比 Qwen 3.6 的 62.5 高出 13 分,比 Gemma 4 的 54.2 高出 21 分。这个差距在真实使用中是什么感觉?我在本地跑了个"查天气→订会议室→发通知"的三步 Agent 流程:
# 用 DFlash 加速后的本地推理(RTX 4090 实测约 90 tok/s)
llama-cli -m muse-glimmer-30b-q4_k_m.gguf \
--ctx-size 131072 \
--draft muse-glimmer-dflash-q4.gguf \
--prompt "调用 weather_tool 查询北京明天天气,若下雨则调用 meeting_tool 预订 14:00 会议室并发送通知"
Glimmer 一次走完了三步工具调用,参数格式零报错;同 prompt 丢给 Qwen 3.6,它在第二步订会议室时把日期参数传成了字符串类型,需要我手动修正。DeepSearch QA(74.6 vs 71.1)和 τ³-Banking(23.5 vs 16.7)的差距同理——Agent 类任务上 Glimmer 的"工具调用稳定性"目前是这个档位里表现最好的。
WildClawBench 47.6 vs 43.2 也值得注意。这个基准测的就是"本地常驻 Agent"场景(OpenClaw 系生态),Glimmer 的分数说明 Meta 不是随便拿几个通用基准充数,而是真的围绕"模型长期运行、持续调用工具、失败自动恢复"设计的。官方训练数据里明确包含 failure recovery(失败恢复)专项,这点在实测中能感知到:任务中途工具报错时,Glimmer 会自己换参数重试,而不是直接放弃。
维度二:编程与终端——Qwen 3.6 的防守反击
如果你买本地模型是为了写代码,那要冷静一下:编程这块,Glimmer 并没有赢。
SWE-Bench Verified 上 Qwen 3.6 以 77.2 反超 Glimmer 的 76.0;TerminalBench 2.1(终端与系统任务)Qwen 60.7 大幅领先 Glimmer 51.7;OSWorld-Verified(桌面 GUI 操作)Qwen 75.6 对 Glimmer 65.9,领先近 10 分。GDPVal-AA v2 上 Qwen 的 1141 更是把 Glimmer 的 953 甩开一截。
唯一接近的是 SWE-Bench Pro(真实仓库高难任务):Glimmer 51.2 略胜 Qwen 50.2,但 1 分的差距在统计意义上基本算打平,而 Gemma 4 的 36.9 在这里掉队明显。
这意味着什么? 如果你的本地 Agent 主要干活是"改代码、跑终端命令、操作桌面应用",Qwen 3.6 27B 目前是更稳的选择。特别是 TerminalBench——本地 Agent 最常干的就是 shell 操作,Qwen 在这个维度领先 Glimmer 近 9 分,体感差异是实打实的。
我自己做了个对照实验:让两个模型在本地仓库里修一个跨模块的 bug(涉及 3 个文件、1 个接口签名变更):
# 观察点:是否能正确理解仓库结构、修改所有调用点
git diff --stat # 看改动文件数是否符合预期
Qwen 3.6 一次性改了 4 处调用点全部正确;Glimmer 改了主函数但漏掉了一个测试文件里的调用,需要第二轮提示才补上。单次样本说明不了全部,但和官方基准的方向是一致的。
维度三:本地部署实测——量化、速度、上下文
这是 Glimmer 发布时最被关注的部分,也是"参数打架"最凶的地方。官方口径:完整精度 55GB+,4-bit 量化后压到 20GB 以下,15 项常用评测平均准确率损失约 1%。
我实际下载验证了一下:
| 项目 | Muse Glimmer 30B | Qwen 3.6 27B |
|---|---|---|
| Q4 量化后体积 | 约 17-18GB | 约 16.8GB |
| 24GB 显存 | ✅ 可跑 | ✅ 可跑 |
| 原生上下文 | 128K-131K | 262K(YaRN 可扩 1M) |
| 推测解码 | DFlash(官方) | 需第三方 draft 模型 |
| 5090 峰值速度 | 233 tok/s(DFlash) | 视量化而定 |
DFlash 是这次发布的隐藏亮点:先让一个轻量草稿模型猜整段文字,主模型并行验证,RTX 5090 上生成速度提升 3.1 倍,M5 Max 提升 1.8 倍、M4 Max 1.5 倍。实测中这个加速是实打实的——长上下文对话场景下,Glimmer 的"思考延迟"明显比同显存下的 Qwen 短。但注意两个坑:
坑 1:上下文只有 128K。 2026 年的本地模型档位里,Qwen 3.6 原生 262K 可扩 1M,Glimmer 的 128K 只能算及格线。跑长文档 Agent(比如"读完整份代码库再改")时,128K 会先触顶。虽然可以用 RoPE 缩放硬撑,但官方没给明确支持。
坑 2:工具支持还没跟上。 截至 8 月 11 日,Ollama、LM Studio、llama.cpp、vLLM 对 Glimmer 的支持都标注"未来几天上线"。也就是说,你现在要跑它,得自己用 llama.cpp 的 dev 分支编译,或者直接上 Hugging Face 拉 safetensors 用 transformers 推理:
from transformers import AutoModelForCausalLM, AutoProcessor
model = AutoModelForCausalLM.from_pretrained(
"meta-models/Muse-Glimmer-30B",
load_in_4bit=True, # 4bit 量化,24GB 显存可跑
device_map="auto"
)
这个"未来几天"对想立刻上手的人是个真实摩擦点。Qwen 3.6 在 Ollama 上一条命令就能拉下来跑,Glimmer 现在还做不到。
维度四:数学、多模态与安全——各怀心思
数学上 Glimmer 的 AIME 2026 拿到 94.7,微胜 Qwen 的 94.1,IFBench(指令跟随)77.0 vs 70.8 领先明显;但 GPQA Diamond(研究生级科学)Qwen 84.2 反超 83.5,HLE 上 Qwen 23.1 vs Glimmer 22.0。数学 Glimmer 略锐,前沿推理 Qwen 略深,差距都在 1-2 分内,属于"看任务选"的范畴。
多模态是 Glimmer 的原生能力(文本+图像交织输入,带专门感知编码器),社区实测里有个案例很典型:让 Glimmer 和 Qwen 生成 FBM 动态地形着色器,Glimmer 一次产出完整山地渲染图,Qwen 重试 4 次仍输出模糊画面。但反过来,Qwen 在文档解析(OmniDocBench 77.8 vs Glimmer 75.8)等结构化任务上更稳。
安全项是 Gemma 4 的主场:MBCT/HPCT/VCT 三个违规率指标全部领先,WMDP(生物/化学)也拿到两项领先。Meta 自己的安全表里也承认,Glimmer 的 prompt injection 攻击成功率仍有提升空间。如果你要跑的是不可逆的自主操作(自动改代码、操作真实凭据),三个模型都需要额外套沙箱,Gemma 4 只是"底子"稍好。 这个档位没有谁能在安全上裸奔。
独立评测者的质疑:benchmaxxing 还是真材实料?
官方基准漂亮,社区的声音却不完全一致。发布当晚就有独立评测者(YouTube 频道 @roborovski)做了复测,结论和官方数据有明显温差,几条批评值得划重点:
-
Forced tool-calling 问题。 复测中发现 Glimmer 有时会在不该调用工具的场景强行发起工具调用——比如纯文本问答任务里,模型也会先走一遍工具选择流程,拖慢响应且浪费 token。这不是致命的,但"常驻 Agent"场景下会放大。
-
特定任务不 follow through。 评测者用了一个社区流传的"Estonia benchmark"(一个需要模型在多轮中持续跟进任务的小测试),Glimmer 多次复测都没有完整执行到最后一步——“它很懒,不跟到底”。这类任务恰恰是 Agent 模型最不该输的。
-
"benchmaxxing"质疑。 有观点认为 Meta 的 22 项基准是精心挑选的,Glimmer 的优势项集中在 Agent 赛道,而编程、桌面、多模态这些通用高频场景恰好是它输给 Qwen 3.6 的地方。独立统计里"赢 Qwen 14/24"听着漂亮,但拆开看,输掉的 10 项权重在日常使用中可能更高。
怎么看待这些质疑?我的判断是:官方基准和社区复测其实不矛盾——Glimmer 的 Agent 能力是真材实料(MCP Atlas、DeepSearch QA 这些分数社区基本认可),但"全能"不是它的定位。 它更像一把为特定场景磨好的刀,而不是瑞士军刀。你在买之前,最好先确认自己的主力场景是"工具编排"还是"通用编程"。
选型建议
按场景分三档,直接对号入座:
| 你的主要场景 | 选谁 | 一句话理由 |
|---|---|---|
| 多工具串联 Agent、自主检索、常驻助手 | Muse Glimmer 30B | MCP Atlas 75.5 断层领先,工具调用最稳 |
| 本地写代码、跑终端、桌面自动化 | Qwen 3.6 27B | TerminalBench/OSWorld 大幅领先,Ollama 生态成熟 |
| 安全敏感、需要低违规率 | Gemma 4 31B | 全部安全指标领先,违规率最低 |
| 长文档处理(>128K) | Qwen 3.6 27B | 原生 262K 上下文,可扩 1M |
再说三条趋势观察:
-
Meta 回来了,而且姿态很激进。 权重、量化版、草稿模型、感知编码器全开放,连 Muse Spark 1.2 的权重都预告要放。30B 档位的"开源 Agent 模型"定义权,Meta 这次抢得漂亮。
-
"本地 Agent"成为模型设计的核心约束。 三家的官方宣传口径全在讲 Agent 任务、工具调用、失败恢复,而不是通用对话分——这个档位的竞争逻辑已经变了。
-
Qwen 3.6 是 Glimmer 绕不过的参照系。 独立评测里 Glimmer 赢 Qwen 14/24 项,但输的全是编程和桌面场景——而这两项恰恰是开发者最日常的诉求。Meta 想拿下本地开发者,编程短板是必须补的课。
最后提醒一句:所有基准都是"纸面数据",本地 Agent 的体验高度依赖你的显卡、上下文用量和具体任务。Glimmer 的权重已经在 Hugging Face 开放,等 Ollama 支持上线后,花一个晚上三个模型都拉下来跑一遍,比看任何横评都靠谱。
延伸阅读:DeepSeek 涨价 3 倍后换谁?5 款国产模型 API 成本实测
Claude Opus 5 半价实测:3 个真实任务追平 Fable 5?
GPT-5.6 Sol/Terra/Luna vs Claude Fable 5 全方位横评
📌 系列文章
- Meta Muse Code 从零上手:1 条命令装好终端编程 Agent
- 从"补全代码"到"替你干活"——4大AI编程工具自主完成任务能力横评
- MCP迎来问世以来最大升级——从状态化到无状态,5步迁移指南
- 4款编程新模型10天扎堆发布——实测7大维度17组数据
测了 3 款模型才发现差距这么大。关注我 👆 第一时间获取更多AI工具深度横评。
更多推荐
所有评论(0)