推理速度战:OpenAI×Cerebras 750 token/s 之后,本地与云端谁更快?
过去两周,AI 圈的头条从「谁模型更大」悄悄变成了「谁推理更快」。近日,Gemini 3.7 Flash 半价、DeepSeek V4 Pro 上线、Qwen3.8-27B 开源、OpenAI 与 Cerebras 推出 Ultrafast 推理档、智谱 GLM-5.3 发布——这五件事指向同一个信号:推理速度正在和模型能力脱钩,成为独立的竞争维度。对企业开发者来说,这意味着选模型时只看 benchmark 分数已经不够,还得算 token 成本、首 token 延迟和端到端 wall-clock。
本文把这三天的公开信息拼成一张「速度地图」,并给出可直接套用的选型检查清单。
为什么速度突然成了主角?
2026 年之前的模型竞争,基本是「榜单分数 + 参数规模」。但当 Agent、代码助手、长文档处理进入生产环境后,真正决定体验的是:
- 多轮交互延迟:一次对话动辄十几个 tool-call,每轮慢 200ms,整体就是数秒。
- 长上下文成本:1M token 上下文如果输出慢,实时性直接归零。
- 端到端 wall-clock:HLE(Humanity Last Exam)这类 2500 题基准,模型再聪明,跑 78 小时也等于不可用。
8 月 15 日 Cerebras 与 OpenAI 公布的 Ultrafast 档,正是踩中了这一痛点:同样答完 HLE 全部题目,Sol Ultrafast 耗时 11 小时 11 分钟,而 Claude Fable 5 需要 78 小时 27 分钟——将近 7 倍差距(来源:Cerebras 厂商自报基准,待第三方复现)。
云端:OpenAI×Cerebras 把输出速度推到 750 token/s
8 月 15 日,OpenAI 与 Cerebras 宣布推出 Ultrafast Mode,首批面向 OpenAI API 的部分客户开放。Cerebras 公布的性能数据如下:
| 对比项 | Sol Ultrafast | Opus 4.8 Fast | Claude Fable 5 |
|---|---|---|---|
| 相对输出速度(Cerebras 自报) | 1×(基准) | 约 0.20× | 约 0.09× |
| 描述 | 峰值 750 token/s | 约慢 5× | 约慢 11× |
| HLE 2500 题 wall-clock | 11h11m | — | 78h27m |
说明:上表数据来自 Cerebras 官方博客/新闻稿转述(malpass.co、ai0.news),属于厂商自报,尚未看到第三方独立复现;不同模型参数量、推理硬件不同,不能简单等价于「模型质量排名」。

图1:云端大模型推理速度倍率对比。Sol Ultrafast 以 Cerebras 厂商自报为基准;横评模型与硬件不同,仅对比速度量级。
对开发者而言,Ultrafast 的意义不是「替代思考型模型」,而是把已验证质量的高能力模型加速到可交互。下面是一段示意调用(字段请以 OpenAI/Cerebras 官方文档为准):
import openai
client = openai.OpenAI()
stream = client.chat.completions.create(
model="gpt-5.6-sol",
# service_tier 字段名为示意,发布前请确认官方文档
service_tier="ultrafast",
messages=[{"role": "user", "content": "用 Python 写一段并查集模板"}],
stream=True,
)
for chunk in stream:
print(chunk.choices[0].delta.content, end="")
本地:Qwen3.8-27B 在消费级显卡跑出约 138 token/s
云端卷速度的同时,本地也没有闲着。8 月 14 日阿里开源 Qwen3.8-27B(Apache 2.0),主打一个「能跑在家用显卡上」:
- 参数规模:27B 稠密模型,原生多模态。
- 上下文:262K 原生,YaRN 可外推到 1M token。
- 本地速度:社区用户报告称在 RTX 5090 上使用 ninfer 推理引擎可达约 138 token/s,约为朴素 llama.cpp 的两倍(来源:ai0.news 转述 HN 社区实测)。

图2:同一模型本地推理:引擎优化约 2× 提速(Qwen3.8-27B,RTX 5090;社区数据,受批大小与量化影响)。
这里的关键不是「27B 比 700B 快」,而是推理引擎优化正在把同样权重的速度天花板抬高。对需要端侧/私有部署的场景(金融、医疗、代码审查),这意味着本地模型的可用性从「能用」迈向「好用」。
一段示意本地运行命令(tag 与引擎名称请以官方为准):
# 示意:等待官方/Ollama 等引擎上架该 tag 后即可尝试
ollama run qwen3.8:27b
# 或使用 ninfer 等优化引擎
ninfer serve Qwen/Qwen3.8-27B
开源侧同频:GLM-5.3 与 Kog 的快信号
速度战不是中美两端的故事。同一天,智谱发布 GLM-5.3:
- 总参数 7430 亿,底座不变、后训练硬拉约 50% 性能。
- Terminal Bench 3.0、Agents' Last Exam (CLI) 等公开基准取得开源第一(来源:智谱官方/界面新闻转述)。
- 完整权重将在两周内开源。
- 同时,智谱在 cvd.z.ai 用 GLM-5.3 做自动化漏洞扫描,已有若干 CVE 处于 embargo 阶段。
另一边,法国初创公司 Kog 宣称在现有 MI300X/H200 硬件上实现 30× 推理加速,2B 小模型 demo 跑出 3000 token/s(来源:ai0.news 转述)。这一数字目前仅见单一社区源,建议标记为「待独立验证」。
速度战与价格战同频
过去 72 小时,速度和价格像双螺旋一样交替下降:

图3:2026-08-13 ~ 08-15 速度与价格相关关键节点时间线(事件日期来自公开报道)。
几个值得留意的价格信号:
- Gemini 3.7 Flash(8/13):API 价格直接减半,同时 FrontierCode 1.1 Main 从 34.4% 提升到 43.6%。
- DeepSeek V4 Pro(8/14):硅基流动平台缓存命中后低至 $0.44 / 百万 token,配合 1M 上下文,对长文档 Agent 极具吸引力。
- Qwen3.8-27B(8/14):Apache 2.0 开源,免费可商用,把消费级部署成本打到「电费级」。
- OpenAI×Cerebras Ultrafast(8/15):按 Cerebras 说法「不牺牲质量」,即用同等质量换 wall-clock。
当「更快」和「更便宜」同时发生时,企业采购模型时的单一 benchmark 决策模型就会失效。
选型建议:速度、成本、质量三角
面对这一波变局,建议把选型拆成四步过滤:
- 任务契约:如果是单次创意写作,首 token 延迟 2s 也能接受;如果是代码补全或 Agent 多轮,200ms 就卡手。
- 端到端成本:不要只看 $/M token,要乘实际输出长度和并发量。缓存命中价(如 DeepSeek $0.44)对长上下文往往是决定性因素。
- 可控性/合规:医疗、金融、政企客户优先考虑本地/私有部署(Qwen/GLM 开源权重)。
- 速度天花板:高并发场景关注服务商的峰值吞吐(如 Cerebras Ultrafast 750 token/s);本地场景关注引擎优化(ninfer/llama.cpp/vLLM 的差距可达 2× 以上)。
一句话:先锁任务,再算成本,最后才是 benchmark 分数。
诚实的局限
本文的数据全部来自公开报道与社区转述,主要限制包括:
- Cerebras 的 750 token/s、11×/5× 倍率、HLE 11h11m 均属于厂商自报,尚未检索到第三方独立复现。
- Qwen3.8-27B 的 138 token/s 是社区实测,受批大小、量化精度、驱动版本影响较大。
- Kog 的 30× 加速与 3000 token/s 目前仅见 ai0.news 单一转述,建议等官方技术报告或独立评测。
- 速度提升不等于体验提升:ai0.news 同日报道指出,部分开发者认为 Claude Opus 5 虽然更快,但存在「不确认假设、输出风格怪异」等问题,已回退到 4.7/4.8。
- 价格为厂商披露口径,含税、配额、peak/off-peak 策略可能差异巨大。
参考与事实来源
- malpass.co: Top AI Stories - August 15, 2026(Cerebras Ultrafast、Gemini 3.7 Flash、DeepSeek Harness、Mistral OCR 4.1、Google HEIR)。
- ai0.news: AI News - August 15, 2026(Qwen3.8-27B 138 tok/s、GLM-5.3、Opus 5 反馈、Kog 30× 宣称、Apple-Alibaba 中国模型)。
- aistart.ai: AI News(OpenAI 400 亿美元年化营收、Anthropic 多 Agent 冲突实验、Google 水印设置)。
- 163.com / 界面新闻 / 央广网 / 今日头条:Qwen3.8-27B 开源、GLM-5.3 发布、DeepSeek V4 Pro 上线、华强北 AI 眼镜销量。
- 环球网 / 国家超算互联网:DeepSeek V4 Pro 与 DeepSeek Harness 上线。
更多推荐


所有评论(0)