gpt5.6与claude fable等模型对比
·
结论:截至 2026 年 7 月 20 日,GPT‑5.6 没有传统意义上的同行评审论文或 arXiv 论文。最接近“论文”的官方技术材料是 7 月 9 日发布的 GPT‑5.6 System Card PDF,另有网页版和包含完整性能表的发布说明。
GPT‑5.6 Sol 对 Claude Fable 5 的直接差距:
- Agents’ Last Exam:52.7% vs 40.5%,领先 12.2 个百分点。
- Coding Agent Index:80.0 vs 77.2,领先 2.8 分。
- Terminal-Bench 2.1:88.8% vs 83.1%,领先 5.7 个百分点。
- GPQA Diamond:94.6% vs 92.6%,领先 2.0 个百分点。

但 Sol 并非全面获胜。Fable 5 在 SWE‑Bench Pro 上为 80.0%,明显高于 Sol 的 64.6%;它还在 GDPval‑AA v2、Artificial Analysis Intelligence Index、FrontierMath Tier 4 和 Toolathlon 上分别领先 Sol。因此,偏长周期智能体、终端和综合专业工作时 Sol 更强;如果工作负载高度贴近 SWE‑Bench Pro,Fable 仍有明显优势。
API 价格
以下按短上下文标准价,单位为美元/百万 Token。“示例成本”是许多短请求累计 100 万输入 + 20 万输出,即 输入价 + 0.2 × 输出价,不包含工具调用和缓存。
| 模型 | 输入 / 输出 | 示例成本 | 相对 Fable |
|---|---|---|---|
| GPT‑5.6 Sol | $5 / $30 | $11.00 | 低 45% |
| GPT‑5.6 Terra | $2.50 / $15 | $5.50 | 低 72.5% |
| GPT‑5.6 Luna | $1 / $6 | $2.20 | 低 89% |
| Claude Fable 5 | $10 / $50 | $20.00 | 基准 |
| Claude Opus 4.8 | $5 / $25 | $10.00 | 低 50% |
| Claude Sonnet 5 | $3 / $15 | $6.00 | 低 70% |
| Gemini 3.1 Pro ≤200K | $2 / $12 | $4.40 | 低 78% |
| GPT‑5.5 | $5 / $30 | $11.00 | 低 45% |
长上下文价格会更高:GPT‑5.6 Sol/Terra/Luna 分别为 $10/$45、$5/$22.50、$2/$9;Gemini 3.1 Pro 超过 200K 提示时为 $4/$18。
综合来看:
- 追求最高综合能力:GPT‑5.6 Sol。
- 性价比最好:GPT‑5.6 Terra——在图中四项测试均略高于 Fable,但示例成本只有 Fable 的 27.5%。
- 大规模、预算敏感:GPT‑5.6 Luna。
- SWE‑Bench Pro 类的软件工程任务:值得同时实测 Fable 5。
价格与模型信息来源:OpenAI API 定价、Claude 模型与定价、Fable 5 发布说明、Gemini API 定价。直接对比表主要由 OpenAI 发布,不应当作完全独立的第三方排名;实际采购前最好用自己的任务集复测。
更多推荐


所有评论(0)