结论:截至 2026 年 7 月 20 日,GPT‑5.6 没有传统意义上的同行评审论文或 arXiv 论文。最接近“论文”的官方技术材料是 7 月 9 日发布的 GPT‑5.6 System Card PDF,另有网页版和包含完整性能表的发布说明

GPT‑5.6 Sol 对 Claude Fable 5 的直接差距:

  • Agents’ Last Exam:52.7% vs 40.5%,领先 12.2 个百分点。
  • Coding Agent Index:80.0 vs 77.2,领先 2.8 分。
  • Terminal-Bench 2.1:88.8% vs 83.1%,领先 5.7 个百分点。
  • GPQA Diamond:94.6% vs 92.6%,领先 2.0 个百分点。

但 Sol 并非全面获胜。Fable 5 在 SWE‑Bench Pro 上为 80.0%,明显高于 Sol 的 64.6%;它还在 GDPval‑AA v2、Artificial Analysis Intelligence Index、FrontierMath Tier 4 和 Toolathlon 上分别领先 Sol。因此,偏长周期智能体、终端和综合专业工作时 Sol 更强;如果工作负载高度贴近 SWE‑Bench Pro,Fable 仍有明显优势。

API 价格

以下按短上下文标准价,单位为美元/百万 Token。“示例成本”是许多短请求累计 100 万输入 + 20 万输出,即 输入价 + 0.2 × 输出价,不包含工具调用和缓存。

模型输入 / 输出示例成本相对 Fable
GPT‑5.6 Sol$5 / $30$11.00低 45%
GPT‑5.6 Terra$2.50 / $15$5.50低 72.5%
GPT‑5.6 Luna$1 / $6$2.20低 89%
Claude Fable 5$10 / $50$20.00基准
Claude Opus 4.8$5 / $25$10.00低 50%
Claude Sonnet 5$3 / $15$6.00低 70%
Gemini 3.1 Pro ≤200K$2 / $12$4.40低 78%
GPT‑5.5$5 / $30$11.00低 45%

长上下文价格会更高:GPT‑5.6 Sol/Terra/Luna 分别为 $10/$45$5/$22.50$2/$9;Gemini 3.1 Pro 超过 200K 提示时为 $4/$18

综合来看:

  • 追求最高综合能力:GPT‑5.6 Sol。
  • 性价比最好:GPT‑5.6 Terra——在图中四项测试均略高于 Fable,但示例成本只有 Fable 的 27.5%。
  • 大规模、预算敏感:GPT‑5.6 Luna。
  • SWE‑Bench Pro 类的软件工程任务:值得同时实测 Fable 5。

价格与模型信息来源:OpenAI API 定价Claude 模型与定价Fable 5 发布说明Gemini API 定价。直接对比表主要由 OpenAI 发布,不应当作完全独立的第三方排名;实际采购前最好用自己的任务集复测。

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐