近期AI热点005|Claude Opus 5 发布:长程 Agent 更强之后,成本与验证如何控制

主要信息源:Anthropic 官方发布文章、Claude Opus 5 System Card、Claude Platform 开发者文档
关键词:Claude Opus 5、Anthropic、AI Agent、Agentic Coding、API 接入、Token 成本、模型安全

2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5,并在当天开放 Claude API,模型名为 claude-opus-5

这次更新没有把重点放在“更会聊天”上。Anthropic 对 Opus 5 的定位很明确:让模型在编程、专业知识工作和长时间运行的 Agent 任务中,更愿意检查自己的结果、发现问题后继续迭代,而不是刚得到一个看似合理的答案就结束任务。

价格也提供了一个重要线索。Opus 5 的 API 单价与 Opus 4.8 相同,输入为每百万 Token 5 美元,输出为每百万 Token 25 美元。Anthropic 称,它在部分编程与知识工作评测中接近更高端的 Claude Fable 5,但单位任务成本约为后者的一半。

这并不意味着所有请求都应该迁移到 Opus 5。对开发者来说,更实际的问题是:哪些任务值得使用更强的长程 Agent,怎样用 effort、Token 预算和验证流程把结果控制在可接受范围内?

Opus 5 的变化,主要发生在任务执行过程

大模型完成复杂任务,通常不只需要生成一段答案,而是要经历一条更长的链路:

理解目标
  ↓
搜索文件与资料
  ↓
制定计划
  ↓
调用工具并修改外部状态
  ↓
运行测试或检查结果
  ↓
发现问题后继续修正
  ↓
提交最终结果与证据

链路越长,单步的小错误越容易累积。一个模型即使代码生成能力不错,如果不会主动运行测试、检查边界条件或重新审视假设,也很难稳定完成跨文件重构、数据分析、自动化办公和科研任务。

Anthropic 在发布文章中反复强调 Opus 5 的“验证”和“迭代”能力,并列出三个代表性案例:模型从原始像素中提取几何信息并重建 FreeCAD 零件;定位开源包管理器中的真实缺陷并修复社区补丁遗漏的边界情况;在没有实时数据源可验证时,为交易所行情接入任务自行建立测试工具。

这些案例说明了产品方向,但仍然来自厂商测试和早期客户反馈。它们不能直接证明模型在任意代码库中都能自主完成同类工作。复现环境、工具权限、任务提示、允许尝试次数和验收标准,都会明显改变结果。

官方评测很亮眼,但要先看评测边界

Anthropic 公布的结果覆盖编程、知识工作、计算机操作和科学研究等方向。

评测或场景 Anthropic 公布的结论
Frontier-Bench v0.1 成绩超过其他被测模型,相比 Opus 4.8 提升超过一倍,单位任务成本更低
CursorBench 3.2 在 max effort 下,与 Fable 5 峰值成绩相差不到 0.5%,单位任务成本约为其一半
ARC-AGI 3 成绩约为第二名模型的 3 倍
Zapier AutomationBench 在相同单位任务成本下,通过率约为第二名的 1.5 倍
OSWorld 2.0 在成本—性能曲线上优于其他被测模型,并以略高于三分之一的成本超过 Fable 5 最佳结果

这些数字不适合简单汇总成一个“模型排名”。不同评测测量的是不同能力,而且 Anthropic 也在脚注中说明,Frontier-Bench 结果来自其内部运行环境,每个任务尝试 5 次;当 Opus 5 或 Fable 5 被安全分类器拦截时,评测会回退到 Opus 4.8。

这意味着评测结果包含模型、Agent 框架、尝试策略和回退机制的共同影响。企业在选型时,更有价值的指标通常不是单次最高分,而是下面四项:

  1. 在自己的任务集上,一次成功率和多次尝试后的成功率分别是多少。
  2. 一个成功任务平均消耗多少输入、输出 Token 和工具调用。
  3. 不同运行之间的结果波动有多大。
  4. 失败时能否被测试、规则或人工审查及时发现。

同价升级,不等于任务成本不变

Opus 5 的基础单价与 Opus 4.8 相同:

计费项 API 单价
输入 Token 5 美元 / 100 万 Token
输出 Token 25 美元 / 100 万 Token
Fast 模式 基础价格的 2 倍,官方称速度约为默认模式的 2.5 倍

Agent 任务的成本不能只看单价。模型如果读取更多文件、生成更长的推理与结果、反复调用工具或重新尝试,最终费用仍可能增加。

例如,不考虑缓存、工具和其他平台费用时:

场景 计算 估算费用
5 万输入 + 5000 输出 0.05 × $5 + 0.005 × $25 0.375 美元
20 万输入 + 2 万输出 0.2 × $5 + 0.02 × $25 1.50 美元
上述第二个任务使用 Fast 模式 1.50 × 2 3.00 美元

Fast 模式适合延迟直接影响业务价值的交互场景,例如实时编程协作和高价值工作流。批处理、夜间分析和用户不等待结果的后台任务,通常没有必要为速度统一支付双倍价格。

Anthropic 还提供 effort 设置,让开发者在推理投入、速度和成本之间调整。更稳妥的路由方式是按任务难度分层,而不是让所有请求固定使用最高 effort:

  • 文本改写、字段提取和简单问答,优先交给成本更低的模型。
  • 单文件修改、常规调试和有明确验收条件的任务,可以先用中等推理投入。
  • 跨系统排障、长程代码修改、复杂研究和高价值专业任务,再使用 Opus 5 的高推理配置。
  • 即使任务重要,也要设置 Token、时间、工具调用次数和重试上限。

具体 effort 可用值和请求格式可能随 Claude Platform 更新,生产代码应以调用时的官方文档为准。

最小 API 接入

先在隔离环境中安装 Anthropic Python SDK:

python -m venv .venv
.venv\Scripts\Activate.ps1
python -m pip install --upgrade anthropic
$env:ANTHROPIC_API_KEY="你的 API Key"

一个最小调用示例如下:

from anthropic import Anthropic


client = Anthropic()

message = client.messages.create(
    model="claude-opus-5",
    max_tokens=4096,
    system=(
        "你是代码审查助手。先定位根因,再提出最小修改方案。"
        "没有运行测试或获得可复核证据时,不要声称问题已经解决。"
    ),
    messages=[
        {
            "role": "user",
            "content": "分析这段任务队列代码中的重复执行问题,并列出验证步骤。",
        }
    ],
)

for block in message.content:
    if block.type == "text":
        print(block.text)

print(message.usage)

示例显式设置了 max_tokens,但这只是输出预算。实际 Agent 服务还应在应用层记录输入 Token、输出 Token、工具调用次数、完整耗时、重试次数和最终验收状态。

如果任务允许模型修改代码或调用外部系统,还要把“模型完成”与“业务完成”分开。模型说已经修复,不代表测试通过;模型说邮件已经准备好,也不等于应该直接发送。

长程 Agent 需要四道工程边界

1. 路径和工具白名单

只向 Agent 暴露当前任务需要的目录与工具。代码修改任务通常不需要访问凭据目录、生产数据库或部署密钥;资料分析任务通常也不需要 Shell 和写文件权限。

2. 可执行的验收条件

把“修好问题”改写成可以验证的结果,例如:

先定位重复消费的调用链和现有测试。
只允许修改 src/queue/ 和 tests/queue/。
不得新增依赖,不得提交 Git commit。
修改后运行指定测试,并报告命令、退出码和失败项。
如果无法复现问题,停止修改并说明缺少的证据。

这种提示不会保证模型正确,但能减少任务边界漂移,并让最终结果更容易审查。

3. 外部动作单独确认

写文件、执行测试和读取文档通常可以在隔离环境中自动完成;部署生产、发送邮件、删除数据、付款和修改权限则应保留独立确认。Agent 越擅长连续操作,越不能把所有工具权限一次性打开。

4. 用结果决定是否升级模型

可以让低成本模型先处理任务,只有在测试失败、置信度不足、上下文复杂或需要跨工具规划时再升级到 Opus 5。路由依据应来自任务结果,而不是用户输入里是否出现“复杂”“紧急”等词。

安全改进值得关注,但不能替代权限控制

Anthropic 称,Opus 5 在其自动化行为审计中的“整体不对齐行为”得分为 2.3,是近期 Claude 模型中最低的;同时,模型在生物研究和攻击性网络安全能力上仍落后于 Mythos 5。

官方也为部分网络安全请求设置了额外分类器。与 Fable 5 相比,Opus 5 的分类器预计减少约 85% 的介入,但仍会拦截二进制漏洞扫描、渗透测试和漏洞利用生成等请求。Claude.ai、Claude Code 和 Claude Cowork 中,被标记的请求默认可以回退到 Opus 4.8;API 也新增了自动回退能力。

这里需要区分两件事:模型更少欺骗、更少执行不可逆动作,是发布前评测中的行为信号;应用是否安全,则取决于模型、工具权限、数据边界、回退逻辑和人工确认的共同设计。任何单一安全分数都不能替代应用层控制。

Opus 5 更像一个“高价值任务层”

Opus 5 的核心卖点不是基础单价下降,而是在保持 Opus 4.8 单价的同时,提高长程任务成功率,并通过 effort 和 Fast 模式提供速度、推理投入与成本之间的选择。

如果官方结果能在真实项目中复现,它更适合承担跨文件重构、复杂排障、专业分析、科研辅助和端到端业务自动化,而不是统一替换所有聊天、摘要和分类请求。

后续最值得观察的也不是更多单项榜单,而是三类生产数据:一次成功任务的平均成本、不同运行之间的稳定性,以及模型在较少人工干预下能否持续遵守工具和权限边界。

参考资料

  • Anthropic:Introducing Claude Opus 5,2026-07-24
    https://www.anthropic.com/news/claude-opus-5
  • Anthropic:Claude Opus 5 System Card
    https://www.anthropic.com/claude-opus-5-system-card
  • Claude Platform:Prompting Claude Opus 5
    https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5
  • Claude Platform:Mid-conversation tool changes
    https://platform.claude.com/docs/en/build-with-claude/mid-conversation-system-messages
  • Claude Platform:Automatic fallbacks
    https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback#server-side-fallback
  • Frontier-Bench
    https://www.frontierbench.ai/
  • Artificial Analysis:GDPval-AA
    https://artificialanalysis.ai/evaluations/gdpval-aa
Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐