近期AI热点005|Claude Opus 5 发布:长程 Agent 更强之后,成本与验证如何控制
近期AI热点005|Claude Opus 5 发布:长程 Agent 更强之后,成本与验证如何控制
主要信息源:Anthropic 官方发布文章、Claude Opus 5 System Card、Claude Platform 开发者文档
关键词:Claude Opus 5、Anthropic、AI Agent、Agentic Coding、API 接入、Token 成本、模型安全
2026 年 7 月 24 日,Anthropic 发布 Claude Opus 5,并在当天开放 Claude API,模型名为 claude-opus-5。
这次更新没有把重点放在“更会聊天”上。Anthropic 对 Opus 5 的定位很明确:让模型在编程、专业知识工作和长时间运行的 Agent 任务中,更愿意检查自己的结果、发现问题后继续迭代,而不是刚得到一个看似合理的答案就结束任务。
价格也提供了一个重要线索。Opus 5 的 API 单价与 Opus 4.8 相同,输入为每百万 Token 5 美元,输出为每百万 Token 25 美元。Anthropic 称,它在部分编程与知识工作评测中接近更高端的 Claude Fable 5,但单位任务成本约为后者的一半。
这并不意味着所有请求都应该迁移到 Opus 5。对开发者来说,更实际的问题是:哪些任务值得使用更强的长程 Agent,怎样用 effort、Token 预算和验证流程把结果控制在可接受范围内?
Opus 5 的变化,主要发生在任务执行过程
大模型完成复杂任务,通常不只需要生成一段答案,而是要经历一条更长的链路:
理解目标
↓
搜索文件与资料
↓
制定计划
↓
调用工具并修改外部状态
↓
运行测试或检查结果
↓
发现问题后继续修正
↓
提交最终结果与证据
链路越长,单步的小错误越容易累积。一个模型即使代码生成能力不错,如果不会主动运行测试、检查边界条件或重新审视假设,也很难稳定完成跨文件重构、数据分析、自动化办公和科研任务。
Anthropic 在发布文章中反复强调 Opus 5 的“验证”和“迭代”能力,并列出三个代表性案例:模型从原始像素中提取几何信息并重建 FreeCAD 零件;定位开源包管理器中的真实缺陷并修复社区补丁遗漏的边界情况;在没有实时数据源可验证时,为交易所行情接入任务自行建立测试工具。
这些案例说明了产品方向,但仍然来自厂商测试和早期客户反馈。它们不能直接证明模型在任意代码库中都能自主完成同类工作。复现环境、工具权限、任务提示、允许尝试次数和验收标准,都会明显改变结果。
官方评测很亮眼,但要先看评测边界
Anthropic 公布的结果覆盖编程、知识工作、计算机操作和科学研究等方向。
| 评测或场景 | Anthropic 公布的结论 |
|---|---|
| Frontier-Bench v0.1 | 成绩超过其他被测模型,相比 Opus 4.8 提升超过一倍,单位任务成本更低 |
| CursorBench 3.2 | 在 max effort 下,与 Fable 5 峰值成绩相差不到 0.5%,单位任务成本约为其一半 |
| ARC-AGI 3 | 成绩约为第二名模型的 3 倍 |
| Zapier AutomationBench | 在相同单位任务成本下,通过率约为第二名的 1.5 倍 |
| OSWorld 2.0 | 在成本—性能曲线上优于其他被测模型,并以略高于三分之一的成本超过 Fable 5 最佳结果 |
这些数字不适合简单汇总成一个“模型排名”。不同评测测量的是不同能力,而且 Anthropic 也在脚注中说明,Frontier-Bench 结果来自其内部运行环境,每个任务尝试 5 次;当 Opus 5 或 Fable 5 被安全分类器拦截时,评测会回退到 Opus 4.8。
这意味着评测结果包含模型、Agent 框架、尝试策略和回退机制的共同影响。企业在选型时,更有价值的指标通常不是单次最高分,而是下面四项:
- 在自己的任务集上,一次成功率和多次尝试后的成功率分别是多少。
- 一个成功任务平均消耗多少输入、输出 Token 和工具调用。
- 不同运行之间的结果波动有多大。
- 失败时能否被测试、规则或人工审查及时发现。
同价升级,不等于任务成本不变
Opus 5 的基础单价与 Opus 4.8 相同:
| 计费项 | API 单价 |
|---|---|
| 输入 Token | 5 美元 / 100 万 Token |
| 输出 Token | 25 美元 / 100 万 Token |
| Fast 模式 | 基础价格的 2 倍,官方称速度约为默认模式的 2.5 倍 |
Agent 任务的成本不能只看单价。模型如果读取更多文件、生成更长的推理与结果、反复调用工具或重新尝试,最终费用仍可能增加。
例如,不考虑缓存、工具和其他平台费用时:
| 场景 | 计算 | 估算费用 |
|---|---|---|
| 5 万输入 + 5000 输出 | 0.05 × $5 + 0.005 × $25 |
0.375 美元 |
| 20 万输入 + 2 万输出 | 0.2 × $5 + 0.02 × $25 |
1.50 美元 |
| 上述第二个任务使用 Fast 模式 | 1.50 × 2 |
3.00 美元 |
Fast 模式适合延迟直接影响业务价值的交互场景,例如实时编程协作和高价值工作流。批处理、夜间分析和用户不等待结果的后台任务,通常没有必要为速度统一支付双倍价格。
Anthropic 还提供 effort 设置,让开发者在推理投入、速度和成本之间调整。更稳妥的路由方式是按任务难度分层,而不是让所有请求固定使用最高 effort:
- 文本改写、字段提取和简单问答,优先交给成本更低的模型。
- 单文件修改、常规调试和有明确验收条件的任务,可以先用中等推理投入。
- 跨系统排障、长程代码修改、复杂研究和高价值专业任务,再使用 Opus 5 的高推理配置。
- 即使任务重要,也要设置 Token、时间、工具调用次数和重试上限。
具体 effort 可用值和请求格式可能随 Claude Platform 更新,生产代码应以调用时的官方文档为准。
最小 API 接入
先在隔离环境中安装 Anthropic Python SDK:
python -m venv .venv
.venv\Scripts\Activate.ps1
python -m pip install --upgrade anthropic
$env:ANTHROPIC_API_KEY="你的 API Key"
一个最小调用示例如下:
from anthropic import Anthropic
client = Anthropic()
message = client.messages.create(
model="claude-opus-5",
max_tokens=4096,
system=(
"你是代码审查助手。先定位根因,再提出最小修改方案。"
"没有运行测试或获得可复核证据时,不要声称问题已经解决。"
),
messages=[
{
"role": "user",
"content": "分析这段任务队列代码中的重复执行问题,并列出验证步骤。",
}
],
)
for block in message.content:
if block.type == "text":
print(block.text)
print(message.usage)
示例显式设置了 max_tokens,但这只是输出预算。实际 Agent 服务还应在应用层记录输入 Token、输出 Token、工具调用次数、完整耗时、重试次数和最终验收状态。
如果任务允许模型修改代码或调用外部系统,还要把“模型完成”与“业务完成”分开。模型说已经修复,不代表测试通过;模型说邮件已经准备好,也不等于应该直接发送。
长程 Agent 需要四道工程边界
1. 路径和工具白名单
只向 Agent 暴露当前任务需要的目录与工具。代码修改任务通常不需要访问凭据目录、生产数据库或部署密钥;资料分析任务通常也不需要 Shell 和写文件权限。
2. 可执行的验收条件
把“修好问题”改写成可以验证的结果,例如:
先定位重复消费的调用链和现有测试。
只允许修改 src/queue/ 和 tests/queue/。
不得新增依赖,不得提交 Git commit。
修改后运行指定测试,并报告命令、退出码和失败项。
如果无法复现问题,停止修改并说明缺少的证据。
这种提示不会保证模型正确,但能减少任务边界漂移,并让最终结果更容易审查。
3. 外部动作单独确认
写文件、执行测试和读取文档通常可以在隔离环境中自动完成;部署生产、发送邮件、删除数据、付款和修改权限则应保留独立确认。Agent 越擅长连续操作,越不能把所有工具权限一次性打开。
4. 用结果决定是否升级模型
可以让低成本模型先处理任务,只有在测试失败、置信度不足、上下文复杂或需要跨工具规划时再升级到 Opus 5。路由依据应来自任务结果,而不是用户输入里是否出现“复杂”“紧急”等词。
安全改进值得关注,但不能替代权限控制
Anthropic 称,Opus 5 在其自动化行为审计中的“整体不对齐行为”得分为 2.3,是近期 Claude 模型中最低的;同时,模型在生物研究和攻击性网络安全能力上仍落后于 Mythos 5。
官方也为部分网络安全请求设置了额外分类器。与 Fable 5 相比,Opus 5 的分类器预计减少约 85% 的介入,但仍会拦截二进制漏洞扫描、渗透测试和漏洞利用生成等请求。Claude.ai、Claude Code 和 Claude Cowork 中,被标记的请求默认可以回退到 Opus 4.8;API 也新增了自动回退能力。
这里需要区分两件事:模型更少欺骗、更少执行不可逆动作,是发布前评测中的行为信号;应用是否安全,则取决于模型、工具权限、数据边界、回退逻辑和人工确认的共同设计。任何单一安全分数都不能替代应用层控制。
Opus 5 更像一个“高价值任务层”
Opus 5 的核心卖点不是基础单价下降,而是在保持 Opus 4.8 单价的同时,提高长程任务成功率,并通过 effort 和 Fast 模式提供速度、推理投入与成本之间的选择。
如果官方结果能在真实项目中复现,它更适合承担跨文件重构、复杂排障、专业分析、科研辅助和端到端业务自动化,而不是统一替换所有聊天、摘要和分类请求。
后续最值得观察的也不是更多单项榜单,而是三类生产数据:一次成功任务的平均成本、不同运行之间的稳定性,以及模型在较少人工干预下能否持续遵守工具和权限边界。
参考资料
- Anthropic:Introducing Claude Opus 5,2026-07-24
https://www.anthropic.com/news/claude-opus-5 - Anthropic:Claude Opus 5 System Card
https://www.anthropic.com/claude-opus-5-system-card - Claude Platform:Prompting Claude Opus 5
https://platform.claude.com/docs/en/build-with-claude/prompt-engineering/prompting-claude-opus-5 - Claude Platform:Mid-conversation tool changes
https://platform.claude.com/docs/en/build-with-claude/mid-conversation-system-messages - Claude Platform:Automatic fallbacks
https://platform.claude.com/docs/en/build-with-claude/refusals-and-fallback#server-side-fallback - Frontier-Bench
https://www.frontierbench.ai/ - Artificial Analysis:GDPval-AA
https://artificialanalysis.ai/evaluations/gdpval-aa
更多推荐


所有评论(0)