Opus 4.7 发布24h 升了3处降了2处

昨晚 Anthropic 发了新模型 Opus 4.7。

一屏的跑分对比图被疯转。但真读懂的人不多——它悄悄降低了2项能力,大部分中文解读都没讲。

我花了一天把能找到的全部评测都读了一遍:官方文档、The Decoder、Gizmodo、Simon Willison、Nathan Lambert、The Neuron、Zvi、HN 讨论,整理成普通人 + 开发者两个视角。

读完你会知道:

  • 它让 Claude 能做哪 3 件新事(跟写不写代码没关系)
  • 它悄悄退步的 2 项能力是什么,为什么
  • 如果你在用 Claude Code,有哪些新功能真的解决了老痛点
  • Pro / Max 每月到底能用多少
  • X 上英文圈推荐的新用法

一、先给不写代码的人:3 个实打实的升级

❶ 看图能力翻了 3 倍

Opus 4.7 能处理的图像分辨率从 1.15MP 提到 3.75MP(大概从 iPhone 相机 1 倍变焦到 3 倍变焦的信息量)。

这意味着你扔给它一张复杂的 Excel 截图、产品设计稿、医疗报告、甚至一张地铁路线图,它现在能看清楚每一个小字、每一个数据点。

官方测试里,视觉敏锐度从 4.6 的 **54.5% 跳到了 98.5%**。这一条对拍照发问的日常用法是实打实的升级。

❷ Excel 和 PPT 处理更稳了

如果你之前让 AI 改 Word 的修订、调 PPT 的排版,结果经常是"看着对,实际字号错乱"。

新版专门优化了视觉自检能力——它会在输出前自己看一眼自己的结果对不对。

官方建议很有意思:如果你之前 prompt 里写了"请先检查一下再返回"这种保底提示,现在可以删掉了。它会自己做。

❸ 长任务可以真正连续跑几小时

以前让 AI 干活跑 10 分钟就飘了——要么忘了前半段,要么中途自己加戏。

新版支持了一个叫 "任务预算" 的东西:你告诉它"这件事你用 10 万 token 之内搞定",它会看着倒计时规划工作节奏,快到额度时自己收尾。

这不是技术细节,是真实场景:你让它整理一份 30 页文档的摘要 + 翻译 + 校对,现在能一次跑完,不用切成几段自己拼。


二、给不写代码的人:2 个悄悄的退步

官方 PR 稿里是不会写的。但交叉对比发现了这两条。

❶ 上网搜资料能力不如自家上一代

BrowseComp 基准测"AI 自己上网查资料能力"。

模型 得分
Opus 4.6(上一代) 83.7%
Opus 4.7(新版) 79.3%
GPT-5.4 89.3%
Gemini 3.1 Pro 85.9%

新版比自家旧版还差 4 分,被 GPT 和 Gemini 都反超。

背后原因:Anthropic 这一版押注"能自己干活"(Agent),不是"能自己查"(Search)。他们把精力放在了别的赛道。

如果你经常让 Claude 帮你"查一下最新的××"、"综合几个网站的信息告诉我××"——Gemini 3.1 Pro 现在更合适

❷ 网络安全能力被"故意"砍了

这条是外媒 The Decoder 独家挖出来的,中文几乎零覆盖。

新模型训练时 Anthropic 做了一件罕见的事——故意在训练过程中削弱网络安全相关能力。他们把这个项目叫 Project Glasswing

结果:新版会拒绝 33% 的网络安全研究请求,哪怕你只是想学习漏洞原理。

为什么?因为 AI 能力越强,被拿来做真的黑客攻击的风险越大。Anthropic 选择"安全 > 能力"。

合法的安全研究者需要单独申请一个叫 "Cyber Verification Program" 的白名单。


三、一个没公开的"真 · 全能版"

有意思的部分来了。

Anthropic 内部还有一个叫 Mythos Preview 的模型,几乎每一项测试都比公开的 Opus 4.7 强。

测试 Opus 4.7 Mythos(不公开)
真实修 Bug 64.3% 77.8%
通过编程测试 87.6% 93.9%
终端操作 69.4% 82.0%
难题推理(无工具) 46.9% 56.8%

官方自己说:Mythos "broadly more capable"(能力更全面)。

但你用不到。只给少量早期合作伙伴测试。

美国媒体 Gizmodo 的标题很直接:**"Anthropic 发布 Opus 4.7,就是为了提醒大家 Mythos 有多强。"** ——本质就是在发布当天贬低自家旗舰,把真正的"旗舰感"留给没公开的模型。


四、给开发者 / Claude Code 重度用户

如果你每天开着 Claude Code 干活,这次的更新更像是一次产品级的体验改版,不只是模型升级。

❶ Auto Mode —— 解决"一直被弹窗打断"

以前 Claude Code 只有两种模式,都不好用:

  • 默认模式:每调用一个工具都弹确认窗口。跑长任务时你必须一直守着点"允许"。
  • Bypass 模式:不问了,但 任何指令都能执行——包括不小心删文件、把你的代码发到外部服务器。

Auto Mode 是中间档:一个独立的分类器模型会在每一步执行前扫描这个操作,判断三件事:

  • 它是不是在做你没让它做的事?
  • 它操作的服务器是不是可信?
  • 这个指令是不是来自某个网页/文件里藏的恶意提示?

安全 → 自动执行;可疑 → 拦下来换方式。

实际体感:长任务可以真正放手跑 2 小时,你去吃饭回来看结果。

这篇文章我就是在 Auto Mode 下让 Claude 帮我整理出来的,过程全程没被打断。

/ultraplan —— 写代码前先对齐计划

老问题:你说完需求,Claude 直接开干。结果写到一半发现方向错了。

新命令 /ultraplan:把规划变成一份可评论的文档

  • 它先给你一份实施方案(分章节)
  • 你能在任意一段下面评论:"这里改成合并文件,不要拆"
  • 它根据评论修方案,直到你满意
  • 确认后再写代码

一句话总结:从"干完再挨骂"变成"干前先对齐"。

/ultrareview —— 多个专科 AI 并行审代码

普通的 AI 审代码是一个模型一次看完全部——注意力被安全、逻辑、性能、代码风格四件事分散,每件只看个皮毛。

/ultrareview 同时召唤 4 个专科子 Agent

  • 一个只盯安全漏洞
  • 一个只盯业务逻辑 bug
  • 一个只盯性能问题
  • 一个只盯代码风格

最后合并成一份报告。

类比:以前体检找全科医生,现在心内、神经、肝胆、骨科四个专科一起给你看。

使用方法:

  • /ultrareview —— 审当前分支
  • /ultrareview #123 —— 拉 GitHub PR 审

❹ 新档位 xhigh(effort 是啥,一起讲)

先讲 effort 是啥: 大模型不是只有快慢两档。干活前它可以先"想"——想得越久,答案越好,但越慢越贵。effort 就是让你手动调"想多久"的旋钮

档位 什么时候用 感觉类比
Low 简单分类、查找 随口一答
Medium 日常问答(官方默认) 平时状态
High 复杂推理、难题 坐下来认真想
xhigh(新) 编程、Agent 任务推荐默认 泡杯咖啡慢慢干
Max 极限难题,不差钱 全力以赴不限时

以前跑 Opus 的"坑":High 不够,Max 太贵。xhigh 刚好填中间。

官方原话:**"编程和 Agent 任务直接从 xhigh 开始用。"** 在 Claude Code 里它已经是新默认值。


五、Pro / Max 订阅到底能用多少

这是很多人问但官方文档写得很绕的部分。

Pro 档($20/月)

  • 编程 / AI 对话共享一个额度池
  • 大概 每 5 小时 88000 token(Opus 跑得很快就烧完)
  • /ultrareview:每个计费周期 3 次免费
  • 超额需要升级或按 API 价格买额外用量

Max 5x 档($100/月)

  • Pro 额度的 5 倍
  • Anthropic 官方说法:"每周 Opus 用量 15-35 小时"
  • 但社区反馈:重度用户实际 3-5 小时就烧完
  • /ultrareview:同样每周期 3 次免费

Max 20x 档($200/月)

  • Pro 额度的 20 倍
  • Opus 自动升级到 100 万 token 上下文(免费)
  • 超重度用户必选

所有付费档通用

  • 超额后可以走 按量计费(standard API 价格)
  • 可以设置月度上限,防止超支
  • 有独立的 Opus 周上限(跟整体额度分开算)

六、英文圈大神都在说什么

我把 X、Substack、HN 上最有影响力的几个人的角度整理在一起:

官方口径(Boris Cherny,Claude Code 负责人)

"More agentic, more precise, better at handling ambiguity." (更适合 Agent 任务,更精确,更好地处理模糊指令。)

最实用的迁移建议(The Neuron Daily)

"为老模型写的 prompt 在 4.7 上可能反效果。"

新版对指令字面执行得太严格。那些你当初为了"让 AI 更认真"加的一堆保底提示:

  • "请先规划再执行"
  • "每一步自检"
  • "不要跳过任何细节"

现在建议删掉。 新版自己会做。你硬加反而可能让它困惑。

最冷门但最值钱的坑(The-AI-Corner)

新版换了分词器。同样的文本,现在用的 token 数最多涨 35%。

定价没变(输入 25 每百万 token),但实际账单可能涨三成。

反炒作声音(Nathan Lambert,Interconnects.ai)

"别盯着 SWE-bench 跑分。基准时代过去了,看产品整合。"

意思是:对比表上那 2-3 分差异没什么感知,真正决定体验的是 Auto Mode / ultraplan / ultrareview 这类工具层面的改动。

最戳破神话的测试(Simon Willison)

他有个经典测试叫"鹈鹕骑自行车 SVG"——让 AI 画个 SVG 图。

结果:一个 21GB 的本地开源模型 Qwen3.6-35B 画得比 Opus 4.7 好。

他的点评很谨慎:"这不代表 Qwen 全面更强",但是:前沿模型 ≠ 所有任务都最强。某些创意任务,本地小模型反而赢。


七、一句话选型(2026.4.17)

  • 写代码 / 长时间 Agent 任务 → Opus 4.7
  • 联网搜资料 / 综合多源信息 → Gemini 3.1 Pro
  • 终端运维 / 命令行操作 → GPT-5.4
  • 创意画图 / SVG / 视觉生成 → 试试本地开源模型(Qwen3.6、Kimi K2 等)

八、我自己的观察

花一天读完所有评测,有两个观察很想记下来:

一是:评测矩阵的意义越来越小。 顶级模型在通识基准上已经全部卡在 94%+ 饱和。GPQA、MMLU、AIME 这些几年前的"神坛基准"已经失去区分度。看 2026 年的 AI 进展还盯着这些数字,等于在用 2012 年的尺子量 2026 年的人。

二是:工具层的改动比模型层的改动更影响实际体验。 Auto Mode / ultraplan / ultrareview 这类改动,不是"AI 变聪明了 0.5%",而是**"AI 能干的任务类型多了一大类"**。这是质的变化。


以上信息基于 Anthropic 官方文档(2026-04-16)+ 多家独立评测的交叉整理。具体功能请以 anthropic.com 最新官方说明为准,不同订阅档位的用量规则官方也在持续调整。

AI 辅助创作,信息整理由人工完成。仅供学习参考,不构成任何商业或投资建议。

评论区想听听:你最近在用哪个模型干活?有没有踩过文中提到的坑?

本文由 mdnice 多平台发布

Logo

欢迎加入DeepSeek 技术社区。在这里,你可以找到志同道合的朋友,共同探索AI技术的奥秘。

更多推荐