opus4.7最新更新
Opus 4.7 发布24h 升了3处降了2处
昨晚 Anthropic 发了新模型 Opus 4.7。
一屏的跑分对比图被疯转。但真读懂的人不多——它悄悄降低了2项能力,大部分中文解读都没讲。
我花了一天把能找到的全部评测都读了一遍:官方文档、The Decoder、Gizmodo、Simon Willison、Nathan Lambert、The Neuron、Zvi、HN 讨论,整理成普通人 + 开发者两个视角。
读完你会知道:
-
它让 Claude 能做哪 3 件新事(跟写不写代码没关系) -
它悄悄退步的 2 项能力是什么,为什么 -
如果你在用 Claude Code,有哪些新功能真的解决了老痛点 -
Pro / Max 每月到底能用多少 -
X 上英文圈推荐的新用法
一、先给不写代码的人:3 个实打实的升级
❶ 看图能力翻了 3 倍
Opus 4.7 能处理的图像分辨率从 1.15MP 提到 3.75MP(大概从 iPhone 相机 1 倍变焦到 3 倍变焦的信息量)。
这意味着你扔给它一张复杂的 Excel 截图、产品设计稿、医疗报告、甚至一张地铁路线图,它现在能看清楚每一个小字、每一个数据点。
官方测试里,视觉敏锐度从 4.6 的 **54.5% 跳到了 98.5%**。这一条对拍照发问的日常用法是实打实的升级。
❷ Excel 和 PPT 处理更稳了
如果你之前让 AI 改 Word 的修订、调 PPT 的排版,结果经常是"看着对,实际字号错乱"。
新版专门优化了视觉自检能力——它会在输出前自己看一眼自己的结果对不对。
官方建议很有意思:如果你之前 prompt 里写了"请先检查一下再返回"这种保底提示,现在可以删掉了。它会自己做。
❸ 长任务可以真正连续跑几小时
以前让 AI 干活跑 10 分钟就飘了——要么忘了前半段,要么中途自己加戏。
新版支持了一个叫 "任务预算" 的东西:你告诉它"这件事你用 10 万 token 之内搞定",它会看着倒计时规划工作节奏,快到额度时自己收尾。
这不是技术细节,是真实场景:你让它整理一份 30 页文档的摘要 + 翻译 + 校对,现在能一次跑完,不用切成几段自己拼。
二、给不写代码的人:2 个悄悄的退步
官方 PR 稿里是不会写的。但交叉对比发现了这两条。
❶ 上网搜资料能力不如自家上一代
BrowseComp 基准测"AI 自己上网查资料能力"。
| 模型 | 得分 |
|---|---|
| Opus 4.6(上一代) | 83.7% |
| Opus 4.7(新版) | 79.3% |
| GPT-5.4 | 89.3% |
| Gemini 3.1 Pro | 85.9% |
新版比自家旧版还差 4 分,被 GPT 和 Gemini 都反超。
背后原因:Anthropic 这一版押注"能自己干活"(Agent),不是"能自己查"(Search)。他们把精力放在了别的赛道。
如果你经常让 Claude 帮你"查一下最新的××"、"综合几个网站的信息告诉我××"——Gemini 3.1 Pro 现在更合适。
❷ 网络安全能力被"故意"砍了
这条是外媒 The Decoder 独家挖出来的,中文几乎零覆盖。
新模型训练时 Anthropic 做了一件罕见的事——故意在训练过程中削弱网络安全相关能力。他们把这个项目叫 Project Glasswing。
结果:新版会拒绝 33% 的网络安全研究请求,哪怕你只是想学习漏洞原理。
为什么?因为 AI 能力越强,被拿来做真的黑客攻击的风险越大。Anthropic 选择"安全 > 能力"。
合法的安全研究者需要单独申请一个叫 "Cyber Verification Program" 的白名单。
三、一个没公开的"真 · 全能版"
有意思的部分来了。
Anthropic 内部还有一个叫 Mythos Preview 的模型,几乎每一项测试都比公开的 Opus 4.7 强。
| 测试 | Opus 4.7 | Mythos(不公开) |
|---|---|---|
| 真实修 Bug | 64.3% | 77.8% |
| 通过编程测试 | 87.6% | 93.9% |
| 终端操作 | 69.4% | 82.0% |
| 难题推理(无工具) | 46.9% | 56.8% |
官方自己说:Mythos "broadly more capable"(能力更全面)。
但你用不到。只给少量早期合作伙伴测试。
美国媒体 Gizmodo 的标题很直接:**"Anthropic 发布 Opus 4.7,就是为了提醒大家 Mythos 有多强。"** ——本质就是在发布当天贬低自家旗舰,把真正的"旗舰感"留给没公开的模型。
四、给开发者 / Claude Code 重度用户
如果你每天开着 Claude Code 干活,这次的更新更像是一次产品级的体验改版,不只是模型升级。
❶ Auto Mode —— 解决"一直被弹窗打断"
以前 Claude Code 只有两种模式,都不好用:
-
默认模式:每调用一个工具都弹确认窗口。跑长任务时你必须一直守着点"允许"。 -
Bypass 模式:不问了,但 任何指令都能执行——包括不小心删文件、把你的代码发到外部服务器。
Auto Mode 是中间档:一个独立的分类器模型会在每一步执行前扫描这个操作,判断三件事:
-
它是不是在做你没让它做的事? -
它操作的服务器是不是可信? -
这个指令是不是来自某个网页/文件里藏的恶意提示?
安全 → 自动执行;可疑 → 拦下来换方式。
实际体感:长任务可以真正放手跑 2 小时,你去吃饭回来看结果。
这篇文章我就是在 Auto Mode 下让 Claude 帮我整理出来的,过程全程没被打断。
❷ /ultraplan —— 写代码前先对齐计划
老问题:你说完需求,Claude 直接开干。结果写到一半发现方向错了。
新命令 /ultraplan:把规划变成一份可评论的文档。
-
它先给你一份实施方案(分章节) -
你能在任意一段下面评论:"这里改成合并文件,不要拆" -
它根据评论修方案,直到你满意 -
确认后再写代码
一句话总结:从"干完再挨骂"变成"干前先对齐"。
❸ /ultrareview —— 多个专科 AI 并行审代码
普通的 AI 审代码是一个模型一次看完全部——注意力被安全、逻辑、性能、代码风格四件事分散,每件只看个皮毛。
/ultrareview 同时召唤 4 个专科子 Agent:
-
一个只盯安全漏洞 -
一个只盯业务逻辑 bug -
一个只盯性能问题 -
一个只盯代码风格
最后合并成一份报告。
类比:以前体检找全科医生,现在心内、神经、肝胆、骨科四个专科一起给你看。
使用方法:
-
/ultrareview—— 审当前分支 -
/ultrareview #123—— 拉 GitHub PR 审
❹ 新档位 xhigh(effort 是啥,一起讲)
先讲 effort 是啥: 大模型不是只有快慢两档。干活前它可以先"想"——想得越久,答案越好,但越慢越贵。effort 就是让你手动调"想多久"的旋钮。
| 档位 | 什么时候用 | 感觉类比 |
|---|---|---|
| Low | 简单分类、查找 | 随口一答 |
| Medium | 日常问答(官方默认) | 平时状态 |
| High | 复杂推理、难题 | 坐下来认真想 |
| xhigh(新) | 编程、Agent 任务推荐默认 | 泡杯咖啡慢慢干 |
| Max | 极限难题,不差钱 | 全力以赴不限时 |
以前跑 Opus 的"坑":High 不够,Max 太贵。xhigh 刚好填中间。
官方原话:**"编程和 Agent 任务直接从 xhigh 开始用。"** 在 Claude Code 里它已经是新默认值。
五、Pro / Max 订阅到底能用多少
这是很多人问但官方文档写得很绕的部分。
Pro 档($20/月)
-
编程 / AI 对话共享一个额度池 -
大概 每 5 小时 88000 token(Opus 跑得很快就烧完) -
/ultrareview:每个计费周期 3 次免费 -
超额需要升级或按 API 价格买额外用量
Max 5x 档($100/月)
-
Pro 额度的 5 倍 -
Anthropic 官方说法:"每周 Opus 用量 15-35 小时" -
但社区反馈:重度用户实际 3-5 小时就烧完 -
/ultrareview:同样每周期 3 次免费
Max 20x 档($200/月)
-
Pro 额度的 20 倍 -
Opus 自动升级到 100 万 token 上下文(免费) -
超重度用户必选
所有付费档通用
-
超额后可以走 按量计费(standard API 价格) -
可以设置月度上限,防止超支 -
有独立的 Opus 周上限(跟整体额度分开算)
六、英文圈大神都在说什么
我把 X、Substack、HN 上最有影响力的几个人的角度整理在一起:
官方口径(Boris Cherny,Claude Code 负责人)
"More agentic, more precise, better at handling ambiguity." (更适合 Agent 任务,更精确,更好地处理模糊指令。)
最实用的迁移建议(The Neuron Daily)
"为老模型写的 prompt 在 4.7 上可能反效果。"
新版对指令字面执行得太严格。那些你当初为了"让 AI 更认真"加的一堆保底提示:
-
"请先规划再执行" -
"每一步自检" -
"不要跳过任何细节"
现在建议删掉。 新版自己会做。你硬加反而可能让它困惑。
最冷门但最值钱的坑(The-AI-Corner)
新版换了分词器。同样的文本,现在用的 token 数最多涨 35%。
定价没变(输入 25 每百万 token),但实际账单可能涨三成。
反炒作声音(Nathan Lambert,Interconnects.ai)
"别盯着 SWE-bench 跑分。基准时代过去了,看产品整合。"
意思是:对比表上那 2-3 分差异没什么感知,真正决定体验的是 Auto Mode / ultraplan / ultrareview 这类工具层面的改动。
最戳破神话的测试(Simon Willison)
他有个经典测试叫"鹈鹕骑自行车 SVG"——让 AI 画个 SVG 图。
结果:一个 21GB 的本地开源模型 Qwen3.6-35B 画得比 Opus 4.7 好。
他的点评很谨慎:"这不代表 Qwen 全面更强",但是:前沿模型 ≠ 所有任务都最强。某些创意任务,本地小模型反而赢。
七、一句话选型(2026.4.17)
-
写代码 / 长时间 Agent 任务 → Opus 4.7 -
联网搜资料 / 综合多源信息 → Gemini 3.1 Pro -
终端运维 / 命令行操作 → GPT-5.4 -
创意画图 / SVG / 视觉生成 → 试试本地开源模型(Qwen3.6、Kimi K2 等)
八、我自己的观察
花一天读完所有评测,有两个观察很想记下来:
一是:评测矩阵的意义越来越小。 顶级模型在通识基准上已经全部卡在 94%+ 饱和。GPQA、MMLU、AIME 这些几年前的"神坛基准"已经失去区分度。看 2026 年的 AI 进展还盯着这些数字,等于在用 2012 年的尺子量 2026 年的人。
二是:工具层的改动比模型层的改动更影响实际体验。 Auto Mode / ultraplan / ultrareview 这类改动,不是"AI 变聪明了 0.5%",而是**"AI 能干的任务类型多了一大类"**。这是质的变化。
以上信息基于 Anthropic 官方文档(2026-04-16)+ 多家独立评测的交叉整理。具体功能请以 anthropic.com 最新官方说明为准,不同订阅档位的用量规则官方也在持续调整。
AI 辅助创作,信息整理由人工完成。仅供学习参考,不构成任何商业或投资建议。
评论区想听听:你最近在用哪个模型干活?有没有踩过文中提到的坑?
本文由 mdnice 多平台发布
更多推荐


所有评论(0)