HN精选|Claude Opus 5发布

Opus 5登场:半价逼近Fable,编码新SOTA

背景:半价旗舰登场

7月24日,Anthropic 正式发布 Claude Opus 5。官方对它的定位是“深思熟虑且积极主动”的模型,以一半的价格逼近自家最强通用模型 Claude Fable 5 的智能水平。发布当天,Opus 5 即成为 Claude Max 的默认模型,也是 Claude Pro 订阅可用的最强模型。

核心看点:性价比全面碾压

在编码与知识工作评测上,Opus 5 成为新的 SOTA。在 Frontier-Bench v0.1 上它超越所有模型,性能是 Opus 4.8 的两倍以上,单任务成本反而更低;在 CursorBench 3.2 最高档位,与 Fable 5 峰值差距不到 0.5%,而成本减半;在 ARC-AGI 3 新颖问题解决评测中,得分是次优模型的 3 倍;在 OSWorld 2.0 电脑操作基准上,仅以约三分之一的成本就超过 Fable 5 的最佳成绩。唯一明显的短板是网络安全任务,仍落后于 Mythos 5。

具体案例:会自己造工具的模型

Anthropic 披露了多个体现 Opus 5 智能体能力的案例。在一个 Frontier-Bench 任务中,模型拿到一张机械零件图纸并被要求写代码重建为 3D FreeCAD 模型,但任务故意不给它看图的手段。Opus 5 的解法是自建一套计算机视觉流水线,从原始像素中提取几何信息,然后完整重建零件,且反复多次均成功。相同设置下没有竞品模型能在五次尝试内解出。另一个案例中,面对某流行开源包管理器的真实 bug,Opus 5 找到根因并修复了社区补丁遗漏的边缘情况,而竞品只修了表面症状就宣称解决。还有交易公司的工程师用它在一个会话内建成新交易所的行情数据 feed,找不到真实数据源验证时,它甚至自建测试框架来校验解析正确性。

科研与视觉能力

Opus 5 在生命科学评测上全面超越 4.8。有机化学方向(从光谱数据推断分子结构{f10}提升 10.2 个百分点;蛋白序列变异对功能影响的预测提升 7.7 个百分点。视觉输出也大幅增强,可直接生成风洞气流可视化和可交互的细胞结构示意图。

生态反响

Cursor 联创 Sualeh Asif 称它“以 Opus 的速度与成本逼近 Fable 5 的智能”;Zapier CEO Wade Foster 表示 Opus 5 在 AutomationBench 端到端业务流程中拿到 100% 通过率,而之前的模型全部不及格;Lovable 称最难的智能体编码任务提升 22%,且运行间方差大幅降低,“一致性就是一切”;Box 则报告尽调工作流提升 17%。

社区讨论

Hacker News 上,有人截出 ARC-AGI-3 的 30.2% 得分直呼惊人,也有人认为这次主打“每美元智能”的方向比单纯刷榜更有意义。质疑声同样存在,既然整体能力仍不如 Fable 5,意义何在,以及分类器会不会让模型变得难用。还有人注意到发布时机恰好与黄仁勋力挺开源 AI 的声明同一天。

原文:Introducing Claude Opus 5

HN 讨论:news.ycombinator.com/item?id=49038433

Leave a Reply

Your email address will not be published. Required fields are marked *