HN精选|Sonnet 5发布

Sonnet 5发布:Agent能力接近Opus,入门价$2/M

Anthropic 发布 Claude Sonnet 5:Sonnet 系列的 Agent 能力跃升

2026年6月30日,Anthropic 正式发布 Claude Sonnet 5,将其定位为”迄今为止最具自主代理能力的 Sonnet 模型”。与上一代 Sonnet 4.6 相比,Sonnet 5 在推理、工具使用、编码和知识工作等 Agent 关键维度上实现了显著提升,性能接近 Opus 4.8 级别,但价格更低。

从即日起,Sonnet 5 成为 Free 和 Pro 计划的默认模型,Max、Team、Enterprise 用户也可使用。API 定价方面:

• 引入期(至 2026.8.31):输入 $2/百万 token,输出 $10/百万 token

• 常规期:输入 $3/百万 token,输出 $15/百万 token

性能曲线:用更低成本达到更高产出

Anthropic 公布了两张关键性能-成本曲线图。在 BrowseComp(Agent 搜索)和 OSWorld-Verified(计算机操作)评测中,Sonnet 5(橙色曲线)全面优于 Sonnet 4.6(灰色曲线),且在中等 effort 级别提供了比 Opus 4.8(黄色曲线)更优的性价比。在高 effort 下,Sonnet 5 在某些任务上可匹配 Opus 4.8 的能力。

有趣的是,HN 用户 doctoboggan 从曲线中得出一个反直觉的结论:“成本-性能图告诉我,永远不要在中等 effort 以上使用 Sonnet 5——Opus 在同等成本下表现更好。所以如果 Sonnet 5 medium 不够用,应该换模型而不是提 effort。”

实测反馈:速度尚可,一致性存疑

社区早期测试结果喜忧参半:

• 用户 XCSme 在其内部基准测试中得出结论:“性能达到 GLM-5.2 水平,速度是其 2 倍,但成本也是 2 倍。弱项包括冷知识(0/3 通过)、组合工具调用(45/100)、逻辑谜题(7/22)。”

• 开发者 ashvardanian 将其作为 HPC 内核优化的子代理:“三个项目中没有一次写出代码,Sonnet 子代理一直在空转消耗 token。我连上次 Sonnet 这么差是什么时候都记不起来了。”

这些反馈表明,Sonnet 5 在基准测试上的提升未必能线性转化为实际开发场景中的生产力提升。

安全评估:更安全但也更弱

在安全维度上,Sonnet 5 的系统卡(System Card)显示其不良行为率低于 Sonnet 4.6,且网络安全操作能力显著弱于 Opus 系列。Anthropic 显然通过 alignment 训练在”能做”和”不该做”之间做了更有力的权衡。

📎 原文:Introducing Claude Sonnet 5 · HN 讨论:457 条评论

Leave a Reply

Your email address will not be published. Required fields are marked *