半价"背刺"Fable 5,Opus 5登场!A社高管:Kimi K3更便宜,但复杂项目表现待观察
昨夜,Anthropic 发布了 Opus 5 模型,这是其长期主打的重磅模型的最新版本。在公告中列出的多项基准测试中,Opus 5 实际表现优于 Fable 5。
据 Anthropic 介绍,Opus 5 的能力接近其商用最强模型 Fable 5,而价格仅为后者的一半,且安全限制比 Fable 模型更宽松,很可能在大多数使用场景中成为更优选择。
距离 5 月 28 日上线的 Opus 4.8 仅过去两个月,Opus 5 便已推出。这是 Anthropic 在不到两个月内推出的第四款模型。Mythos 5、Fable 5 和 Sonnet 5 均在 6 月发布,目前只剩下轻量级模型 Haiku 仍在等待升级至 5 系列。

编码能力超越 Fable 5,还不受数据约束
软件开发是 Opus 5 最大的改进之一。在以业务和生产力为中心的应用方面也展现出了优势。
Anthropic 制作的基准测试图表显示,Opus 5 在知识工作方面的表现优于其以往任何模型,在编码任务上也显著优于 Opus 4.8,大致与备受追捧的 Fable 模型相当或略胜一筹。在几乎所有类型的任务中,它都明显优于 Opus 4.8 和 OpenAI 的 GPT-5.6-Sol。
在 Frontier-Bench(一项衡量模型能否根据工程图纸构建可用软件的编码评估)中,Opus 5 的得分较前代翻倍有余,并超越了所有竞品,包括 Fable 5。在测试新颖问题解决能力的 ARC-AGI 3 上,Opus 5 的得分约为次优模型的 3 倍。

Anthropic 强调,Opus 5"在验证自身工作并反复推敲直至成功方面更加强大",并引用了基准测试中的例子:Opus 5 根据一个不完整的提示词自行编写了计算机视觉处理流程。
据 Claude Code 工程师 Thariq Shihipar 称,Anthropic 在其最新型号中移除了 80% 的 Claude Code 系统提示,包括 Opus 5 和 Fable 5 等模型,而编码评估结果并未受到明显影响。

该公司还称,Opus 5 在科研方面也更出色,尤其擅长预测蛋白质序列变异如何影响分子功能等任务。当前 Opus 5"展现出最低比例的欺骗性行为"。
Opus 5 不受涵盖 Fable 和 Mythos 的 30 天数据保留政策约束——该政策此前曾引发部分注重隐私的用户的担忧。因此,Anthropic 预计 Opus 5 将成为大多数用户需要完成工作时的首选模型。
此前大家对 Fable 的不满之一就是其施加的安全限制。Anthropic 曾实施一套机制,Claude 会将涉及某些主题的提示词路由至 Opus 4.8 而非 Fable 5。许多人认为这些限制过于严苛,使得 Fable 在某些任务上几乎不可用。
不过,Opus 仍然设有实质性的安全护栏,但是在"较窄范围"的特定任务上进行的,特别是在漏洞利用生成和渗透测试等网络安全任务方面。例如,Opus 5 的护栏禁止其被用于扫描软件二进制文件中的漏洞,但允许其在源代码中搜索漏洞,因为后者更可能用于防御目的。
"Claude Opus 5 的安全措施旨在允许模型在网络安全和生物学领域的良性使用。根据我们的测试,我们预计分类器的干预频率将比 Fable 5 低约 85%。"
该公司还推出了"自动回退"(Automatic Fallbacks)测试功能:当提示词触发安全分类器时,该功能会自动将请求路由至能力较低的模型,使 API 用户获得功能性响应而非错误信息。
据悉,Opus 5 在网络安全方面比 Opus 4.8 更强大,但在漏洞利用开发方面仍远逊于 Mythos 5。

关键在于 token 效率,而非能力跃升
"Opus 5 专为日常使用而设计:它比其他模型更高效。它是 Claude Max 的新默认模型,也是 Claude Pro 上最强的模型。"
定价方面,Opus 5 的 API 费用维持每百万输入 token 5 美元、每百万输出 token 25 美元。Anthropic 还为 Opus 增加了一个"effort"菜单,用户可调整以指示模型是希望更详尽,还是更快更高效以节省 token。
近来 Cursor 和 Meta 等公司也在做类似工作,构建了一套"模型路由器",即根据提示词的性质,从一系列选项中自动选择不同规模和能力的模型。其思路是,不必为每个任务都使用 Fable 这样的模型,从而节省大量 token。

在 CursorBench 3.2 测试中,在最大工作量下,该模型的性能与 Fable 5 的峰值得分相差不到 0.5%,但单项任务成本却只有后者的一半。在高、超高和最大工作量下,Opus 5 在相同成本下也优于所有其他模型。
在 Zapier AutomationBench 测试中(衡量模型能否从头到尾完成业务任务),Opus 5 的通过率约为同等成本下性能次优模型的 1.5 倍。即使在最低工作量设置下,Opus 5 完成的任务数量也超过任何其他模型。
在 OSWorld 2.0(计算机使用基准测试)中,Opus 5 在任何给定的价格下都优于其他所有型号,并且以略高于 Fable 5 三分之一的价格超越了 Fable 5 的最佳成绩。
早期客户报告称资源使用量有所降低:
- Harvey 应用研究负责人 Niko Grupen:该模型"在最大推理设置下,与 Opus 4.8 相比,平均生成的 token 数量减少了 26%,同时保持了相近的性能"
- Zapier CEO Wade Foster:Opus 5"登顶了 Zapier AutomationBench 排行榜,且消耗的 token 数量不超过之前的 Claude 模型",之前模型未能通过测试,而 Opus 5 达到了 100%

Artificial Analysis 评估了各热门模型完成相同任务的成本,每项 Intelligence Index 任务的加权平均成本(美元)为:
| 模型 | 每项任务成本 |
|---|---|
| Fable 5 | $2.75 |
| Opus 5(最高设置) | $2.03 |
| GPT-5.6 Sol(最高设置) | $1.04 |
| Kimi K3 | $0.95 |
现在看来,Opus 5 在各项基准测试显示出的迭代提升,虽非性能上质的飞跃,但主要卖点在于 token 效率。
Anthropic 研究产品管理负责人 Dianne Penn 表示,用户应该选择 Opus 5 来获得更高的性价比,而选择 Fable 5 来处理"持续数天的、高度自主的项目"。
当被问及 Kimi K3 时,Penn 称开源模型在用户委托 Claude 处理的复杂实际项目中表现如何"还有待观察":
"从我们的反馈和客户群体来看,企业看重的是价值。如果模型或产品更便宜,但无法达到相近的质量水平,那实际上并没有什么用。"