Claude Opus 5 发布:用半价逼近 Fable 5 前沿智能,科学评测全面反超 4.8

Anthropic 7 月 24 日发布 Claude Opus 5:以与 Opus 4.8 相同的定价,在 Frontier-Bench、CursorBench 等多项基准上刷新 SOTA,ARC-AGI 3 得分是次优模型的 3 倍,并称其为"史上对齐度最高、欺骗行为最低"的模型。

Anthropic 在 7 月 24 日投下了一枚精心计算的棋子:Claude Opus 5 正式发布——定价与 Opus 4.8 完全一致,性能却以"半价逼近旗舰"的姿态直插自家高端与中端产品线的空白地带。官方定位很直白:这是"可日常使用"的前沿模型,并顺理成章成为 Claude Max 的默认模型、Claude Pro 上最强的模型。

基准成绩:SOTA 与"次优的 3 倍"

Opus 5 的硬数据几乎在每个关键标尺上都留下了"碾压"的注脚:

  • Frontier-Bench v0.1:超越所有其他模型,且以更低单任务成本达到 Opus 4.8 两倍以上的表现
  • CursorBench 3.2:最高 effort 下与 Fable 5 峰值仅差 0.5%,成本为其一半
  • ARC-AGI 3:得分是次优模型的 3 倍
  • Zapier AutomationBench:以相同单任务成本,通过率约为次优模型的 1.5 倍
  • OSWorld 2.0:以超过三分之一成本超越 Fable 5 最佳成绩

科学评测更是全面反超 4.8:所有生命科学评测均占优,有机化学内部分数比 4.8 高 10.2 个百分点,蛋白质相关任务高 7.7 个百分点

定价与新增的工程能力

Opus 5 即日起全平台可用,价格 $5/百万输入 token、$25/百万输出 token(与 Opus 4.8 相同),并提供 Fast 模式(约 2.5 倍速度,2 倍价格)。两个同步推出的 Beta 值得工程团队留意:会话中途工具变更(不再失效 prompt cache,长会话成本结构将显著改善)与 API 自动回退(降级容错的一次官方化尝试)。

在对齐层面,Anthropic 给出的表述颇为罕见——Opus 5 是其"有史以来对齐度最高、欺骗行为最低"的模型,对齐评分 2.3。配合 6 月 30 日推进的"越狱严重度评分"行业框架,Anthropic 正把安全能力当成与性能并列的卖点来营销。

从行业视角看,Opus 5 卡位的深意在于:当 Fable 5(前沿旗舰)与 Sonnet 5(规模化主力)分别占据两端,Opus 5 用"半价旗舰"填补了中间档位,这实际上是对 OpenAI GPT-5.6 三层定价(Sol/Terra/Luna)的一次直接镜像回应。对开发者而言,这场"成本-能力"天平两侧的厂商,正在把选择权交给同一个变量——每单位智能的美元成本。

后续值得跟踪的几个方向:

  1. ARC-AGI 3 的评测方法论:OpenAI 7 月 29 日披露"两项设置三倍得分"后,各家 ARC-AGI 3 数字的横向可比性需要重新审视。
  2. 会话中途工具变更对成本的真实影响:prompt cache 保留率是长 Agent 任务的核心成本变量。
  3. Opus 5 在科学计算场景的渗透:生命科学评测的领先能否转化为医疗、生物制药客户的实际采购。
  4. Fable 5 的后续动作:旗舰被"半价逼近"后,Anthropic 的下一代旗舰升级节奏将被迫提前。
版权声明:本文内容来自 Anthropic 官方新闻 。本平台对该内容进行了编译和整理,仅用于信息传播和学习交流之用。如有侵权,请联系我们进行处理。

用户评价

  • 加载评价中...