Claude Opus 5 今日发布
Claude Opus 5 今日正式登场。对于企业用户而言,它的运行成本低于 Anthropic 旗下旗舰模型 Claude Fable 5——后者曾被该公司定位为面向付费用户的日常前沿产品。不仅如此,Opus 5 在关键基准测试中也表现更优。
要理解 Opus 5 的定位,需要了解 Anthropic 的产品线共分四个层级:Haiku 快速且廉价,Sonnet 为中端型号,Opus 则是重型主力。在这之上还有 Mythos 类——Anthropic 今春推出的层级——其中包含面向公众的 Claude Fable 5,以及通过 Project Glasswing 专供经过审查的网络安全研究人员和关键基础设施运营商使用的、限制较少的 Claude Mythos 5。
Fable 5 作为订阅用户旗舰产品经历了一段坎坷。它于 6 月 9 日发布,三天后因美国政府以“越狱漏洞”为由发布紧急出口管制令而在全球范围内下架,6 月 30 日重新上架——但随即转为仅限积分使用的模式,不再包含在标准套餐中。如今 Opus 5 填补了 Fable 5 未能守住的位置。
拥有数百万用户的开发者平台 Lovable 在其内部评估中测试了 Opus 5,并指出其提升不仅限于原始分数。Fabian Hedin 在 Anthropic 分享的一份声明中表示:“在我们最难的智能体编码任务上,它比 Opus 4.7 提升了 22%,而且更稳定,每次运行之间的差异要小得多。”
听起来可能有些奇怪,但 Opus 在几乎所有对日常用户重要的方面都优于 Fable,同时并未像 Fable 那样被贴上 Mythos 类的标签。
在 Frontier-Bench v0.1 上——这是一个测试 AI 编码智能体能否端到端完成真实软件工程任务的基准,以通过任务百分比计分——Opus 5 达到 43.3%,Fable 5 为 33.7%,Anthropic 的主要商业竞争对手 OpenAI 的 GPT-5.6 Sol 为 34.4%。
差距最明显的是 ARC-AGI-3,这是一项围绕新颖谜题构建的真正问题解决能力测试,模型无法从训练数据中记忆答案,以解谜百分比计分。Opus 5 达到 30.2%,GPT-5.6 Sol 为 7.8%,而 Fable 5 根本未参与测试。在 GDPval-AA v2 上——一项通过 Elo 评分(国际象棋式排名系统,用于衡量真实专业任务上的相对表现)评估的知识工作基准——Opus 5 达到 1,861 分,Fable 5 为 1,747 分,GPT-5.6 Sol 为 1,736 分。
Zapier 在 AutomationBench 上测试了 Opus 5,该评估衡量模型能否在无人协助的情况下从头到尾完成完整的业务工作流。他们的结论是:该模型“拿了一份原始的账户健康工作簿,端到端执行了完整的流失预防流程:标记高风险账户、提醒相应负责人、并总结用于留存运营。之前的模型未能通过,而 Opus 5 达到了 100%。”
Anthropic 还将 Opus 5 定位为研究升级工具。DNA 测序公司 Ultima Genomics 表示,该模型“比我们运行过的任何模型都更像一位严谨的科学家。它会选用正确的统计检验方法来排除混杂因素,通过独立方法交叉验证自身结果,并在漫长的多步骤分析中保持专注。”
不过,在仅有的两个领域——法律和医疗——Fable 5 以微弱优势领先。
此次发布的一周前,总部位于北京、由阿里巴巴支持的初创公司 Moonshot AI 推出了 Kimi K3——一个拥有 2.8 万亿参数的开源权重模型(意味着任何人都可以下载底层代码并独立运行),Moonshot 称其为全球最大的开放 AI 系统。独立基准测试一致将 Kimi K3 排在第三位,落后于 Fable 5 和 GPT-5.6 Sol,但在特定领域超越这两者。
Opus 5 现已通过 API 提供,输入价格为每百万 token 5 美元,输出价格为每百万 token 25 美元(token 是 AI 模型在输入和输出中可处理的基本信息单位)。此外还提供快速模式,速度约为默认速度的 2.5 倍,价格为基本价格的两倍——输入每百万 token 10 美元,输出每百万 token 50 美元。
此次发布或许能终结人们对 Fable 5 无法公开可用的焦虑。Opus 也已面向所有用户通过订阅方式提供。

资金费率
资金费率热力图
多空比
大户多空比
币安/欧易/火币大户多空比
Bitfinex杠杆多空比
账号安全
资讯收藏
自选币种