1. 首页 > 头条

Claude Opus 5性能媲美旗舰 价格仅一半

Ai总结: Anthropic发布新一代模型Opus 5,性能逼近Fable 5,但价格减半。该模型在多个基准测试中表现卓越,同时引入自动回退机制与更宽松的安全策略,成为企业级应用的主力选择。

Anthropic 推出 Claude Opus 5:性能对标旗舰,定价仅为一半

Anthropic 在7月24日推出全新推理模型Claude Opus 5,定位为在智能表现上接近Fable 5,但成本仅为后者一半的高性能选项,主要面向开发者及企业客户群体。

核心能力跃升:以半价实现同级别顶尖表现

该模型距离前代Opus 4.8发布仅两个月,为预算敏感型团队提供了更具性价比的默认部署方案,避免长期支付旗舰模型溢价。

多维基准测试中超越竞品,效率优势显著

尽管运行开销与前代持平,Opus 5 在编程评估基准Frontier-Bench v0.1上的综合表现全面领先,任务完成速度更快、单位成本更低,性能达到Opus 4.8的两倍以上。用户可通过调节“努力程度”参数,在响应速度与智能水平间灵活取舍,实现按需优化。

目前,Opus 5已取代原有模型,成为Claude Max的默认配置,并在Claude Pro服务中提供最强算力支持。公司将其定义为日常高频使用的主力模型,而非特定场景专用工具,强调其整体效率优于同类竞争产品。

在CursorBench 3.2编程测评中,最大努力模式下的得分与Fable 5最佳结果差距不足0.5个百分点,而每项任务成本仅为后者的二分之一。在多项独立测试中,包括较小型的Opus 5反而超越了Fable 5的表现。

于新颖问题解决能力测试ARC-AGI 3中,其成绩是第二名模型的三倍;在Zapier的AutomationBench测试中,通过率约为最接近对手的1.5倍,且成本相当;在OSWorld 2.0计算机操作基准中,仅用三分之一成本即超越Fable 5的最佳成果。

Anthropic承认,在网络安全相关任务中,该模型仍落后于Mythos 5。

安全策略放宽并新增智能容错机制

与Fable和Mythos系列不同,Opus 5不受30天数据保留限制,预计其安全分类器触发频率将降低85%。尽管如此,系统仍设有防护边界:模型无法对编译后的二进制文件进行漏洞扫描,但允许分析源代码,因其被认为具有更高可防御性。

为提升用户体验,Anthropic正测试名为“自动回退”的功能,可在分类器触发时将请求无缝转至次级模型,确保输出可用,而非返回错误提示。

举例而言,在Frontier Bench一项任务中,模型需根据一张机械零件图纸重建3D FreeCAD模型,但无法直接读取图像。Opus 5自主编写计算机视觉脚本,从原始像素中提取几何特征并成功还原,其他模型在五次尝试内均未达成。

Devin CEO Scott Wu指出,该模型在公司内部FrontierCode 1.1测试中,“以一半成本逼近Fable性能”。Zapier CEO Wade Foster表示,Opus 5登顶其AutomationBench榜单,并在端到端流失预防流程中实现100%通过率,此前所有旧版本均未能完成该任务。在生命科学领域,其从光谱数据推断分子结构的能力相较Opus 4.8提升10.2个百分点。

Mythos 5、Fable 5与Sonnet 5已于今年6月上线,目前仅有Haiku维持在上一代架构。公司估值在2025年11月达约3500亿美元,其中约80%收入来自超30万家企业客户。

免责声明:本文所有内容均来源于第三方平台,所有内容不作任何类型的保证,不构成任何投资、不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。