7月25日凌晨,Anthropic正式发布新一代旗舰模型Claude Opus 5。在Frontier-Bench和GDPval-AA等编程与知识工作评估中实现SOTA,性能极为接近Claude Fable 5,但定价仅为后者一半——输入每百万Token 5美元,输出每百万Token 25美元。 网友的神评一针见血:"既然性能差不多,那花2倍价格用Fable 5的人是?"这个问题背后,是大模型市场正在发生的结构性变化:性价比正在取代绝对性能,成为企业AI选型的核心指标。 Opus 5在高价值软件工程任务中表现优异,Frontier-Bench v0.1性能达到Opus 4.8的两倍以上;CursorBench 3.2在最高努力模式下距离Fable 5仅差0.5%,但单任务成本仅为后者一半。更值得关注的是其自我校验与审慎迭代能力的显著提升——模型能持续优化直至任务成功,这是当前业内非常关注的模型能力之一。
文章图片 2
Anthropic在安全性方面同样着墨颇多。Opus 5是其迄今为止对齐程度最高的模型,欺骗行为发生率最低,最不容易被误导或诱导滥用。在网络安全任务上,Opus 5寻找漏洞的能力已逼近Mythos 5,但在漏洞利用方面仍大幅落后。这种"能找漏洞但不制造漏洞"的安全设计,正是企业级AI部署所需要的。 当前国内开源、闭源模型"爆更"给海外大模型厂商带来显著压力。从Kimi K3到GLM-5.2,中国实验室用更少的资源、更高的工程效率,走出了一条"约束条件下的创新"路线。不少海外科技巨头逐渐转向中国模型,加码"性价比"正在成为海外大模型厂商的重要策略之一。
文章图片 4
星战科技在大模型API广场方向的产品设计,正是基于对这一行业趋势的判断。通过统一接口聚合国内外主流开源与闭源模型,企业可以根据具体业务场景的性能要求、成本预算和安全需求,灵活选择最合适的模型。当Opus 5以Fable 5一半的价格提供接近的性能时,企业需要的不是盲目追新,而是一套能根据任务复杂度自动路由到最优性价比模型的调度机制——这正是星战在企业AI落地服务中帮助企业构建的核心能力。 大模型性价比竞争的白热化,对企业来说是好消息。当模型能力差距缩小到个位数百分比,而价格差距达到50%时,CFO的数学题比CTO的技术选型更有说服力。