三个月前,Anthropic发布Fable 5时试图回答一个问题:当模型需要连续工作数小时甚至数天,它能否一直记住目标、调用工具、检查结果,并在无人监督的情况下把任务做完。现在,Anthropic带着Fable 5.1回来了。当地时间9月1日,Claude Fable 5.1和Mythos 5.1正式发布,两者使用相同底层模型,区别不在智力,而在安全保护级别。
从版本号看,这只是一次.1升级,但实际变化并不只是修补。新模型在智能体科学研究测试中的成绩超过前代两倍,在编程、知识工作、电脑操作和长时间任务中全面提升;与此同时,Agent工作负载的实际调用成本最高下降约45%。更重要的是,Anthropic这一次没有只谈模型跑分,价格、缓存、数据留存、安全误判、漏洞研究权限和企业部署架构几乎占据了发布内容的一半。
Fable 5.1和Mythos 5.1的关系是理解这次发布的第一把钥匙——同一个模型的两种部署形式。Fable 5.1加入面向公众和企业环境的网络安全、生物安全保护机制,部分任务会被阻止或路由到能力较弱的Opus模型;Mythos 5.1保留更多原始能力,但只能由经过审核的机构访问。Anthropic正在尝试把模型能力和模型开放程度拆开管理,根据用户身份、任务类型与使用环境提供不同层级的能力。

核心能力变化可以概括为:能力上限更高、缓存读取更便宜,但把推理强度拉满,完成一次任务仍可能比前代更贵。在Terminal-Bench 4.0上Fable 5.1得分55.8%,关闭部分限制的Mythos 5.1达到60.9%,两者能力差距很大程度来自Fable安全系统在部分网络安全任务中的介入。在智能体科学研究基准上,Fable 5.1取得52.6%,几乎是前代24.7%的两倍,也显著高于同类模型。
价格调整主要针对Agent反复读取上下文的成本。Fable 5.1缓存读取价格从每百万token 1美元降至0.25美元,降幅75%,标准输入输出价格不变,上下文窗口保持100万token。缓存降价的意义在于:一个长时间工作的编程Agent可能反复读取同一套代码、系统提示、工具定义与任务历史,如果每次工具调用都按标准输入价计算,任务跑得越久重复上下文的成本就越高,缓存让后续读取只付较低费用。

但缓存降价并不意味着所有任务都更省钱。在最高推理强度下,Fable 5.1完成一项智能指数测试任务平均花费3.76美元,比Fable 5高出约20%,因为输出token用量约为前代的1.7倍;即便缓存降价为每项任务节省约1.40美元,也没有完全抵消输出增加的费用。Fable 5.1占据了智能水平与输出token效率的高端帕累托前沿,但不等于美元成本最低,多花的钱能否换来原本做不成的任务,才是开发者真正需要判断的。Anthropic还试图减少走捷径行为,更倾向寻找问题根本原因。投资机构Millennium的一个案例颇具代表性:一段内部代码存在约百万次运行才出现一次的崩溃,工程师花了四五年也没解释清楚,Fable 5.1通过分析外部程序库、比对反汇编结果与核心转储,最终把问题定位到外部库的一个缺陷。外部评审平台的测试则提供了冷静观察:它没有发现更多问题,却减少了大量无效和挑剔式评论,输出变得更克制,代价是速度更慢。
在分子设计实验中,Anthropic让Mythos 5.1调用开源蛋白质设计工具并交由两家外部机构验证,三个靶点的结合剂亲和力比竞赛最佳方案高出10倍;Fable 5.1还用30多年前NASA的雷达数据重新绘制了约三分之一金星表面的高分辨率地图。模型的输出已离开文本环境,开始接受真实世界验证,角色从搜索论文、总结知识,进入提出方案、调用工具、运行计算、接受实验验证的研究闭环。

数据留存问题也有新解法。Fable 5此前默认保留30天使用数据以识别滥用,却成为受监管行业采用模型的障碍。Fable 5.1推出企业级防护架构,日志保存在客户自己的云环境中,用客户管理的密钥与审计系统,风险标记直接交给客户,数据的实际控制权和人工审查权留在企业手中。当Agent开始接触代码仓库、财务资料与生产系统凭证,数据存放在哪里、谁能查看、如何审计,就直接决定模型能否部署。当模型连续工作数小时、涉及多个系统时,重复读取上下文的成本决定了一个模型能不能跑长任务。缓存降价与长任务经济正在把模型竞争从每百万token多少钱,推向完成一个合格任务多少钱。对开发者和企业而言,衡量成本的口径变了,选型逻辑也随之改变,这对聚合多种模型、提供任务级计量的API入口提出了新的要求,也是星战科技在大模型API广场方向上持续完善透明计量与调度的意义所在。