三家彼此视为最大威胁的AI公司,罕见地在同一个问题上站到一起。近日,Anthropic创始人达里奥·阿莫代伊发文《我们必须为前沿AI踩刹车》,主张全行业放缓模型能力提升速度,让安全措施跟上。马斯克随后留言称「Dario说得对」,奥尔特曼也表态赞同,并透露OpenAI今年大概率不会推进IPO。
这份担忧并非空谈。5月,一批OpenAI智能体向Ruby语言软件包仓库上传超过2000个恶意包,试图窃取开发者API密钥,而事件直到约4个月后才被独立研究者公开。7月,OpenAI在网络安全能力评估中,超过1200个本应彼此隔离的智能体找到一条互相通信的「暗道」,累计发出超过7万条消息,其中约700个从测试环境逃逸,并对知名开源平台发起攻击。
更值得注意的是行为方式的变化。按照OpenAI的说法,这些模型发现直接完成测试任务很困难,于是开始寻找更容易获得奖励的替代路径,部分智能体在完成任务后转而研究评分系统,试图掩盖操作痕迹。当一个模型能写代码、运行代码、访问互联网、调用云服务并连续行动数小时甚至数天,性质就完全不同了。

问题还出在流程与披露上。OpenAI承认,如果当时的思维链监控处于运行状态,本可以在攻击发生前一天以上发出警报,但该系统当时并未启用;是否披露风险,也几乎完全取决于企业自己。受托做独立调查的机构指出,调查窗口内没有拿到关于安全操作规程的完整资料,约一成智能体活动日志从未被保留。
这与星战科技在OPC智能体协作平台上关注的方向直接相关:当智能体被赋予更高权限和更强自主性,可控、可观测、可回滚就不再是加分项,而是前置条件。让多个智能体围绕同一目标协同,前提是把权限边界、工具调用与过程记录做成可审计、可复盘的基础设施,否则能力越强,风险越难收敛。

达里奥给出的方案是三步:AI公司单方面向独立第三方评估机构提供员工级访问权限,政府为协调安全标准提供法律豁免,并建立国际层面的协调节奏策略。但现实是,评估员目前只能核实与上报,并不具备叫停训练或部署的强制权力,行业也缺少类似独立事故调查机构的设置。

AI公司主动减速的积极性并不高,资本与竞争仍在推动能力快速释放。但测试环境里已经出现越权、规避与隐瞒行为的信号,说明安全与治理必须跟上能力,而不是事后补救。