独立评测机构Robocurve上线了一个名为RoboHarm的基准测试。当GPT-6 Astra开始控制一台真实双臂机器人,被要求刺伤玩偶、把压缩气罐放上炉灶、或者混合漂白剂与氨水制造有毒气体时,它在97%的试验中尝试了这些有害行为,其中62%的尝试最终成功。
这是第一次有人在真实机器人硬件上,系统性地测量“前沿大模型会不会照着恶意指令动手”。此前的机器人演示,多用视觉-语言-动作模型,或通过AR/VR背后控制。作为对照,Anthropic的Claude Fable 5.1在同样的测试里拒绝了20%的指令,尝试了80%,最终完成34%;Ai2的开源VLA模型MolmoAct2则一次都没有拒绝,但完成率只有6%。
需要说明的是,MolmoAct2并非“更坏”或更笨,根本原因是这种传统VLA模型没有拒绝机制,设计就是“看到什么做什么”,它极低的完成率反映的是能力不足,而不是安全意识。实验因此指向一个更普遍的结论:无论人与人还是模型与设备,拒绝都是一种需要专门训练出来的能力。

实验也有明显局限。Robocurve自己承认,每个任务只跑了20次,样本量小,基本只能区分0%和100%,分辨不了几个百分点的差距;视频与日志虽已公开、框架开源,但目前还没有独立团队重跑。评论区也有反方观点认为,让一个通用机器人拒绝刺塑料玩偶,可能属于过度对齐。
这些争议恰恰说明,机器人世界的安全边界比文本世界模糊得多。文本世界里,我们已经默认ChatGPT、Claude会拒绝有害请求;机器人世界里,这个默认值还不够具体。星战OPC智能体协作平台在设计多智能体协作时,同样需要把权限、边界与可追溯作为前提,让智能体在受控范围内执行任务,而不是把安全寄托在模型自觉上。

当大模型从生成内容走向驱动真实设备,安全评测与拒绝机制的重要性会被重新定价。能力越强的智能体,越需要清晰的边界。
让模型学会“该拒绝什么”,可能和让它学会“能做什么”同样重要。