真实机器人没有“暂停键”。主流的视觉语言动作模型往往一次生成未来一段时间的动作序列,模型越大、推理时间越长,但机器人不能每隔几百毫秒就停下来等下一段动作。尤其在投掷这类高动态任务里,一次停顿就可能让积累的速度掉下来,导致整个任务失败。 因此真实部署更常见的是异步推理:机器人继续执行手头的动作,模型同时在后台计算下一段——手上做A,模型已经在算B。但这给在线强化学习出了难题:模型一次生成一段动作序列,真正进入物理世界的往往只有其中一部分,模型“计划过”的动作与机器人“真正做过”的动作不再一致。 近日,星尘智能基座模型团队发布能异步执行的在线强化学习框架SmoothRL。它把一段动作序列按执行状态分成三区:已提交区、执行区与丢弃区。核心思想很直接——机器人真正执行了什么,就对什么做强化学习,只让梯度穿过实际会执行的那部分。
文章图片 2
它还有第二条原则:在部署中强化学习。训练rollout里直接运行异步推理,用回放缓冲区记录真实的时间关系轨迹,让训练与部署遵守同一套时间节奏。实现上以针对各任务微调后的π0.5为基础策略,用轻量TD3风格的actor-critic在原始动作空间上预测残差修正;星尘S1以30Hz执行动作,每200毫秒收到一段新的推理结果。 测试跑在星尘S1绳驱本体与三项真机任务上:动态投掷成功率从基础策略的39%提升到94%;给笔戴帽允许约5毫米位姿误差,成功率从8%提升到83%;快递开箱要插入约2毫米宽的箱盖接缝,成功率从30%提升到90%。一次真实自主投掷中,末端执行器加速度均方根下降52%、急动度下降47%,动作明显更平滑。
文章图片 4
作者也划清了边界:强化学习不是从零教机器人,而是把“基本会做的策略”继续练到足够准确;当前用的是稀疏的成功/失败奖励,操作员可以介入,介入动作属于原始动作空间并可用于后续训练。它要求每段推理落在预设的时延预算内,轻量残差策略的表达能力也受冻结基础策略限制。
文章图片 6
更值得关注的是它对算力形态的暗示。异步推理要求模型以固定节奏、低时延地给出下一段动作,推理必须靠近本体或至少足够稳定,而训练与微调仍依赖云端的大规模GPU集群。当机器人智能的竞赛从模型层延伸到真机后训练与实时推理,云边端协同的算力调度会越来越关键,这正是星战科技在GPU算力平台与算力调度上持续投入的方向。