本次突破的核心在于重构了大模型训练的底层逻辑。传统方法需要分离的奖励模型与策略模型协同工作,而URPO通过独创的数据格式转换器,将偏好数据、推理数据和开放指令三类异构信息转化为统一信号流,直接输入GRPO训练管道。这不仅节省了30%的算力消耗,更解决了多模块协同带来的误差累积问题。 在算力基础设施层面,摩尔线程同步披露了该框架与其自研计算卡的深度适配成果。其特有的张量加速单元能够并行处理模型生成与评分任务,使得URPO在VERL强化学习框架下的训练效率提升2.4倍。这标志着国产AI芯片首次实现训练框架的硬件级定制优化,为未来智能算力集群建设提供了新思路。
文章图片 2
性能验证环节的数据尤为亮眼:基于Qwen2-5.7B基座的URPO模型在AlpacaEval指令榜单斩获44.84分,较传统方案提升6.7个点。更值得关注的是其自我迭代能力——通过内置的奖励循环机制,模型在RewardBench评测中以85.15分反超专业奖励模型,证实了"训练即评估"新范式的可行性。