星尘智能发布SmoothRL框架,解决机器人异步推理下的在线强化学习难题
星尘智能基座模型团队发布SmoothRL,一种面向异步执行的在线强化学习框架,旨在解决大模型推理速度慢导致机器人无法实时决策的问题。该框架在真实高动态投掷任务中验证,成功率从39%提升至94%。
核心事实
星尘智能(Astribot)基座模型团队近日发布SmoothRL(Online Reinforcement Learning During Asynchronous Execution),一种能异步执行的在线强化学习框架。该框架针对大模型异步推理成为真实部署常态后,在线强化学习应如何从动作中学习的问题。SmoothRL将异步action chunk划分为已提交区域(committed region)、执行区域(execution region)和丢弃区域(discarded region),并只让梯度穿过执行区域,即机器人真正执行的动作。团队在绳驱本体星尘智能S1上测试了三项真机任务,包括动态投掷(成功率从39%提升至94%)、给笔戴帽(从8%提升至83%)和快递开箱(从30%提升至90%)。
背景与影响
传统在线强化学习假设模型生成动作后机器人立即执行,但异步推理打破了这一对应关系。SmoothRL通过让训练和部署遵守同一套时间节奏,在训练rollout中直接运行异步推理,实现“在部署中强化学习”。该框架旨在解决机器人进入真实环境后,基础策略虽具备基本能力但存在微小偏差的问题,通过在线后训练修正这些偏差,提升准确性和动作平滑性。例如,在动态投掷任务中,经过在线RL后,末端执行器的加速度均方根下降52%,急动度下降47%。SmoothRL由星尘智能王佳楠担任项目负责人,高广、农宇轩为共同第一贡献者,黄百富参与研究。
限制与来源
当前实现要求每次chunk-level inference在预设延迟预算内完成,且轻量residual policy的表达能力受冻结基础策略限制。若基础策略本身离目标行为太远,局部residual correction可能无法补救。训练过程中操作员可介入,介入动作可直接用于后续训练,因此并非完全无人参与的自主进化。技术报告见www.astribot.com/en/research/SmoothRL。本文由星尘智能提供,量子位获授权转载,观点归原作者所有。具体性能数据以官方报告为准。