核心发布
9月4日,据量子位17:19、新浪科技及网易科技同日报道,星尘智能(Astribot)基座模型团队发布能异步执行的在线强化学习框架 SmoothRL(Online Reinforcement Learning During Asynchronous Execution)。据专业媒体报道,框架于当日集中披露,技术报告已在 Astribot 官网研究页公开,首次将异步在线强化学习放到真实高动态投掷等任务中验证。
解决的问题与核心机制
真实机器人没有暂停键。VLA 等大模型一次生成未来一段动作序列(action chunk),推理耗时数百毫秒,机器人不能每步停下来等待,尤其在投掷类任务中一次停顿就会让已积累的速度归零。实际部署多采用异步推理:机器人继续执行手头动作,模型在后台计算下一段。
异步部署打破了模型生成与机器人执行的对应关系。SmoothRL 将每个 action chunk 按执行状态划分为已提交区域(committed,已被上一轮锁定)、执行区域(execution,当前轮真正执行)与丢弃区域(discarded,会被下一轮替换),核心是仅让梯度通过执行区,机器人真正做了什么就只对什么做强化学习。团队将此原则概括为 Reinforce in Deployment,训练阶段即运行异步推理,replay buffer 记录真实时间关系下的轨迹。实现上采用任务微调后的 π0.5 为基座,沿用 RLT 骨架并以轻量 TD3-style actor-critic 预测 residual correction,S1 以 30Hz 执行、5Hz 推理,每 200ms 产生新 chunk,基座每次预测 32 帧,其中 Committed 与 Execution 共占 12 帧,约 6 帧为本轮真实执行的 Execution Region。
真机验证结果
团队在绳驱双臂移动机器人 Astribot-S1 上验证三项任务,覆盖高动态与高精度双臂操作。动态投掷需在摆动中持续加速并在准确时刻释放,250 个 rollout 节点成功率从 39% 提升至 94%;给笔戴帽需将相对位姿误差控制在约 5mm 内,成功率从 8% 提升至 83%;快递开箱需以约 1mm 刀片插入 2—3mm 接缝并切开胶带,成功率从 30% 提升至 90%,过程中曾在 150 episodes 时从 30% 跌至 20% 后再回升,体现真实在线探索的非单调性。
- 动态投掷 39%→94%(250 episodes);给笔戴帽 8%→83%(约5mm 精度);快递开箱 30%→90%(2—3mm 接缝,1mm 刀片);加速度均方根下降约52%,急动度下降约47%,动作更平滑连续
边界与下一步
据报道,SmoothRL 当前仍有明确边界:要求每次 chunk 推理在预设 latency budget 内完成,轻量 residual 策略受限于冻结基座的表达能力,若基座本身偏离目标过远则难以完全纠正;训练采用稀疏成功/失败奖励,操作员可在必要时介入,介入轨迹可直接用于训练,尚未实现完全无人自主进化。团队下一步计划探索更大范围策略更新、更广任务分布,以及异步执行与生成式策略的端到端联合优化,目标是让具备基础能力的预训练策略在真实世界持续修正、更准更稳。编辑提示:本文依据 9月4日专业媒体报道整理,官方技术报告细节以 Astribot 官网研究页为准。