结论

加州大学洛杉矶分校、圣塔芭芭拉分校、亚马逊与 Robotics and AI Institute 团队于上海时间 2026 年 9 月 1 日 01:59(对应 UTC 8 月 31 日 17:59)以预印本 arXiv:2608.31167v1 首次公开 SUN(Semantically UNified Programs)与系统 Kuafu。核心发现是:将语言接地的几何与接触关系以类型化程序定义一次并在 MPC 验证后持久保留,可显著提升多阶段操纵的控制到学习转换效率与数据质量,在 9 项任务上平均 82.03% 宏观成功、数据训练的视觉策略达 46.02% 且实现 34.72% 真机零样本迁移。但该成果当前为预印本,未经同行评审,评估限于注册场景与固定算子库的受控实验。

方法与评估条件

SUN 程序由大模型从自然语言指令、已注册场景帧与类型化算子库中选择并绑定参数,按阶段组织并为每个关系耦合满足阈值与权重,编译为三类可执行接口:MPC 目标项、阶段完成谓词与 RL 学习项,语义身份在各阶段保持一致。Kuafu 流程为:合成候选程序后以任务空间非线性 MPC 在仿真中闭环筛选,至少 1 次物理成功且无误完成为接受条件,失败至多 5 次整程序修复;接受的程序与 1,000 条成功 MPC 轨迹监督阶段条件行为克隆,随后冻结先验并以有界残差强化学习训练残差策略,奖励由阶段分数、阶段转换、物理成功/误完成与动作惩罚构成,谓词与关系定义在学习中保持不变。评估在 Isaac Lab 仿真中以 8192 并行环境、外部独立评估器 gext 为稀疏成功信号,对比稀疏奖励、Stage-BC、Eureka 迭代奖励搜索与 VoxPoser 在线规划等基线。大模型调用统一使用 GPT-5.5。

数据范围与主要结果

基准涵盖 9 项日常操纵能力:急停交互、堆叠、抽屉操作、物体扶正与重定向、插入与灵巧悬挂等,阶段数 3–15、约束 12–53。结果显示 Kuafu 的协同增益显著:移除程序监督的稀疏奖励变体仅 35.67%,而完整 Kuafu 达 82.03%;三条独立谱系平均 79.43%,误完成率约 0.60%。Eureka 在 5 轮搜索内最佳 18.24% 但终轮回落至 12.85%,VoxPoser 仅 10.00%。跨 horizon 保持性上,Kuafu 从 8 阶段堆叠 95.78% 到 15 阶段 87.25% 仅降 8.53 点,抽屉任务扩展仅降 2.80 点。数据生产方面,500 轨迹每任务的固定 DP3 训练中 Kuafu 数据 46.02% 显著领先 SkillMimic 22.44% 等对照,且在 T5–T7 上对照为 0 而 Kuafu 非零;Q95 合格率 57.3% 与最短路径与平滑动作优于对照,稳态吞吐 246.79 分钟/GPU 小时为人工 10.57 倍。视觉策略 8 种架构均非零,点云最佳达 51.53%,但 15 阶段任务仍存较大差距。

局限与不确定性

作者在结论中明确 scope and limitations:SUN 依赖注册场景与有限算子,无法直接处理可变形物体或流体;未评估留出指令、算子、场景或任务组合,开放泛化待验证;阶段监视器不可回退,Q95 为 MPC 相对指标。实验为作者单次受控报告,视觉与真机部分受限于特定相机配置、随机化与数据量,106 次试验的 34.72% 仅为可行性证据,主要失败为抓取精度,未证明广泛可靠性。局部基准、仿真结果与预印本结论不应外推为普遍、因果或已获学界认可的事实。

是否同行评审与潜在意义

该工作当前状态为预印本,未发表于期刊或会议,需标注为未同行评审,引用与应用应审慎。其意义在于提出持久化、可被 MPC 验证的任务制品作为控制与学习的统一语义核心,将语言交互从每轨执行成本转化为任务级成本,并在数据效率与 sim-to-real 迁移上提供可复现实证,为后续设计更开放的算子、回退机制与校准方法提供了基线,但在规模化部署前仍需同行评审、独立验证与安全性评估。