结论先行
Fondazione Bruno Kessler与都灵大学团队在2026年9月2日首次公开的预印本SAGE提出:不必将昂贵、未微调且不完美的视觉语言模型(VLM)当作每步策略,而是作为训练期的选择性教师,仅在轻量强化学习策略熵高于阈值时查询、执行并通过行为克隆蒸馏内化。作者在FrozenLake、MiniGrid、EZPoints、CardMaze和ALFWorld等稀疏奖励视觉任务上报告,SAGE可在多个环境显著优于无指导PPO,并在CardMaze等案例中超越其VLM教师,同时将训练期VLM调用降至1.2%–13.3%、部署期零调用。该结论来自作者实验,属预印本未同行评审、未获独立验证的局部基准结果。
方法与评估条件
SAGE以策略归一化熵为不确定性代理,超过阈值ν时查询冻结的VLM教师并执行其单步动作建议,使用缓存减少重复查询。学习目标采用分区损失:学习器自采轨迹用PPO裁剪目标,教师引导轨迹排除在PPO策略损失外、通过行为克隆(可选用环境优势加权的AWBC,权重exp(A/τ)并截断至20)蒸馏,价值函数在全缓冲上用环境奖励训练。评估条件为:Qwen3.5-27B(ALFWorld用Gemma3-27B)作教师,PPO为学习器,6个受控环境各训练100k步(ALFWorld 40k步)、3个随机种子,持留种子上无VLM指导评估峰值回合回报;DAgger-VLM作为每步查询基线仅25k步。作者另设无BC、普通BC与规则教师等变体以分离蒸馏与探索的作用。
数据范围限于作者设计的稀疏奖励视觉决策任务,包含程序化生成的FrozenLake 8×8、MiniGrid的LavaGap/GoToDoor/Fetch、算术推理EZPoints、自研的CardMaze(需连续5次正确选卡)及家庭交互ALFWorld,未涉及连续控制或真实机器人数据,5M步长时程对比仅在规则教师下进行。
主要结果
- CardMaze上VLM直接策略约0,SAGE达最优1.0,DAgger亦达0.993,证实该环境中VLM指导可帮助发现稀疏奖励但需蒸馏才能内化 训练期查询率:FrozenLake、EZPoints、GoToDoor、Fetch等1.2%–2.7%,CardMaze 13.3%,显著低于每步查询基线的100% 移除BC后性能在所有环境崩溃,规则教师下亦然,说明仅靠引导探索不足;AWBC与普通BC差异在种子方差内,未证实一致优势 教师分析:Qwen与Gemma在直接策略与作教师时的排序不一致,EZPoints上Gemma直接策略-3.4但作教师可让SAGE达10.0,随机教师则无提升 长时程5M步下,PPO在FrozenLake/EZPoints/CardMaze仍近零,SAGE+规则教师接近最优,提示指导改变了可发现轨迹而非仅加速
局限、是否同行评审与潜在意义
局限包括:预印本状态,EMNLP 2026 Findings标注为期刊引用但论文页仍为arXiv预印本,需同行评审确认;熵代理的粗糙性、仅离散动作验证、对教师信息量的强假设、优势加权未稳健地过滤错误指导,以及ALFWorld等环境的小预算与受控性,均限制向真实具身任务的泛化。作者也在Potential Risks中提示,错误教师指导若恰好带来高回报可能被蒸馏,需人工安全评估。
作者结论:VLMs don’t need to be used as fixed policies to be useful; they can instead act as temporary, imperfect sources of guidance whose value is tested and internalized through interaction. 该判断为作者基于上述受限实验的解释,未经独立验证。
潜在意义在于为中国关注具身智能与RL的研究与工程团队提供一种低成本利用VLM先验的训练范式:训练期按需调用、部署期摆脱VLM依赖,适用于稀疏奖励探索瓶颈场景。落地前仍需在连续动作、真实视觉与物理交互及教师选择机制上进一步验证,并建立独立复现与安全评估。