结论:北京 Across Physical AI 与中国科学院自动化研究所团队于上海时间2026年8月31日通过 arXiv 首次公开预印本 AcrossVAM1.0,核心结论是:以冻结语义感知定义粒子、轻量Transformer预测运动、因果外观流恢复纹理的分解式设计,可在异构真机视频上稳定降低轨迹误差并提升运动区图像质量,但在全局感知指标、语言接地与跨机型迁移上仍存在明确局限。该结论来自作者在VRS基准上的受控测量,尚未经同行评审或独立验证,不应外推为通用世界模型能力或已获学界共识。
研究对象与方法
研究针对机器人视频预测中静止像素占主导、关节运动关键但易被末帧复制掩盖,以及语言指令与视觉轨迹弱关联的问题。方法上,团队构建冻结的SAM3-DLP粒子编解码器,对每帧提取对应整机、机械臂与夹爪的三语义粒子(位置、尺度、深度、存在度与外观)及背景潜在,经匈牙利匹配对齐身份;动力学模块为宽度64、2层4头的因果时空Transformer(约0.28M参数),以残差形式自回归滚动粒子状态,并以零初始化的FiLM将冻结OpenCLIP指令嵌入注入各块;解码端冻结粒子渲染器生成结构提议,稠密外观编码器仅观测末帧,结合条件残差先验、精炼器与学习型投送掩码合成未来5帧,未来外观、掩码与粒子真值仅作训练目标,推理时不泄露。
评估条件与数据范围
数据为作者从DROID类真机轨迹构建的Video Robot Segmentation(VRS)基准,共2,746段带部素材掩码与指令的片段,划分2,526/106/105用于训练/验证/测试,评估用92段共460帧未来帧、编解码重建用48段、轨迹诊断用368窗口,涵盖Franka、WidowX、Mobile ALOHA、Google Robot等10类平台,帧尺寸128×128,采样9帧窗口步长3,观测4帧预测5帧。指标包括全局PSNR/SSIM/LPIPS与膨胀后运动/前景区PSNR,基线为持久复制末帧,另设粒子真值与像素最优选择两类不可部署上界作对照;检查点与混合阈值在验证集一次性选取后在测试集单次评估。
主要结果(作者报告,未独立验证)
作者报告:去除外观捷径、采用步长3后,粒子动力学在多种子下较持久复制轨迹误差平均降低21.0%,原始粒子生成运动区PSNR提升1.34dB但全局SSIM下降;残差投送恢复静态保真度,使全局PSNR/SSIM分别提升约0.61dB/0.0044而保留大部分运动优势,投送掩码三种子分散仅0.009dB/0.0002,LPIPS仍差0.0082,至像素最优选择尚有1.55dB差距。基线完整复现尚未完成,作者将FitVid等5方法列为待重训队列,未直接移植其他数据集分数。语言对照中,正确文本较打乱文本轨迹误差仅低2.8-3.1%,而伪文本与随机标签近零差距,作者据此将模型定位为文本辅助;Franka(136窗口+21.1%)、WidowX(68窗口+19.0%)提升,非Franka聚合+10%,但Mobile ALOHA(60窗口-16.1%)与Google Robot等退化。以上均为作者在固定协议下的测量,未经独立复现。
作者明确指出:显式粒子动力学是机器人视频预测有前景的低维接口,但稳健的语言接地与外观投送仍是主要开放挑战;轻量仅指可训练动力学核心,总部署内存仍含冻结大模型。
局限与同行评审状态
该工作为arXiv:2608.28491v1预印本,于2026年8月28日16:19 UTC提交、按arXiv 14:00 UTC截点于8月31日00:00 UTC(上海8时)公告并归入当日cs.AI新列表,尚未经期刊或会议同行评审。关键限制包括:仅5帧128分辨率预测、依赖部素材掩码的编解码、短时域视频指标而非闭环控制;全局增益温和且LPIPS未超越基线,投送校准不完善;语言效应小、跨机型不一致;公开基线的同协议重训与多种子端到端不确定性尚未完成。局部基准、模拟结果与相关性不得写作普遍因果或已获同行认可的事实,往日研究不得作为当日资讯补发。
潜在意义与适用边界
若后续在更广分辨率、长时域、更多机型与同行评审中得到验证,该分解式粒子世界模型为可解释的视频动作模型提供了可诊断的运动接口与可控的外观恢复路径,有助于在不掩盖失败模式的前提下进行离线分析与数据生成。适用性取决于部素材分割可用性、冻结感知与语言塔的部署成本、投送掩码的校准与不确定性建模,以及与闭环策略的联合评估。团队已明确其为研究原型,不应用于安全控制器,数据可能含机型与实验室偏置。