结论先行
腾讯、新加坡国立大学与香港理工大学团队于2026年9月2日(上海日历日,对应1 Sep 2026 17:21:40 UTC)首次公开的预印本H3-World提出:无需为视频生成器新增专用动作模块,通过将角色与相机的低层控制转为结构化自然语言指令并注入MiniMax-H3原生文本通道,再以潜在对齐时序绑定与单出口路由保持时序精确性,即可以轻量LoRA将33B参数的MiniMax-H3转为交互式世界模型。作者在受控游戏数据上报告,仅8000条样本、10000步优化与0.199%可训练参数即可实现角色与相机精确控制,并泛化至训练未见的字符-相机组合与多类分布外视觉场景。该结论来自作者受控实验的预印本报告,未同行评审、未获独立验证,属局部基准结果。
方法与评估条件
方法上,H3-World将每段视频潜在区间对应的键盘状态聚合为字符指令与相机指令的组合(9×16=144种理论组合,135种有效),映射为如“the man walks backward and strafes left, camera pans right slowly.”的短文本,经共享编码器与双层token精炼器编码后,与静态语义条件、首帧外观条件及视频潜在区间按时间顺序打包为单序列。MiniMax-H3的单流自注意力处理该序列,单出口路由掩码限制每段动作span仅能被同span与对应视频潜在读取,视频潜在间保持双向注意力以传递视觉效应;仅对注意力QKV与输出投影及精炼器施加rank 32 LoRA更新,骨干、编码器与VAE冻结,沿用原生去噪目标训练。
评估条件为:数据来自ABot-World-Explorer-500h的7872条训练片段与128条持留片段,每段124帧、24fps、832×480分辨率,每段提供37条潜在对齐提示;训练学习率1e-4、10000步,推理生成124帧、50步去噪。评估采用配对控制干预(固定首帧、种子与采样,仅改变调度动作)与持留片段的前帧加动作条件生成对比,通过光流法累积水平流等诊断量化相机运动,并以定性帧采样展示角色与视角变化。
主要结果
- 受控相机左右切换(前15段左慢速、后22段右快速)中,H3-World产生+52.7与-106.0的累积水平流,反向调度为-58.7与+121.0;全局提示仅小幅单向响应,零LoRA的逐潜在接口几乎静止,证实适配对时序绑定是必需的 常量单向相机指令下,H3-World与全局提示方向分离相当(约300.5 vs 301.8),说明预训练已具粗粒度语言控制,H3-World将其转为精确时序控制 加性偏置与FiLM等直接动作条件化在持留片段上响应弱或不一致,文本接口产生协调的角色与相机变化,跟随记录动作的持留生成保持场景与主体外观 135种有效组合中训练覆盖83种,未见组合中字符与相机分量各来自已见组合,H3-World在持留游戏与分布外观测上均正确执行未见组合,显示组合泛化 6类分布外初始观测(第三/一人称、室内外、奇幻/科幻、多渲染风格)中,同一接口产生对应角色或相机响应并保持布局与风格,支持轻量适配保留广域生成能力
局限、是否同行评审与潜在意义
局限在论文第5章明确列出:当前聚焦短时段生成,组合与视觉泛化以代表性示例为主,缺乏更系统的跨组合、场景与随机种子定量评估;模型生成固定长度段,尚未提供持久世界状态、实时交互、规划或策略学习,向长周期交互世界模型仍需扩展;所有结果限于作者自采游戏域,是否向真实物理交互泛化未证实。
作者原话:language already acts as a coarse control interface for strong text-to-video models;language is emerging as a natural interface for control。该判断为基于MiniMax-H3观测的作者解释,属预印本结论,尚未独立验证。
是否同行评审:arXiv:2609.01560v1为预印本,标注提交历史Tue 1 Sep 2026 17:21:40 UTC(对应上海9月2日),未标注期刊或会议接收,尚未同行评审,需等待后续审议与独立复现。潜在意义在于为关注世界模型与视频生成的研究与工程团队提供一条低成本路径:复用大规模视频预训练的语义表征,以语言为动作抽象层实现精细时序控制,避免新增专用控制模块与大规模重训;但该路径现阶段仅验证短时段视觉动力学,落地至持久交互、规划与控制仍需系统验证与安全评估,局部光流与示例结果不得夸大为普遍或已获验证的因果能力。