World Labs 于 2026年9月2日正式发布下一代世界模型 Atlas。官方将其定位为面向空间智能的通用世界模型,宣称是全球首个原生处理文本、图像、视频与三维数据的多模态世界模型,采用多模态自回归扩散 Transformer 架构,今日面向合作伙伴开放早期访问,未来将支撑 Marble 等产品。

核心发布与定位

官方在今日上线的新博客中介绍,Atlas 从头预训练,目标是在统一架构内同时完成世界生成、重建与模拟。所有输入均锚定在三维空间形成空间上下文,模型基于该上下文自回归地生成后续多模态输出。官方强调该架构融合了大语言模型的自回归与视频模型的扩散建模思路,可复用 KV Cache、缓存感知路由、扩散蒸馏等加速与质量权衡技术,并具备随算力扩大持续提升的扩展性。

关键能力

  • 相机控制生成:单张至多张参考图像配合显式相机位姿,可实现像素级相机控制,单张图像即可生成约1分钟、1440p 的可控长视频,并支持将两张无关图像置于同一空间上下文中缝合成连续世界 空间重建:支持1至百余张输入图像的稀疏视角重建,可输出新视角图像帧与显式三维点云、高斯泼溅;官方称在2-3张图时即可实现忠实重建,超越专用三维重建模型 时空模拟:可对输入视频同时建模空间与时间,实现多相机“子弹时间”式视频重定向,以及基于手机视频的机器人导航与操作 Real-to-Sim,生成 RGB 与深度传感器视图 图像生成:支持文本生成图像与360°全景图,可遵循复杂提示并准确渲染文字与多样视觉风格

评估与技术边界

World Labs 在博客中披露了两类定量评估。在相机控制生成任务中,以单一图像与1-3段电影级相机运动为输入,由第三方人工评测相机轨迹跟随度,Atlas 优于近期主流视频模型,且轨迹越复杂优势越明显。在稀疏视角三维重建任务中,Atlas 在多个基准上以更低的重建误差超越表现最佳的开源专用重建模型。评估结论均为官方自述,尚未经独立第三方全面复现,实际效果受输入数量、场景类型与相机轨迹复杂度影响。

开放范围与下一步

官方表示 Atlas 已进入合作伙伴早期访问阶段,可通过官网申请,后续将作为 Marble 等产品的底层模型持续迭代。团队同时披露已观察到有利的规模化趋势,未来将继续加大训练规模。限制方面,当前未公布公开 API、价格、可用地域与完整模型卡,早期访问以定向合作为主,具体开放节奏以官方后续更新为准。中国用户可关注官方申请通道及后续中文技术解读。