核心变化
8月17日,Noiz AI与香港科技大学、清华大学、CMU、谷歌DeepMind等机构研究人员联合公开实时可交互音视频世界模型HelixWorld 1.0。官方称,模型以统一Transformer同时生成画面与声音,支持24FPS实时画面与48kHz双声道音频;用户前进、转身等操作会实时改变画面与声场,声音并非事后配轨。
目前GitHub仓库已公开,代码采用Apache-2.0许可;模型权重、推理代码与技术报告预计在接下来几周发布,权重许可将随检查点一并公布。官方称API已进入内测。
性质与限制
以上能力与参数来自Noiz AI的官方公告和媒体报道,尚未发布权重、技术报告或可独立复现的评测。团队称模型以音视频生成基座LTX2.3为起点,通过因果化、KV缓存与轨迹蒸馏实现实时生成;这些仍属官方口径,未经第三方验证。
关注世界模型、可交互视频生成或开源模型的开发者,可留意后续权重与报告发布;在权重开放前,不宜依据演示直接评估其真实可用性。