核心发布
北京时间8月28日11时45分,高德(阿里巴巴旗下)通过量子位宣布正式发布流式3D重建模型ABot-Recon。据官方通过专业媒体发布的信息,该模型为首个无长程依赖的万帧级方案:无需长程记忆锚点,仅以连续12帧局部画面即可实时稳定重建上万帧3D场景,实现“边拍边建”。官方同时在GitHub开源推理与评测代码及权重,并在魔搭社区上线在线体验,当前GitHub提交记录显示8月28日仍有更新,与发布窗口一致。
技术路径与关键结果
针对传统流式重建为保持全局一致而保存、检索并融合历史长程记忆,导致序列越长速度越慢、精度越差、显存越高的痛点,ABot-Recon摒弃长程记忆锚点,采用“局部位姿预测+残差优化”路径。每步仅缓存前11帧KV特征,预测当前相机坐标系下的局部点云与相邻两帧相对位姿,再通过在线组合拼出全局轨迹与三维场景;并在预测与训练端加入纠偏与误差约束以限制长程组合漂移。
- - 设计目标:计算复杂度与显存恒定,不随视频长度膨胀; - 精度:Oxford Spires长序列ATE 4.35m,RPE-R 0.12°,为同类流式最优,较行业代表方法Lower约40%; - 速度与显存:KITTI-02上24.45FPS、峰值约6.71GB,约同类三分之一,单张消费级GTX 1080Ti即可运行; - 输入:仅需单目RGB视频,无需深度传感器或已知相机参数。
可用性、限制与下一步
可用性:已提供GitHub与Hugging Face、ModelScope双通道权重,支持Linux、Python 3.10+、PyTorch 2.5.1、CUDA 12.1,在A100验证、H100完成效率基准;提供demo与Python API及可选回环优化后端。限制:评测结论来自官方在KITTI、Oxford Spires、VBR等公开基准的报告,尚未经独立同行评审复现;稠密重建评估在无回环条件下进行,弱纹理、重复结构长廊等场景仍可能累积误差。下一步:官方披露训练代码与配方将于9月30日前发布,开发者可在本地先验证长序列稳定性与显存表现,再规划私域建图试点。
媒体报道显示该结论“让模型走得更远,未必记得更多”;编辑提示:该表述为官方技术解读,实际效果仍取决于具体序列、硬件与部署条件。