点击下方卡片,关注「3D视觉工坊」公众号
选择星标,干货第一时间送达
作者供稿直发 | 编辑:3D视觉工坊
3D视觉硬件汇总,包括结构光3D相机(支持室内外,焊接,机械臂抓取等场景),相位偏折术、散斑、机械臂抓取和焊接软件,手持扫描仪(支持定位、重定位、稠密建图)、四足狗和小车定位和导航,底盘。点击->查看详情:
高德视觉技术中心团队开源万帧级流式 3D 重建基础模型:一段普通 RGB 视频,边拍边恢复相机轨迹和稠密三维世界

想象一下:拿着手机在一栋楼里走一圈,行车记录仪沿城市道路开一段,或者让无人机飞过园区。
摄像头只是在不断拍摄普通视频,系统却要一边接收新画面,一边回答两个问题:镜头走到了哪里?沿途看到的道路、墙面和建筑,在三维空间里究竟是什么形状?
它最终输出的不是一段“看过就结束”的视频,而是一条相机运动轨迹,以及一张随拍摄不断生长的三维地图。这就是流式 3D 重建。
几百帧的视频并不难。真正困难的是,当几百帧变成几千、几万帧,每一步极小的方向误差都会被带到下一步:轨迹可能越走越偏,原本笔直的道路逐渐弯曲,同一面墙被重复画出几层,三维地图最终出现重影、撕裂和碎片。
另一种直觉做法,是把看过的画面全部保存下来。但视频越长,模型要维护的历史信息就越多,显存和计算也会跟着增长。
即便再把历史拆成长、短期两套记忆,新旧信息也可能“打架”:近处的细节、远处的轨迹和已经过时的线索混在一起,模型需要不断判断该信谁,处理不好反而会带来干扰和误差累积。
LingBot-Map、HorizonStream 等工作分别用分层记忆、信息衰减等方式解决这一难题。高德视觉技术中心团队最新开源的 ABot-Recon,则给出了一个出人意料的答案:
无论视频已经拍了多久,ABot-Recon 始终使用固定 12 帧局部上下文:当前帧加此前 11 帧。
跑到第 10,000 帧,模型侧仍只维护同样大小的 12 帧局部上下文,学习状态与 KV 缓存不会随着视频长度继续增长。
它不要求神经网络记住此前见过的整个世界,而是努力把每一次局部几何和相机运动预测做得足够稳定,再像拼积木一样,把这些局部结果持续组合成一条全局轨迹和一个不断扩展的三维世界。
目前,ABot-Recon 的模型权重、推理代码和评测代码均已公开。
先看一个结果:连续处理 48,656 帧
在论文展示的望京道路案例中,ABot-Recon 连续处理了 48,656 帧视频。车辆行驶 8.6 公里、持续拍摄 27 分钟,系统在同一次流式运行中恢复出完整轨迹和沿途三维场景。
论文还展示了武汉大学 8.8 公里 / 14,338 帧、北京道路 48 公里 / 14,509 帧,以及浙江大学 11.3 公里 / 11,942 帧等案例。

从城市驾驶、校园探索,到手持设备穿过室内空间、四足机器人在园区中行走,不同载体拍下的视频最终都被放进连续的相机轨迹和三维世界中。
注:上图部分超长序列结果使用了可选 loop closure(回环优化)修正全局轨迹;ABot-Recon 的基础学习模型仍只使用固定 12 帧局部上下文。
固定 12 帧局部上下文,为什么仍能重建长距离空间?
可以把 ABot-Recon 想象成一扇始终向前移动的“12 帧局部窗口”:每一步都使用当前帧与此前 11 帧构成上下文。每来一张新画面,最旧的一帧离开窗口,最新的一帧进入窗口;无论系统已经处理 100 帧还是 10,000 帧,模型面对的始终是同样大小的局部几何问题。它不是总共只处理 12 张图,而是让这扇固定大小的窗口沿着整段视频持续向前移动。

在实现上,窗口由当前帧和此前 11 帧的 KV 特征组成。模型从中预测三样东西:
当前画面中每个位置对应的三维点,也就是一块局部三维“拼图”; 这些三维预测有多可信; 当前相机相对上一帧发生了怎样的旋转和平移。
随后,系统根据相机运动,把每块局部拼图放进统一的全局坐标系。新画面不断到来,轨迹越来越长,三维地图也随之向外生长。

这套设计真正关键的地方,不只是窗口短,而是模型的预测目标不会随着视频变长而变远。第 100 帧和第 10,000 帧面对的仍是相同大小的局部几何问题,因此模型内部状态和单帧计算不会随着序列长度持续膨胀。
换句话说,在模型核心推理侧,第 10,000 帧并不会比第 100 帧背着更多历史包袱。只要把已经生成的轨迹和点云及时交给下游或写出存储,模型侧显存占用不会因为视频继续变长而一路上升。这也是 ABot-Recon 能把同一套固定窗口设计稳定运行到万帧乃至更长序列的关键。
一点点转歪,为什么最后可能差几百米?
长序列最怕的不是某一步出现巨大错误,而是每一步都只错一点点。
想象车辆方向每次只估偏很小的角度。单独看一帧几乎发现不了,但连续组合几千次后,原本向前的轨迹就可能逐渐转向,最终和真实道路相距很远。
ABot-Recon 为此增加了两道专门约束:
运动—视觉旋转修正器(Motion-Visual Contextualized Rotation Refiner):同时参考近期运动趋势和画面中的稠密几何线索,专门修正相邻帧旋转。它只增加约 4.75M 参数,占完整模型约 0.48%。 面向组合的位姿监督(Composition-Aware Pose Supervision):训练时不只检查“这一步走得准不准”,还把多个时间跨度的位姿连接起来,检查连续走很多步之后是否仍然正确,让模型在训练阶段就看到局部小误差累积后的后果。
训练第二阶段把监督序列从 32 帧扩展到 128 帧,但推理时仍使用固定 12 帧局部上下文。更长训练是为了教会模型“如何稳定地连续走很多步”,并不意味着推理时需要保存更长的学习状态。
正面对比 LingBot-Map:三条路线谁更稳?
LingBot-Map 是长序列流式 3D 重建中最受关注的方法之一。它把近期视觉信息、轨迹记忆和姿态参考结合起来;HorizonStream 则让不同时间尺度的信息逐渐衰减。ABot-Recon 的选择更为极简:模型内部不保存持久的长程学习状态,只依赖固定 12 帧局部上下文。
作者使用各方法公开的官方实现和检查点,按时间顺序、stride 1 处理完整序列,并在无回环、逐帧设置下进行统一评测。
如果不熟悉指标,可以这样理解:ATE 衡量“整条预测路线和真实路线总体差了多少”;RPE 更关心“每一小步走得稳不稳”。
KITTI 与 Oxford Spires:ABot-Recon 的平均 ATE 为 18.25 m 和 4.35 m;LingBot-Map 为 29.13 m 和 7.32 m,前者分别降低约 37% 和 41%。 VBR:三种方法的无回环平均 ATE 很接近,ABot-Recon 为 30.14 m,LingBot-Map 为 29.45 m,HorizonStream 为 29.02 m,ABot-Recon 并非这一项第一。但它的平均 RPE-R / RPE-T 为 0.60° / 0.04 m,明显低于 LingBot-Map 的 4.42° / 2.70 m,说明局部相对运动更稳定。启用可选回环后,ABot-Recon 的平均 ATE 可进一步降至 9.99 m。 逐帧效率:在同一张 H100、完整 KITTI-02、输入预加载且不计输入存储的协议下,ABot-Recon 达到 24.45 FPS / 6.71 GB;LingBot-Map 为 19.74 FPS / 18.87 GB,HorizonStream 为 8.02 FPS / 13.04 GB。HorizonStream 的默认多帧模式可以获得更高吞吐,但不是同一种逐帧设置。

换句话说,ABot-Recon 不是靠“记住更多”取胜,而是用一个更短、更固定的模型状态,换取长程精度、逐帧速度与显存占用之间更均衡的结果。
最终分数接近,不代表一路都同样稳定
只看序列结束时的 ATE,容易忽略一个重要问题:模型是从头到尾都很稳,还是前面正常、后面逐渐抖起来?
论文在 4,661 帧 KITTI-02 上统计了相邻帧误差随运行时间的变化。结果显示,LingBot-Map 的旋转误差在序列早期迅速上升,平移误差也随着处理帧数持续增长;ABot-Recon 则在完整序列中保持最低的运行误差,没有出现明显的渐进退化。
落到三维地图上,这种差异意味着:镜头走得越久,墙面、道路和建筑边缘是否仍能对齐,轨迹会不会出现越来越明显的抖动和漂移。

相邻两帧稳定还不够。数千次组合后,局部小误差仍可能变成全局大偏差。为此,论文把时间间隔从 1 帧逐步拉到 512 帧,检查跨越更长距离后的组合误差。ABot-Recon 在所有测试间隔上都取得了最低的平均旋转和平移误差,误差随跨度增长也更慢。

在代表性 KITTI、Oxford Spires 和 VBR 序列中,ABot-Recon 也保留了更完整的轨迹形状和更平滑的局部运动;如果场景中检测到有效重访,可选回环后端还能进一步修正全局漂移。

轨迹画对还不够,墙和道路也要放对位置
流式重建不能只告诉机器人“自己走过哪条路”,还要恢复沿途环境。否则机器人知道自己在哪里,却不知道前面是墙、门洞还是可以通行的道路。
ABot-Recon 会预测稠密局部点图,并随着相机运动在线组合成全局点云。在 Oxford Spires 大尺度地标场景中,它达到CD 1.37 m / F1 91.81%,在论文所列方法中取得最低 CD 和最高 F1;LingBot-Map 为 1.68 m / 90.58%,HorizonStream 为 2.00 m / 84.69%。

这并不意味着 ABot-Recon 在所有场景和指标上都第一。在空间更紧凑、重访更频繁的 7Scenes 和 TUM-Dynamic 上,LingBot-Map 等保留场景级信息的方法仍有优势。
这一结果也说明,固定局部上下文并不是否定全局信息的价值。它更像一套边界清晰、可扩展的流式骨干;当应用中存在可靠重访时,标准回环或图优化仍可作为独立后端接入。
24.45 FPS、6.71 GB,意味着什么?
在单张 NVIDIA H100、504×280 输入、完整 KITTI-02 序列、输入预加载且不计输入存储的测试协议中,ABot-Recon 逐帧达到:
24.45 FPS 流式推理速度
6.71 GB 峰值 GPU 显存

大约每秒处理 24 帧,意味着在该测试设置下,模型吞吐已经接近日常视频帧率;6.71 GB 显存则为后续在更多硬件平台上优化和部署留下了空间。
更重要的是,这不是“只在短片段上测出的 6.71 GB”。由于模型始终只保留固定 12 帧局部上下文,运行到第 1,000 帧、第 10,000 帧,模型侧缓存规模仍然不变,显存曲线不会因为序列变长而持续向上爬。这里的恒定显存指模型学习状态与推理缓存,不包含应用主动长期保留的输入帧或全部输出点云。
ABot-Recon 也不是对比表中绝对最高 FPS 或最低显存的方法。它更突出的特点,是在无回环长程轨迹精度、逐帧吞吐和显存占用之间取得平衡。相较 LingBot-Map,其逐帧速度约快 24%,显存占用减少约 64%。
不止于建图:这套三维表征还能帮助谁?
ABot-Recon 持续输出的并不是一堆彼此孤立的三维点,而是一套随视频不断更新的几何表征:相机当前在哪里、走过怎样的轨迹、场景表面是什么形状,以及不同区域在三维空间中如何排列。
这相当于把持续到来的二维画面,转换成一套可供其他模型使用的“空间坐标系”。
视觉 SLAM 与相机定位:持续预测相对位姿、全局轨迹和局部几何,可为单目视觉里程计、长时程定位以及回环检测、图优化等 SLAM 后端提供稳定的学习型几何输入;固定大小的模型侧状态也更适合持续运行。 长序列三维重建:连续输出的稠密局部点图可以在线组合到统一坐标系,为大尺度场景建图、测绘、数字孪生和变化检测提供可持续扩展的几何底座。 长时程具身感知:机器人可以同时获得“自己在哪里”和“周围空间是什么形状”,为大范围导航、巡检、路径规划和长期交互提供几何基础。 3D 视觉语言模型(3D-VLM):当几何表征与物体、文字和语言语义结合后,模型不仅能回答“这是什么”,还可以进一步理解“它在哪里”“离机器人多远”“两个物体之间是什么空间关系”,让语言推理真正落到三维世界中。 3D 内容生成:连续且稳定的场景几何可以提供结构先验和多视角一致性约束,减少生成结果中的空间错位、结构漂移和视角不一致,并为真实场景的持续扩展与编辑提供底座。 世界模型:它可以作为连接视觉观察、机器人动作和环境变化的几何状态,让模型在统一的三维坐标系中学习“采取一个动作后,相机会移动到哪里,周围空间会如何变化”。

这些下游能力仍需要进一步研究和验证,但 ABot-Recon 提供了一个很有吸引力的起点:不用让内部记忆随着时间无限增长,也能持续构建可被感知、语言、生成和决策模型复用的长时程空间表征。
为什么其他方向的研究者也值得点开这个仓库?
对于视觉 SLAM、相机定位与流式重建研究者,ABot-Recon 提供了一条与长程记忆模型明显不同的固定窗口骨干:从标准 RGB 视频持续输出相对位姿、全局轨迹、稠密点图和全局点云。对于具身智能、3D-VLM、世界模型和 3D 生成研究者,这些输出又构成了可以继续接入语义、生成与决策模块的长时程空间接口。
固定 12 帧局部上下文也让实验边界更容易控制:研究者可以把新的语义模块、回环后端、地图表示或生成模型接在它前后,而无需先继承一个不断扩张的内部记忆系统。
模型权重、推理代码和评测代码已经开放,项目还提供在线体验。对于正在研究长视频、空间智能或具身系统的人来说,这不只是一个值得观看的 Demo,也是一套值得复现、扩展和加入实验工具箱的开源骨干。
固定 12 帧局部上下文并不长。
但当每一步局部几何与相机运动都能可靠地接到下一步,它们就能共同构成一条很长的路,也能逐步恢复一个不断延伸的三维世界——为 SLAM、三维重建、相机定位以及更广泛的空间智能研究提供新的基础能力。
项目已开源
ABot-Recon 已公开模型权重、推理代码和评测代码;训练代码与训练 recipe 计划于 2026 年 9 月 30 日前发布。
Tech Report:https://github.com/amap-cvlab/ABot-Recon/blob/main/ABot-Recon-Tech-Report.pdf
Project Page:https://amap-cvlab.github.io/ABot-Recon-html/
GitHub:https://github.com/amap-cvlab/ABot-Recon
Hugging Face:https://huggingface.co/acvlab/ABot-Recon
ModelScope 模型:https://modelscope.cn/models/amap_cvlab/ABot-Recon
ModelScope 在线体验:https://modelscope.cn/studios/amap_cvlab/ABot-Recon/
如果这条“固定局部上下文 × 可组合几何”的路线对你的研究有启发,欢迎前往 GitHub 体验与交流;也可以直接打开上方的 ModelScope 在线 Demo,上传或更换一段视频,即可快速感受模型从普通 RGB 视频恢复相机轨迹与三维场景的能力。
本文仅作学术与技术分享,具体实验设置与完整结果请以 Tech Report 和项目仓库为准。
本文仅做学术分享,如有侵权,请联系删文。
。




添加微信:cv3d001,备注:姓名+方向+单位,邀请入群。