从GitHub爆火到ECCV Oral,全球开发者把LingBot-Map玩出新高度
机器之心
2026-09-11
热度4461

蚂蚁灵波开源的LingBot-Map是一种流式3D重建基础模型,仅用单颗RGB摄像头即可实时完成相机位姿估计与场景三维结构重建,提出几何上下文注意力(GCA)机制,通过锚点、局部窗口和轨迹记忆三层结构实现高效长序列处理,在ECCV 2026获Oral论文认可,显著提升位姿精度与重建质量,推动机器人空间感知从‘看见’迈向‘记住’。

摘要由 Mars AI 生成
本摘要由 Mars AI 模型生成,其生成内容的准确性、完整性还处于迭代更新阶段。

机器人正在学习一种曾经只属于人类的能力:记住自己走过的世界。

第一次进入陌生房间时,人不会把看到的一切逐帧存储下来。我们会记住关键结构:门在哪里,桌子在哪里,刚才经过的位置,以及自己现在处于什么位置。

正是这种选择性记忆,支撑了人类在复杂环境中的持续行动。对于机器人来说,这也是走向真实世界必须解决的问题。

今年 4 月,蚂蚁灵波开源的流式 3D 重建基础模型 LingBot-Map,正是在「机器人如何记住空间」这一核心问题上,探索出了一条新的技术路线。无需复杂硬件,仅靠一颗普通 RGB 摄像头,就能让机器人在视频采集过程中,实时完成相机位姿估计与场景三维结构重建,从而填补了实时空间感知领域的关键技术空白。

在穿越多房间的长序列中,面对环境剧变与大幅视角变换,LingBot-Map 依然能表现出极强的鲁棒性

截至目前,LingBot-Map 官方 GitHub 项目已获得 16.9K Stars、1.9K Forks,并多次登上 GitHub Trending,成为 3D 视觉领域备受关注的开源项目之一。

  • 项目地址:https://github.com/Robbyant/lingbot-map
  • 论文地址:https://arxiv.org/pdf/2604.14141
  • 论文主页:https://technology.robbyant.com/lingbot-map
  • Hugging Face 链接:https://huggingface.co/robbyant/lingbot-map
  • ModelScope 链接:https://www.modelscope.cn/models/Robbyant/lingbot-map

令人惊喜的是,现在这项研究迎来新的认可。

其论文《Geometric Context Transformer for Streaming 3D Reconstruction》入选 EC CV 2026 Oral,将于会议期间进行口头报告。在昨天 EC CV 的开幕式上,机器之心前方编辑还在 Award Candidates 的名单中看到了这项工作。

从 GitHub 社区的高度关注,到顶级视觉会议的认可,LingBot-Map 完成了从开发者生态到学术界的双重验证。

更重要的是,它背后反映出一个变化:机器人空间感知的竞争,正在从看见世界,走向记住世界。

顶会认可之前,LingBot-Map 已完成开源社区验证

在入选 EC CV Oral 之前,LingBot-Map 已经在开源社区收获了一大波关注,开发者围绕这个项目进行了各种二次开发

有人快速完成复现验证,有人把它搬到不同硬件环境中尝试运行,也有开发者开始探索新的空间数据采集方式。

每个人的玩法都很有趣,这种来自社区的主动探索,往往比单纯的 Stars 数量更能说明它的生命力。

让更多人能够快速体验:从部署到可视化

对于许多研究项目,论文公开并不意味着普通开发者能够真正使用。环境配置、依赖安装、结果展示等环节,往往成为从论文 Demo 到实际体验之间的距离。

LingBot-Map 开源后不久,就有开发者制作了可在 Apple Silicon Mac 上本地运行的原生桌面前端和 3D 点云查看器,让用户能够更加直观地查看模型生成的空间重建结果。

来源:https://github.com/donalleniii/lingbot-desktop-mac

与此同时,也有开发者基于 Pinokio 制作了一键启动方案,将环境配置、依赖安装以及 Demo 运行流程进一步封装,让没有复杂配置经验的用户也能够快速体验 LingBot-Map。

来源:https://github.com/cocktailpeanut/lingbot-map.pinokio

这些尝试补齐了从研究成果到开发体验之间的重要环节,让更多用户能够真正接触和使用这一流式 3D 重建模型。

更多设备运行:消费级硬件适配

除了优化使用流程,开发者也开始尝试扩展 LingBot-Map 的硬件适用范围。

开发者 ureeey 针对 RTX 4060 8GB 显存设备进行了适配尝试,通过优化运行策略降低显存压力,让 LingBot-Map 能够运行在更轻量的 GPU 环境中。

来源:https://github.com/ureeey/lingbot-map-rtx4060-8g/blob/main/README.md?utm_source=chatgpt.com

这类尝试背后的意义在于:当模型不再局限于高配置工作站,而能够进入更多普通开发环境时,技术才有机会被更多人测试、改造和应用。

从摄像头到智能眼镜:探索新的采集入口

在 X 平台上,有开发者关注到,过去部分高精度三维扫描任务通常依赖专业 LiDAR 设备,或者需要复杂的离线优化流程,而传统方法在长时间连续输入下也容易面临稳定性挑战。

相比之下,LingBot-Map 通过普通视频流实现实时流式重建,仅需单 GPU 即可运行,达到约 20 FPS,并能够处理超过 10,000 帧的长序列输入。

来源:https://x.com/XAMTO_AI/status/2080900857235726635

在这些开发者看来,LingBot-Map 展示了一种更加轻量的空间感知路径:降低对专用硬件和复杂流程的依赖,让实时三维重建能力有机会进入机器人、AR/VR、自动驾驶等更多场景。

基于这一点,真有人进一步将 LingBot-Map 接入消费级设备。

他将 Ray-Ban Meta Gen-2 智能眼镜(无需 LiDAR)改造成 3D 扫描设备,通过手机 App 采集数据,并调用部署在 RunPod 上的 LingBot-Map 后端,在约 30 秒内完成所在空间的三维建图。即使使用较少的视频帧,室内场景仍能获得较好的重建效果。

来源:https://x.com/0x6rss/status/2079597540568137866

除了智能眼镜,这位用户在普通戴尔台式机上运行 LingBot-Map,仅对着办公桌进行一次视频采集,约 61.5 秒后便获得了一个可交互浏览的三维点云模型。

来源:https://x.com/shavonnewong_/status/2080130333094101360

而这些,只是 LingBot-Map 开源之后社区探索的一部分。对于一个 3D 视觉研究项目而言,这种持续的二次开发并不常见,这表明 LingBot-Map 已经开始进入真实的使用场景。

开源之后,团队也在持续更新评测脚本、推理优化、示例案例以及问题修复,进一步提升项目的可用性和稳定性。与此同时,官方还展示了超长视频重建结果:在约 25,000 帧、持续 13 分钟的室内行走视频中,LingBot-Map 仍能保持连续重建,生成完整的三维空间表示。

当然,社区热度只是其中一面。对于一项研究成果而言,真正决定其长期影响力的,仍然是它是否解决了领域中的关键问题。

ECCV Oral 背后,LingBot-Map 如何重新设计机器人空间记忆?

那么,LingBot-Map 究竟解决了什么问题?为什么一个流式 3D 重建模型,能够吸引开发者持续扩展,又能够获得 EC CV Oral 的认可?

答案需要回到机器人空间感知中最核心的挑战:如何让机器人在不断增长的视频输入中,既保持对空间的长期记忆,又避免计算和存储成本随着时间无限增加。

对于机器人而言,3D 重建需要边走边理解环境。机器人看到当前画面,需要同时回答现在看到的位置在哪里?过去走过的区域和当前画面之间是什么关系?

这意味着模型需要持续估计摄像头轨迹,并生成对应的深度信息,最终形成不断扩展的三维地图。

流式重建相比离线重建,要面对一个核心矛盾:保留更多历史信息,可以提升空间一致性;但历史越来越长,也会让计算和存储成本快速增长。

现有方法大致采用三种路线。

一种方法类似记住全部历史。例如基于 causal attention 的方案,会缓存之前所有帧的信息。这样模型拥有完整上下文,但随着序列增长,显存和计算量也不断增加。

另一种方法选择压缩历史状态,例如循环网络式结构。但压缩过度可能导致模型遗忘关键几何信息,长时间运行后出现轨迹漂移。

还有一些方法结合传统 SLAM,通过关键帧选择和优化算法维持稳定性。但这类方法依赖人工设计的规则,并且需要额外优化过程,难以兼顾实时性。

因此,真正困难的问题是机器人面对不断增长的视频流,哪些空间信息必须保留,哪些信息可以舍弃?

LingBot-Map 将这个问题称为 streaming reconstruction 中的 context management(上下文管理)。它希望让模型像人类空间记忆一样,只保留最重要的几何线索,而不是记录所有观察

GCA:把空间记忆拆成三层,让模型知道该记什么

为了解决这个问题,LingBot-Map 提出了 Geometric Context Attention(GCA,几何上下文注意力)

它的核心思想来自传统 SLAM:一个稳定的空间系统,通常需要三类信息:一个固定参考点,用来确定坐标;附近区域的信息,用来判断当前位置;长距离历史,用来避免累计漂移。因此,GCA 将流式状态拆成三个部分。

LingBot-Map 流程。该框架处理相对于初始化集 [T, T) 的当前视图。DINO 骨干网络提取图像特征,然后通过交替的帧注意力层和 GCA 层进行细化。在 GCA 模块中,输入视图聚合来自锚点上下文、局部姿态参考窗口 [T, T] 和轨迹记忆上下文的信息。最后,特定任务的头部预测相机姿态和深度图,从而实现对长序列的鲁棒、内存高效的流式 3D 重建。

第一层:Anchor Context,建立空间坐标。负责记住「我从哪里出发」。它为整个三维坐标系提供稳定基准,空间重建最怕坐标漂移,有了锚点,模型在处理第一万帧时,仍然清楚第一帧发生在什么位置。

第二层:Local Pose-Reference Window,保持局部精确定位。用来负责捕捉当前位置附近的局部几何细节。这相当于对「我身边有什么」保持清醒的即时感知,保证了逐帧重建的精度。

第三层:Trajectory Memory,压缩长期历史避免漂移。这是整个架构中较为关键的设计。它把庞大的历史信息压缩成极其紧凑的逐帧 Token,以较低的存储代价保留对过去路径的「印象」。正是这一机制,让 LingBot-Map 的内存消耗几乎不随视频长度增长,处理 100 帧和处理 10000 帧,总的计算量和内存占用维持在几近相同的水平。

这种设计带来的效率提升相当可观。在 1 万帧序列中,传统 causal attention 需要约 500 万 token;GCA 只需要约 7 万 token,足足压缩了近 80 倍,且每处理一帧新画面,计算量和内存消耗几乎不随总帧数增长。

注意力掩码比较。每个方框代表一帧的 Token,由一小段上下文 Token 和一段较大的图像 Token 组成。(a) 全注意力(Full attention)会关注所有帧。(b) 因果注意力(Causal attention)支持流式处理,但计算开销随序列长度线性增长。(c) 滑动窗口注意力(Sliding-window attention)虽然限制了计算成本,但会丢失长程上下文。(d) GCA 将流式上下文划分为锚框 (n=2)、局部窗口 (k=2) 和轨迹记忆,在保持计算成本随序列长度增加而近乎恒定的同时,保留了丰富的长程上下文信息。

在基准测试上,它表现如何?

实验也验证了 LingBot-Map 有效性。

团队首先在 Oxford Spires 数据集上进行测试,并以两种设置分别测试模型的短程定位能力和长程稳定性。

在稀疏设置中,团队选取 320 帧图像(每隔 12 帧采样)测试,LingBot-Map 在几乎所有指标上都取得了最佳结果。

尽管 LingBot-Map 采用的是流式在线推理方式,但其性能仍大幅超过最强的离线基线方法。具体来看,LingBot-Map 的 AUC@15 达到 61.64,明显高于最佳离线方法 DA3 的 49.84,并超过 VGGT 的两倍以上(VGGT 为 23.84)。在轨迹级别的精度指标上,LingBot-Map 将 ATE 从 DA3 的 12.87 米、VGGT 的 24.78 米降低到了 6.42 米。

相比依赖跨帧重投影误差优化的传统优化方法,LingBot-Map 同样取得了更优表现。它超过了表现最好的优化方法 VIPE,在位姿精度(AUC@15:61.64 vs. 45.35)和轨迹一致性(ATE:6.42 vs. 10.52)两个指标上均取得优势。

而在在线流式方法之间的比较中,优势更加明显。其他流式方法普遍存在严重的记忆遗忘问题:随着序列不断增长,模型会逐渐丢失过去观察到的几何信息,最终导致累计漂移。LingBot-Map 分别达到 61.64 和 6.42,在位姿精度上提升约 10 倍,在轨迹误差上降低约 2.8 倍。

在密集设置(完整 3840 帧)下,团队进一步对模型的长序列流式重建能力进行了压力测试。随着轨迹长度从 320 帧增加到 3840 帧,大多数前馈式方法都会因为累计漂移问题出现明显性能下降。

相比之下,LingBot-Map 始终保持较低的误差水平,ATE 仅从 6.42 增加到 7.11。在序列长度扩大 12 倍的情况下,误差只增加了 0.69。

这说明 GCA 的三层上下文结构 —— 包括 anchor context、trajectory memory 和 local window—— 能够在无需显式优化或回环检测(loop closure)的情况下,有效保持长距离几何一致性。

值得注意的是,LingBot-Map 在保持最高轨迹精度的同时,还达到了具有竞争力的推理速度,运行速度达到 20.29 FPS,在所有流式方法中实现了最佳的轨迹估计效果。

在生成高质量三维地图方面,团队在 ETH3D、7-Scenes、NRGBD 三个数据集测试点云重建。LingBot-Map 均取得最高 F1 分数。

在 ETH3D 数据集上,LingBot-Map 的 F1 达到 98.98,相比第二名 Wint3R 的 77.28 提升了 21.70 个百分点。说明 LingBot-Map 生成的重建结果不仅更加精准,也覆盖了更加完整的场景结构

在 7-Scenes 数据集上,LingBot-Map 的 F1 达到 80.39,并在 Accuracy(0.02)和 Completeness(0.07)两个指标上均取得最佳表现。

在 NRGBD 数据集上,LingBot-Map 的优势更加明显,其 F1 达到 64.26。NRGBD 包含大量复杂室内环境以及精细几何结构,在这类场景中,其他方法由于累计位姿漂移,容易导致重建结果出现表面模糊或结构重复的问题。而 LingBot-Map 具备更强抗漂移能力的轨迹估计,可以直接提升这类场景下的重建质量

下图是定性对比结果。在较简单的场景中(图中上方几组),TTT3R 和 Wint3R 已经出现建筑边缘错位的问题。随着场景复杂度增加(中间几组),竞争方法开始出现重复结构和模糊表面,这是由于累计位姿漂移导致同一几何结构被投影到了不同位置。

在最具挑战性的多建筑室外场景中(底部几组),差距更加明显:TTT3R 和 Wint3R 几乎完全失去空间一致性,生成的点云出现坍缩和碎片化,甚至无法区分独立建筑。相比之下,LingBot-Map 始终保持清晰的几何结构、锐利的建筑边缘以及连续的墙面表面,说明 GCA 提供的长期几何一致性能力能够直接转化为高质量的 3D 重建效果。

点云重建的定性比较。

从一个模型,到一套机器人空间感知体系

其实回看蚂蚁灵波的技术布局,LingBot-Map 并非孤立存在。

对于机器人而言,真正的空间理解并非单一能力。它首先需要看懂眼前的环境,随后需要准确判断距离,最后,还需要把连续观察到的信息整合起来,形成对整个环境的长期记忆。

围绕这三个环节,蚂蚁灵波已经布局了 LingBot-Vision、LingBot-Depth 和 LingBot-Map,分别对应视觉结构理解、高精度空间感知以及持续空间记忆

其中,LingBot-Vision 提出的思路,是让模型重新关注图像中的边界。它认为,物体轮廓和形状变化区域包含大量几何信息,是机器人理解空间的重要线索。基于此,团队提出掩码边界建模(Masked Boundary Modeling),让模型无需人工标注或额外边缘检测器,就能自主学习亚像素级边界表示,并利用这些边界信息增强视觉表征。

LingBot-Depth 的关键洞见是将传感器缺失视为可学习的信息,而非单纯的噪声。通过掩码深度建模(Masked Depth Modeling, MDM),模型能够结合 RGB 图像中的视觉上下文,推断缺失区域的深度信息。这样,机器人不仅能看到物体,还能更准确判断物体在三维空间中的位置关系,尤其在处理透明、反光、密集物体时表现突出。

LingBot-Map 则进一步解决记住的问题,通过流式 3D 重建能力,将连续视频中的视觉信息组织成稳定的三维空间表示,让机器人能够在不断移动过程中更新环境认知,并保持对已经探索区域的记忆。

三者结合起来,形成一条从感知到理解再到行动的空间智能链路。

当机器人能够持续感知、理解并记忆周围环境,它才有可能完成更复杂的导航、巡检、操作和任务执行。LingBot-Map 所推动的,正是机器人从看到世界走向理解并利用世界的关键一步。

本文来自微信公众号 “机器之心”(ID:almosthuman2014),编辑:陈陈

本内容旨在传递行业动态,不构成投资建议或承诺。
为你推荐

商务合作:TG:@Lottie96