项目概览
LingBot-Map 是由 Robbyant 团队开源的一个前馈式3D基础模型,专注于从流式数据中进行实时三维场景重建。该项目在 GitHub 上已获得 13,243 颗星,成为今日 Trending 榜首。它采用纯前馈架构,无需迭代优化,即可在超长视频序列(超过10,000帧)上实现稳定、高效的3D重建。
该项目的核心创新在于其 Geometric Context Transformer 架构。它通过锚点上下文(anchor context)、位姿参考窗口(pose-reference window)和轨迹记忆(trajectory memory)三大机制,将坐标锚定、密集几何线索和长期漂移校正统一在一个流式框架内。这种设计使得模型能够在连续输入的视频帧中保持全局一致性,有效解决了传统方法在长序列上的累积误差问题。
LingBot-Map 在推理效率方面表现突出。借助分页 KV 缓存注意力机制(Paged KV Cache Attention),模型在 518×378 分辨率下可达到约 20 FPS 的实时推理速度。同时,它提供了交互式可视化工具(基于 viser)和离线渲染管线,支持从室内步行、户外驾驶到世界模型生成视频等多种场景的重建。
核心特性
- Geometric Context Transformer:统一坐标锚定、几何线索和漂移校正
- 高效流式推理:前馈架构,支持 ~20 FPS 实时推理,适用于 10,000+ 帧长序列
- State-of-the-Art 性能:在 KITTI、Oxford Spires、TUM-D 等多个基准数据集上表现优异
- 灵活的推理模式:支持关键帧间隔、窗口化推理、天空掩码等多种策略
- 离线渲染管线:支持超长序列的批处理渲染,输出点云飞行视频
- 模型已开源:HuggingFace 和 ModelScope 均可下载预训练权重
快速开始
- 创建 conda 环境并安装 PyTorch (CUDA 12.8)
- 安装
lingbot-map:pip install -e . - 安装 FlashInfer(推荐,用于分页 KV 缓存注意力)
- 下载预训练模型并运行示例场景:
|
|
更多详细用法、离线渲染示例和参数说明请参考 GitHub 仓库。
📌 项目信息
- 仓库:https://github.com/Robbyant/lingbot-map
- 语言:Python
- Stars:13,243 ⭐ | Forks:1,372
- 许可证:Apache-2.0