Featured image of post GitHub Trending 榜首:lingbot-map

GitHub Trending 榜首:lingbot-map

一个前馈式3D基础模型,用于从流式数据中重建场景。支持高效流式推理,在超过10,000帧的长序列上达到约20 FPS。

项目概览

LingBot-Map 是由 Robbyant 团队开源的一个前馈式3D基础模型,专注于从流式数据中进行实时三维场景重建。该项目在 GitHub 上已获得 13,243 颗星,成为今日 Trending 榜首。它采用纯前馈架构,无需迭代优化,即可在超长视频序列(超过10,000帧)上实现稳定、高效的3D重建。

该项目的核心创新在于其 Geometric Context Transformer 架构。它通过锚点上下文(anchor context)、位姿参考窗口(pose-reference window)和轨迹记忆(trajectory memory)三大机制,将坐标锚定、密集几何线索和长期漂移校正统一在一个流式框架内。这种设计使得模型能够在连续输入的视频帧中保持全局一致性,有效解决了传统方法在长序列上的累积误差问题。

LingBot-Map 在推理效率方面表现突出。借助分页 KV 缓存注意力机制(Paged KV Cache Attention),模型在 518×378 分辨率下可达到约 20 FPS 的实时推理速度。同时,它提供了交互式可视化工具(基于 viser)和离线渲染管线,支持从室内步行、户外驾驶到世界模型生成视频等多种场景的重建。

核心特性

  • Geometric Context Transformer:统一坐标锚定、几何线索和漂移校正
  • 高效流式推理:前馈架构,支持 ~20 FPS 实时推理,适用于 10,000+ 帧长序列
  • State-of-the-Art 性能:在 KITTI、Oxford Spires、TUM-D 等多个基准数据集上表现优异
  • 灵活的推理模式:支持关键帧间隔、窗口化推理、天空掩码等多种策略
  • 离线渲染管线:支持超长序列的批处理渲染,输出点云飞行视频
  • 模型已开源:HuggingFace 和 ModelScope 均可下载预训练权重

快速开始

  1. 创建 conda 环境并安装 PyTorch (CUDA 12.8)
  2. 安装 lingbot-mappip install -e .
  3. 安装 FlashInfer(推荐,用于分页 KV 缓存注意力)
  4. 下载预训练模型并运行示例场景:
1
2
python demo.py --model_path /path/to/lingbot-map-long.pt \
    --image_folder example/courthouse --mask_sky

更多详细用法、离线渲染示例和参数说明请参考 GitHub 仓库


📌 项目信息