∴ GitHub / 趋势仓库
Robbyant / lingbot-map
基于几何上下文 Transformer 的流式 3D 重建前馈基础模型
- 语言
- Python
- Star
- 17.6k
- Fork
- 1.9k
- 当日新增(10-09)
- +109
- 累计在榜
- 1 天
- 最高名次
- 第 10 名
- 首次上榜
- 2026-10-09
∴ 是什么
LingBot-Map 是一个用于流式 3D 重建的前馈 3D 基础模型,其核心是几何上下文 Transformer,通过锚点上下文、位姿参考窗口和轨迹记忆在单一流式框架中统一坐标定位、密集几何线索和长距离漂移校正。 仓库包含交互式演示脚本 (demo.py))、离线渲染流水线 (demo_render/batch_demo.py))、评估基准脚本及预训练模型权重链接.
∴ 解决什么问题
- 流式 3D 重建中需要同时处理坐标定位、密集几何线索和长距离漂移校正
- 长序列(超过 10,000 帧)重建时需保持稳定高效的推理
- 现有流式方法和迭代优化方法在多个基准上重建质量不够好
∴ 怎么上手
- 01创建 conda 环境:conda create -n lingbot-map python=3.10 -y && conda activate lingbot-map
- 02安装 PyTorch:pip install torch==2.8.0 torchvision==0.23.0 --index-url https://download.pytorch.org/whl/cu128
- 03安装 lingbot-map:pip install -e .
- 04安装 FlashInfer(推荐):pip install --index-url https://pypi.org/simple flashinfer-python
- 05下载模型权重(见 HuggingFace 或 ModelScope 仓库)
- 06运行演示:python demo.py --model_path /path/to/lingbot-map.pt --image_folder example/courthouse --mask_sky
∴ 适合谁
面向需要实时或流式 3D 重建的研究人员和开发者,适用于室内外场景、长视频序列的重建任务。
∴ 要点
- 架构为几何上下文 Transformer,统一坐标定位、密集几何线索和长距离漂移校正
- 前馈架构配合 paged KV cache attention,在 518×378 分辨率下可约 20 FPS 稳定推理,且支持超过 10,000 帧的长序列
- 在多个基准上优于现有流式方法和迭代优化方法
- 提供交互式 viser 查看器演示和离线批渲染流水线
- 支持天空掩膜(使用 ONNX 模型)和窗口化推理(长序列)
- 许可证为 Apache-2.0
许可证 Apache-2.0
解读由 AI 依据项目 README 生成,生成于 2026-10-09,以 GitHub 原文为准。
∴ 在榜记录
GitHub Trending 今日榜的每日存档,日期按北京时间。2026-10-09 首次上榜,累计在榜 1 天,最高第 10 名。