这个项目能做什么

LingBot-Map是一种前馈式3D基础模型,专为从视频或图像序列进行流式3D重建而设计。它引入了几何上下文变换器(Geometric Context Transformer),通过锚点上下文、姿态参考窗口和轨迹记忆,在单一流式框架内统一了坐标定位、密集几何线索和长程漂移校正。该架构在518x378分辨率下,对超过10,000帧的序列可实现约20 FPS的高效推理,并利用分页KV缓存注意力(推荐使用FlashInfer,并支持SDPA回退)。 该仓库提供两种主要工作流程:一个交互式演示(`demo.py`),使用基于浏览器的viser查看器进行实时可视化;以及一个离线渲染管线(`demo_render/batch_demo.py`),用于从长视频生成无头点云飞越MP4。两者均支持通过ONNX分割模型进行天空遮罩、管理KV缓存内存的关键帧间隔策略,以及针对超出约320帧训练范围的序列进行窗口推理。预训练检查点可在HuggingFace和ModelScope上获取,并包含KITTI和Oxford Spires等数据集的评估基准。 安装需要Python 3.10、PyTorch 2.8.0及CUDA 12.8,以及用于渲染(Open3D、Kaolin、ffmpeg)和可视化的可选依赖项。该项目采用Apache-2.0许可证,并包含详细文档、工作示例(室内漫游、室外驾驶、生成场景)以及针对有限GPU内存的性能调优选项。