Sobre el proyecto

LingBot-Map es un modelo fundacional 3D feed-forward diseñado para la reconstrucción 3D en streaming a partir de secuencias de video o imágenes. Introduce un Transformador de Contexto Geométrico que unifica el anclaje de coordenadas, las señales geométricas densas y la corrección de deriva a largo plazo dentro de un único marco de streaming utilizando contexto de anclaje, ventanas de referencia de pose y memoria de trayectoria. La arquitectura permite una inferencia de alta eficiencia a aproximadamente 20 FPS en resolución 518x378 sobre secuencias que superan los 10,000 fotogramas, aprovechando la atención de caché KV paginada (se recomienda FlashInfer, con SDPA como alternativa). El repositorio proporciona dos flujos de trabajo principales: una demostración interactiva (`demo.py`) que utiliza un visor basado en navegador para visualización en tiempo real, y un pipeline de renderizado offline (`demo_render/batch_demo.py`) para producir videos MP4 de sobrevuelo de nubes de puntos sin cabeza a partir de videos largos. Ambos admiten enmascaramiento de cielo mediante modelos de segmentación ONNX, estrategias de intervalo de fotogramas clave para gestionar la memoria de caché KV e inferencia por ventanas para secuencias más allá del rango de entrenamiento de ~320 fotogramas. Los puntos de control preentrenados están disponibles en HuggingFace y ModelScope, e incluyen puntos de referencia de evaluación para conjuntos de datos como KITTI y Oxford Spires. La instalación requiere Python 3.10, PyTorch 2.8.0 con CUDA 12.8 y dependencias opcionales para renderizado (Open3D, Kaolin, ffmpeg) y visualización. El proyecto tiene licencia Apache-2.0 e incluye documentación detallada, ejemplos prácticos (recorrido interior, conducción exterior, escenas generadas) y opciones de ajuste de rendimiento para memoria GPU limitada.