Sobre o projeto
LingBot-Map é um modelo 3D feed-forward projetado para reconstrução 3D em streaming a partir de sequências de vídeo ou imagem. Ele introduz um Geometric Context Transformer que unifica o ancoramento de coordenadas, pistas geométricas densas e correção de deriva de longo alcance dentro de uma única estrutura de streaming usando contexto de âncora, janelas de referência de pose e memória de trajetória. A arquitetura permite inferência de alta eficiência a aproximadamente 20 FPS em resolução 518x378 para sequências que excedem 10.000 quadros, utilizando atenção de cache KV paginada (FlashInfer recomendado, com fallback SDPA).
O repositório fornece dois fluxos de trabalho principais: uma demonstração interativa (`demo.py`) usando um visualizador baseado em navegador para visualização em tempo real, e um pipeline de renderização offline (`demo_render/batch_demo.py`) para produzir vídeos MP4 de flythrough de nuvem de pontos sem cabeça a partir de vídeos longos. Ambos suportam mascaramento de céu via modelos de segmentação ONNX, estratégias de intervalo de quadros-chave para gerenciar a memória do cache KV e inferência em janelas para sequências além do intervalo de treinamento de ~320 quadros. Checkpoints pré-treinados estão disponíveis no HuggingFace e ModelScope, com benchmarks de avaliação para conjuntos de dados como KITTI e Oxford Spires incluídos.
A instalação requer Python 3.10, PyTorch 2.8.0 com CUDA 12.8 e dependências opcionais para renderização (Open3D, Kaolin, ffmpeg) e visualização. O projeto é licenciado sob Apache-2.0 e inclui documentação detalhada, exemplos práticos (caminhada interna, passeio externo, cenas geradas) e opções de ajuste de desempenho para memória GPU limitada.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.