À propos du projet
LingBot-Map est un modèle 3D feed-forward conçu pour la reconstruction 3D en streaming à partir de séquences vidéo ou d'images. Il introduit un transformateur de contexte géométrique qui unifie l'ancrage des coordonnées, les indices géométriques denses et la correction de dérive à longue portée dans un cadre de streaming unique, en utilisant un contexte d'ancrage, des fenêtres de référence de pose et une mémoire de trajectoire. L'architecture permet une inférence à haute efficacité d'environ 20 FPS sur une résolution de 518x378 pour des séquences dépassant 10 000 images, en tirant parti de l'attention avec cache KV paginé (FlashInfer recommandé, avec repli SDPA).
Le dépôt fournit deux flux de travail principaux : une démo interactive (demo.py) utilisant un visualiseur viser basé sur navigateur pour la visualisation en temps réel, et un pipeline de rendu hors ligne (demo_render/batch_demo.py) pour produire des vidéos MP4 de survol de nuages de points sans interface graphique à partir de longues vidéos. Les deux prennent en charge le masquage du ciel via des modèles de segmentation ONNX, des stratégies d'intervalles d'images clés pour gérer la mémoire du cache KV, et une inférence fenêtrée pour les séquences au-delà de la plage d'entraînement d'environ 320 images. Des points de contrôle pré-entraînés sont disponibles sur HuggingFace et ModelScope, avec des benchmarks d'évaluation pour des ensembles de données comme KITTI et Oxford Spires inclus.
L'installation nécessite Python 3.10, PyTorch 2.8.0 avec CUDA 12.8, et des dépendances optionnelles pour le rendu (Open3D, Kaolin, ffmpeg) et la visualisation. Le projet est sous licence Apache-2.0 et comprend une documentation détaillée, des exemples concrets (visite intérieure, conduite extérieure, scènes générées) et des options de réglage des performances pour une mémoire GPU limitée.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.