Sobre el proyecto
SAM 2 (Segment Anything Model 2) es un modelo fundacional de Meta AI / FAIR para la segmentación visual mediante indicaciones (prompts) en imágenes y vídeos. Extiende el enfoque original de SAM al tratar una imagen como un vídeo de un solo fotograma, usando una arquitectura de transformador con memoria en streaming para el procesamiento de vídeo en tiempo real. El repositorio proporciona el código oficial de inferencia, los checkpoints entrenados descargables, cuadernos de ejemplo, código de entrenamiento/ajuste fino y una demo web desplegable localmente.
Las capacidades clave descritas en el README:
- Predicción en imágenes: la clase SAM2ImagePredictor ofrece una interfaz similar a SAM para la segmentación basada en indicaciones en imágenes estáticas, incluida la generación automática de máscaras.
- Predicción en vídeo: un predictor de vídeo permite añadir indicaciones de puntos o cajas, refinarlas y propagar masklets a lo largo de un vídeo, con seguimiento de múltiples objetos y estado de inferencia por objeto.
- Checkpoints del modelo: checkpoints SAM 2.1 (tiny, small, base_plus, large) publicados en septiembre de 2024, además de los checkpoints anteriores de SAM 2 de julio de 2024, con cifras reportadas de tamaño, velocidad y benchmarks en SA-V, MOSE y LVOS v2.
- Carga desde Hugging Face: los modelos pueden cargarse mediante from_pretrained tanto para predictores de imagen como de vídeo.
- Entrenamiento y ajuste fino: se incluye código para entrenar o ajustar modelos en conjuntos de datos personalizados de imagen, vídeo o mixtos.
- Demo web: código de frontend y backend para una demo desplegable localmente similar a la demo alojada de SAM 2.
- Dataset SA-V: el mayor dataset de segmentación de vídeo hasta la fecha, construido con un motor de datos con modelo en el bucle; se incluye documentación del dataset.
La instalación requiere Python 3.10+, PyTorch 2.5.1+ y TorchVision 0.20.1+, con un kit de herramientas CUDA para compilar el kernel personalizado; se recomienda a los usuarios de Windows usar WSL. Los extras opcionales instalan Jupyter y matplotlib para los cuadernos. El README señala que una compilación fallida de la extensión CUDA puede ignorarse, con solo un impacto limitado en el postprocesado. Una actualización de diciembre de 2024 añadió la compilación completa del modelo para acelerar la segmentación de objetos en vídeo y un SAM2VideoPredictor actualizado que admite inferencia independiente por objeto y la adición de nuevos objetos después de iniciar el seguimiento.
Licencias: los checkpoints del modelo, el código de la demo y el código de entrenamiento están bajo Apache 2.0, con Inter Font y Noto Color Emoji bajo SIL Open Font License 1.1. El código de componentes conectados de terceros para GPU está adaptado de cc_torch con su propio archivo de licencia.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.