Sobre o projeto
O SAM 2 (Segment Anything Model 2) é um modelo fundacional da Meta AI / FAIR para segmentação visual promptável em imagens e vídeos. Ele estende a abordagem original do SAM tratando uma imagem como um vídeo de um único quadro, usando uma arquitetura de transformer com memória em streaming para processamento de vídeo em tempo real. O repositório fornece o código oficial de inferência, checkpoints treinados para download, notebooks de exemplo, código de treinamento/ajuste fino e uma demonstração web implantável localmente.
Principais capacidades descritas no README:
- Predição em imagens: a classe SAM2ImagePredictor oferece uma interface semelhante ao SAM para segmentação baseada em prompts em imagens estáticas, incluindo geração automática de máscaras.
- Predição em vídeos: um preditor de vídeo suporta adicionar prompts de ponto ou caixa, refiná-los e propagar masklets através de um vídeo, com rastreamento multi-objeto e estado de inferência por objeto.
- Checkpoints de modelos: checkpoints SAM 2.1 (tiny, small, base_plus, large) lançados em setembro de 2024, além dos checkpoints anteriores do SAM 2 de julho de 2024, com tamanho, velocidade e métricas de benchmark relatados em SA-V, MOSE e LVOS v2.
- Carregamento via Hugging Face: os modelos podem ser carregados via from_pretrained para preditores de imagem e vídeo.
- Treinamento e ajuste fino: código fornecido para treinar ou ajustar modelos em conjuntos de dados personalizados de imagem, vídeo ou mistos.
- Demonstração web: código de frontend e backend para uma demo implantável localmente, semelhante à demonstração hospedada do SAM 2.
- Conjunto de dados SA-V: o maior conjunto de dados de segmentação de vídeo até hoje, construído com um mecanismo de dados com modelo no circuito; a documentação do conjunto de dados está incluída.
A instalação requer Python 3.10+, PyTorch 2.5.1+ e TorchVision 0.20.1+, com um kit de ferramentas CUDA para compilar o kernel personalizado; usuários de Windows são aconselhados a usar WSL. Extras opcionais instalam Jupyter e matplotlib para os notebooks. O README observa que uma falha na compilação da extensão CUDA pode ser ignorada, com apenas impacto limitado no pós-processamento. Uma atualização de dezembro de 2024 adicionou compilação completa do modelo para acelerar a segmentação de objetos em vídeo e um SAM2VideoPredictor atualizado que suporta inferência independente por objeto e adição de novos objetos após o início do rastreamento.
Licenciamento: checkpoints de modelos, código de demonstração e código de treinamento estão sob Apache 2.0, com a Inter Font e o Noto Color Emoji sob a SIL Open Font License 1.1. O código de componentes conectados de GPU de terceiros é adaptado do cc_torch com seu próprio arquivo de licença.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.