Sobre o projeto
O CVAT (Computer Vision Annotation Tool) é uma plataforma de anotação de dados para construir conjuntos de dados visuais para visão computacional e IA visual. Este repositório contém o código-fonte e os recursos de implantação do CVAT Community, a edição de código aberto gratuita e auto-hospedada. O projeto está no GitHub desde 2018 e serve como base das ofertas comerciais CVAT Online e CVAT Enterprise.
A implantação é baseada em Docker: clone o repositório, execute `docker compose up -d`, depois crie uma conta de administrador com um comando de gerenciamento e abra a interface web em localhost:8080 (ou um CVAT_HOST configurado). Docker Engine, Docker Compose e Git são os pré-requisitos indicados. O README observa testes primários com navegadores baseados em Chromium, possíveis ressalvas no Firefox e nenhum suporte a Safari/WebKit. Guias alternativos de implantação cobrem AWS, Kubernetes, PostgreSQL externo, backups e atualizações.
As principais capacidades descritas incluem rotulagem manual e automática de imagens, vídeos e nuvens de pontos 3D com caixas delimitadoras, polígonos, máscaras, pontos-chave, cuboides e tags. A anotação automática funciona conectando seus próprios modelos. O gerenciamento de tarefas organiza conjuntos de dados em projetos, tarefas e jobs com atribuição e acompanhamento de progresso. Os recursos de colaboração incluem organizações, funções, comentários e issues. O controle de qualidade abrange revisão, sinalização de problemas, comparação de consenso e verificações de Ground Truth e Honeypot via API do servidor. A análise usa painéis Grafana para atividade do usuário, tempo de trabalho, eventos e logs do servidor. As operações de dados suportam importação/exportação em mais de 20 formatos, como CVAT XML, COCO JSON, YOLO TXT, Ultralytics YOLO, Pascal VOC, KITTI e MOT, além de conexões de armazenamento em nuvem com S3, Azure e Google Cloud.
O ferramental para desenvolvedores inclui um SDK Python (`pip install cvat-sdk`), uma ferramenta de linha de comando (`pip install cvat-cli`) e uma API REST para controle programático. A anotação automática pode ser habilitada por meio de um componente serverless alimentado pelo Nuclio, com modelos pré-construídos listados para detecção, segmentação, estimativa de pose e rastreamento, incluindo Segment Anything (SAM), Inside-Outside Guidance, RetinaNet R101, HRNet32 Whole Body Pose, TransT, YOLO v7, Mask RCNN Inception ResNet v2, Face Detection 0205 e Faster RCNN Inception v2, nos frameworks PyTorch, ONNX, OpenVINO e TensorFlow.
O README distingue quatro edições: CVAT Online para avaliação baseada em navegador e planos gerenciados, CVAT Community como a opção auto-hospedada licenciada sob MIT, CVAT Enterprise para organizações que precisam de implantação na própria nuvem, suporte, SSO e SLAs, e Labeling Services para anotação terceirizada. Recursos avançados como análises avançadas de projetos, interface de controle de qualidade, auto-rotulagem integrada com SAM 2 e SAM 3, agentes de IA e SSO são descritos como disponíveis em planos pagos e empresariais, e não na edição comunitária.
Licenciamento: o núcleo é MIT. O código em `/serverless` também é licenciado sob MIT, mas pode usar ativos de terceiros sob licenças separadas, incluindo não comerciais. O software usa bibliotecas FFmpeg sob LGPL/GPL. Os canais de suporte incluem Discord, Stack Overflow com a tag `cvat`, GitHub Issues e FAQ da documentação. Contribuições são bem-vindas por meio da documentação de contribuição e do rastreador de issues, e uma política de segurança é fornecida com um contato dedicado para relatórios sensíveis.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.