Sobre el proyecto
CVAT (Computer Vision Annotation Tool) es una plataforma de anotación de datos para construir conjuntos de datos visuales para visión por computador e IA visual. Este repositorio contiene el código fuente y los recursos de despliegue de CVAT Community, la edición de código abierto gratuita y autoalojada. El proyecto está en GitHub desde 2018 y sirve como base de las ofertas comerciales CVAT Online y CVAT Enterprise.
El despliegue se basa en Docker: clona el repositorio, ejecuta `docker compose up -d`, luego crea una cuenta de administrador con un comando de gestión y abre la interfaz web en localhost:8080 (o un CVAT_HOST configurado). Docker Engine, Docker Compose y Git son los requisitos previos indicados. El README señala que las pruebas principales se realizan con navegadores basados en Chromium, posibles advertencias en Firefox y que no hay soporte para Safari/WebKit. Las guías de despliegue alternativas cubren AWS, Kubernetes, PostgreSQL externo, copias de seguridad y actualizaciones.
Entre las capacidades clave descritas se incluyen el etiquetado manual y automático de imágenes, vídeos y nubes de puntos 3D con cuadros delimitadores, polígonos, máscaras, puntos clave, cuboides y etiquetas. La anotación automática funciona conectando tus propios modelos. La gestión de tareas organiza los conjuntos de datos en proyectos, tareas y trabajos con asignación y seguimiento del progreso. Las funciones de colaboración incluyen organizaciones, roles, comentarios e incidencias. El control de calidad abarca la revisión, el marcado de incidencias, la comparación por consenso y las comprobaciones Ground Truth y Honeypot mediante la API del servidor. Las analíticas usan paneles de Grafana para la actividad de los usuarios, el tiempo de trabajo, los eventos y los registros del servidor. Las operaciones de datos admiten importación/exportación en más de 20 formatos como CVAT XML, COCO JSON, YOLO TXT, Ultralytics YOLO, Pascal VOC, KITTI y MOT, además de conexiones a almacenamiento en la nube S3, Azure y Google Cloud.
Las herramientas para desarrolladores incluyen un SDK de Python (`pip install cvat-sdk`), una herramienta de línea de comandos (`pip install cvat-cli`) y una API REST para control programático. La anotación automática puede habilitarse mediante un componente serverless impulsado por Nuclio, con modelos preconstruidos listados para detección, segmentación, estimación de pose y seguimiento, incluidos Segment Anything (SAM), Inside-Outside Guidance, RetinaNet R101, HRNet32 Whole Body Pose, TransT, YOLO v7, Mask RCNN Inception ResNet v2, Face Detection 0205 y Faster RCNN Inception v2, en los frameworks PyTorch, ONNX, OpenVINO y TensorFlow.
El README distingue cuatro ediciones: CVAT Online para evaluación basada en navegador y planes gestionados, CVAT Community como la opción autoalojada con licencia MIT, CVAT Enterprise para organizaciones que necesitan despliegue en su propia nube, soporte, SSO y SLA, y Labeling Services para anotación externalizada. Las funciones avanzadas como analíticas avanzadas de proyectos, interfaz de control de calidad, autoetiquetado integrado con SAM 2 y SAM 3, agentes de IA y SSO se describen como disponibles en planes de pago y empresariales, no en la edición comunitaria.
Licencia: el núcleo es MIT. El código en `/serverless` también tiene licencia MIT, pero puede usar recursos de terceros bajo licencias separadas, incluidas las no comerciales. El software usa bibliotecas FFmpeg bajo LGPL/GPL. Los canales de soporte incluyen Discord, Stack Overflow con la etiqueta `cvat`, GitHub Issues y las preguntas frecuentes de la documentación. Las contribuciones son bienvenidas a través de la documentación de contribución y el rastreador de incidencias, y se proporciona una política de seguridad con un contacto dedicado para informes sensibles.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.