Sobre el proyecto

PaddleSeg es un kit de desarrollo de segmentación de imágenes de extremo a extremo basado en PaddlePaddle, orientado al flujo completo de aplicaciones de segmentación de imágenes desde el entrenamiento hasta el despliegue. El proyecto utiliza la licencia Apache 2.0, soporta Linux, Windows y macOS, y requiere Python 3.6 o superior. Capacidades principales El kit incluye más de 45 algoritmos de modelos y más de 140 modelos preentrenados, ofreciendo cuatro capacidades principales de segmentación: segmentación semántica, segmentación interactiva, matting de imágenes y segmentación panorámica, además de direcciones especializadas como segmentación de retratos, segmentación médica 3D y adaptación de dominio. En cuanto al desarrollo, soporta tanto la configuración como llamadas API, cubriendo todo el flujo de anotación de datos, desarrollo de modelos, entrenamiento, compresión y despliegue. Modelos y componentes La biblioteca de modelos de segmentación semántica incluye PP-LiteSeg, PP-MobileSeg, DeepLabV3P, OCRNet, BiSeNetV1/V2, DDRNet, SegFormer, series U-Net, MaskFormer, K-Net, SegNeXt y muchos otros. Las redes backbone incluyen HRNet, ResNet, STDCNet, MobileNetV2/V3, ShuffleNetV2, GhostNet, LiteHRNet, ViT, Swin Transformer, MSCAN, entre otras. Las funciones de pérdida ofrecen múltiples opciones como entropía cruzada, Dice, Focal, Lovasz, OHEM y atención de bordes. Las métricas de evaluación incluyen mIoU, Accuracy, Kappa, Dice y AUC_ROC. Soporte de datos y entrenamiento Incluye soporte de lectura para ADE20K, Cityscapes, COCO Stuff, Pascal VOC, PP-HumanSeg14K y varios conjuntos de datos de imágenes médicas (DRIVE, STARE, CHASE_DB1, HRF, etc.), y proporciona estrategias de aumento de datos como volteo, escala, recorte, ruido, desenfoque, rotación y transformaciones afines. En el lado del entrenamiento, adopta estrategias de aceleración como E/S asíncrona multiproceso, entrenamiento y evaluación en paralelo con múltiples GPU, junto con optimización de memoria del framework para reducir costos de entrenamiento. Despliegue y compresión Los modelos pueden exportarse como modelos de predicción u ONNX, y las rutas de despliegue incluyen FastDeploy, Paddle Inference (Python/C++), Paddle Lite, Paddle Serving y Paddle JS, cubriendo GPU de servidor, CPU X86, ARM CPU móvil y escenarios Web. En cuanto a compresión, ofrece capacidades de cuantización, destilación, poda y entrenamiento de cuantización-destilación. Bajo código y herramientas En noviembre de 2024, se añadió la capacidad de desarrollo de flujo completo de bajo código basada en PaddleX, integrando modelos de segmentación semántica general y detección de anomalías de imágenes en pipelines, soportando tanto comandos unificados como interfaces gráficas, e incorporando el algoritmo SFTPM para detección de anomalías de imágenes. Además, proporciona herramientas complementarias como el selector de modelos PaddleSMRT, la herramienta de anotación interactiva EISeg y el modelo ligero de visión grande MobileSAM. Escenarios aplicables El README enumera ejemplos de prácticas industriales como segmentación de retratos, segmentación de carreteras remotas, segmentación de líneas de carril, segmentación de partes faciales, segmentación de vértebras 3D, vista previa de manicura y monitoreo de longitud de barras de acero, lo que indica su utilidad en escenarios médicos, industriales, de teledetección y entretenimiento.