Sobre o projeto

PaddleSeg é um kit de desenvolvimento de segmentação de imagens de ponta a ponta baseado no PaddlePaddle, voltado para o fluxo completo de aplicações de segmentação de imagens, do treinamento à implantação. O projeto usa a licença Apache 2.0, suporta Linux, Windows e macOS, e requer Python 3.6 ou superior. Capacidades principais O kit inclui 45+ algoritmos de modelo e 140+ modelos pré-treinados, oferecendo quatro capacidades principais de segmentação: segmentação semântica, segmentação interativa, matting de imagens e segmentação panorâmica, além de direções especializadas como segmentação de retratos, segmentação médica 3D e adaptação de domínio. O desenvolvimento suporta tanto configuração dirigida quanto chamadas de API, cobrindo todo o fluxo de anotação de dados, desenvolvimento de modelos, treinamento, compressão e implantação. Modelos e componentes A biblioteca de modelos de segmentação semântica inclui PP-LiteSeg, PP-MobileSeg, DeepLabV3P, OCRNet, BiSeNetV1/V2, DDRNet, SegFormer, séries U-Net, MaskFormer, K-Net, SegNeXt e muitos outros. As redes backbone abrangem HRNet, ResNet, STDCNet, MobileNetV2/V3, ShuffleNetV2, GhostNet, LiteHRNet, ViT, Swin Transformer, MSCAN, entre outras. As funções de perda oferecem múltiplas opções, como entropia cruzada, Dice, Focal, Lovasz, OHEM e atenção de borda. As métricas de avaliação incluem mIoU, Accuracy, Kappa, Dice e AUC_ROC. Suporte a dados e treinamento O kit inclui suporte integrado para leitura de ADE20K, Cityscapes, COCO Stuff, Pascal VOC, PP-HumanSeg14K e vários conjuntos de dados de imagem médica (DRIVE, STARE, CHASE_DB1, HRF, etc.), e fornece estratégias de aumento de dados como flip, escala, recorte, ruído, desfoque, rotação e transformações afins. No lado do treinamento, são usadas estratégias de aceleração como I/O assíncrono multiprocesso, treinamento e avaliação paralelos com múltiplas GPUs, combinadas com otimização de memória do framework para reduzir custos de treinamento. Implantação e compressão Os modelos podem ser exportados como modelos de previsão ou ONNX. Os caminhos de implantação incluem FastDeploy, Paddle Inference (Python/C++), Paddle Lite, Paddle Serving e Paddle JS, cobrindo GPU de servidor, CPU X86, CPU ARM móvel e cenários Web. Em compressão, oferece quantização, destilação, poda e treinamento com compressão por quantização-destilação. Baixo código e ferramentas Em novembro de 2024, foi adicionada capacidade de desenvolvimento de fluxo completo de baixo código baseada em PaddleX, integrando modelos de segmentação semântica geral e detecção de anomalias de imagem em pipelines, com suporte a linha de comando unificada e interface gráfica, além do novo algoritmo de detecção de anomalias SFTPM. Também fornece ferramentas complementares como o seletor de modelos PaddleSMRT, a ferramenta de anotação interativa EISeg e o modelo leve de visão MobileSAM. Cenários de aplicação O README lista exemplos práticos da indústria, como segmentação de retratos, segmentação de estradas por sensoriamento remoto, segmentação de faixas de rodagem, segmentação de partes faciais, segmentação vertebral 3D, pré-visualização de manicure e monitoramento de comprimento de barras de aço, demonstrando sua utilidade em cenários médicos, industriais, de sensoriamento remoto e de entretenimento.