paddleocrPaddlePaddle
NOVOPaddleOCR é um toolkit OCR de código aberto que converte PDFs e imagens em dados estruturados (JSON/Markdown) para LLMs. Inclui PP-OCRv6 para reconhecimento multilíngue (100+ idiomas), PaddleOCR-VL para análise de documentos e PP-StructureV3 para conversão com consciência de layout. Suporta CPU, GPU e vários aceleradores de IA.