PaddleOCR é um toolkit OCR de código aberto que converte PDFs e imagens em dados estruturados (JSON/Markdown) para LLMs. Inclui PP-OCRv6 para reconhecimento multilíngue (100+ idiomas), PaddleOCR-VL para análise de documentos e PP-StructureV3 para conversão com consciência de layout. Suporta CPU, GPU e vários aceleradores de IA.
OPEN SOURCE, OPEN TO EVERYONE
Código aberto. Novas possibilidades.
Descubra projetos open source de qualidade, envie projetos anonimamente e reivindique e edite seu próprio projeto.
✳Seleção editorial · Descubra bons projetos open source4109descobertos
Um pouco de curiosidade. Um mundo de código aberto.
THE FIRST COLLECTIONTopic: document-parsing清除
paddleocrPaddlePaddle
NOVOdoclingdocling-project
NOVODocling é uma biblioteca da IBM Research para processamento de documentos, preparada para IA generativa. Suporta formatos como PDF, DOCX, imagens, áudio e vídeo, oferecendo OCR avançado, compreensão de layout e exportação para Markdown/JSON. Integra-se com LangChain e LlamaIndex.