프로젝트 소개
PaddleOCR는 PaddlePaddle가 개발한 종합 OCR 및 문서 AI 툴킷으로, PDF 문서와 이미지를 JSON 또는 Markdown 형식의 구조화된 LLM 준비 데이터로 변환합니다.
주요 구성요소:
- PP-OCRv6: 중국어, 영어, 일본어를 포함한 50개 이상의 언어를 단일 통합 모델로 지원하는 다국어 텍스트 인식 모델입니다. 키릴 문자, 아랍어, 데바나가리 등을 포함한 100개 이상의 언어를 커버합니다. 경량(1.5M), 소형(7.7M), 중형(34.5M) 파라미터 세 가지 크기 계층으로 제공되어 엣지, 모바일, 서버 배포에 적합합니다.
- PaddleOCR-VL: 문서 파싱을 위한 비전-라nguages 모델(0.9B 파라미터)로, OmniDocBench 등 벤치마크에서 우수한 성능을 발휘하며 텍스트, 수식, 표, 차트, 고문서, 인장, 희귀 문자 등을 처리합니다. 좌표 정보가 포함된 구조화된 Markdown과 JSON을 출력합니다.
- PP-StructureV3: 표 셀, 텍스트 영역 등 레이아웃 요소에 대한 세밀한 좌표 정보를 제공하는 구조 인식 문서 변환 파이프라인입니다.
- HPD-Parsing: 계층적 병렬 디코딩을 통한 고속 문서 파싱을 위한 경량 비전-라nguages 모델입니다.
이 툴킷은 NVIDIA GPU, Intel CPU, Kunlunxin XPU 및 다양한 AI 가속기를 포함한 여러 하드웨어 백엔드를 지원합니다. ONNX, OpenVINO, TensorRT를 통해 배포하거나 HTTP API로 서비스할 수 있습니다. PaddleOCR는 Dify, RAGFlow, Pathway, Cherry Studio 등의 AI 애플리케이션 플랫폼과 통합됩니다.
공식 브라우저 추론 SDK인 PaddleOCR.js는 PP-OCR 모델을 브라우저에서 직접 실행할 수 있게 해줍니다. 또한 Word, Excel, PowerPoint 문서를 Markdown으로 변환하고, 파싱 결과를 DOCX 형식으로 내보내는 기능도 지원합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.