프로젝트 소개
Marker는 Datalab의 문서 변환 도구로, PDF 및 기타 문서 형식을 Markdown, JSON, HTML 또는 청크로 변환합니다. README에 따르면 모든 언어의 PDF, 이미지, PPTX, DOCX, XLSX, HTML 및 EPUB 입력을 지원하며 표, 양식, 수식, 인라인 수학, 링크, 참조 및 코드 블록을 처리합니다. 이미지를 추출하고 저장하며 헤더, 푸터 및 기타 아티팩트를 제거할 수도 있습니다.
이 프로젝트는 두 가지 주요 변환 모드를 제공합니다. 균형 모드는 GPU를 대상으로 하며 레이아웃에 surya VLM을 사용하고 인라인 수식을 OCR 처리하며 임베디드 텍스트 품질이 낮을 경우 전체 페이지를 다시 OCR 처리합니다. 빠른 모드는 CPU에 최적화되어 pdftext 추출과 함께 경량 rf-detr 레이아웃 감지기를 사용하며 VLM 사용을 최소화합니다. --disable_ocr 옵션은 순수 텍스트 레이어 추출을 위해 모든 VLM 호출을 비활성화합니다. Marker는 GPU, CPU 또는 MPS에서 실행됩니다.
옵션인 --use_llm 플래그는 Gemini, Claude, OpenAI 호환 엔드포인트, Azure, Vertex, OpenRouter 및 Ollama를 지원하는 더 높은 정확도를 위한 하이브리드 모드를 활성화합니다. README에 따르면 균형 모드는 1,403개 PDF에 대한 타사 벤치마크인 olmocr-bench에서 전체 점수 76.0%를 기록했으며, born-digital PDF에서는 83.5%를 기록했습니다.
설치는 pip install marker-pdf를 통해 이루어지며, 비 PDF 형식의 경우 marker-pdf[full]을 사용합니다. 사용법에는 Streamlit GUI(marker_gui), 단일 파일 변환(marker_single) 및 폴더 변환(marker)이 포함되며 페이지 범위, 출력 형식, 워커, 머신 간 청킹 및 기존 파일 건너뛰기 옵션을 제공합니다. Python API는 PdfConverter, TableConverter 및 OCRConverter 클래스와 사용자 정의 구성을 위한 ConfigParser를 제공합니다. 출력 형식에는 이미지 링크와 LaTeX 수식이 포함된 Markdown, HTML, 블록 유형 및 폴리곤이 포함된 트리 구조 JSON, RAG용 평면화된 청크 형식이 포함됩니다. 간단한 FastAPI 서버는 marker_server로 시작할 수 있습니다.
코드는 Apache 2.0 라이선스를 따르며 모델 가중치는 수정된 AI Pubs Open Rail-M 라이선스를 사용합니다. README는 더 높은 정확도를 제공하는 Chandra 모델을 실행하는 관리형 플랫폼도 언급하며, 기본값으로 데이터 보존이 없고 SOC 2 Type 2 인증을 받았으며 맞춤형 BAA를 제공합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.