PaddleOCR — open-source OCR-инструментарий для конвертации PDF и изображений в структурированные данные (JSON/Markdown) для LLM. Включает PP-OCRv6 для распознавания 100+ языков, PaddleOCR-VL для анализа документов и PP-StructureV3 для структурированного преобразования с учётом макета.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONCLIO Agent — это автономная система ИИ для управления крупными научными данными, построенная на платформе IOWarp. Она оркестрирует многоуровневую архитектуру с поддержкой FastMCP для HDF5, Parquet и CSV, а также включает терминальный интерфейс Bubbletea. Система интегрируется с популярными LLM (Ollama, OpenAI, Anthropic) и выступает в качестве слоя интеллекта (CEI) экосистемы IOWarp.
MinerU — это открытый движок разбора документов, преобразующий PDF, изображения, DOCX, PPTX и XLSX в структурированный Markdown/JSON для рабочих процессов LLM, RAG и агентов. Поддерживает двойные движки VLM+OCR, OCR на 109 языках и приватное/офлайн-развёртывание.