Об этом проекте

PixelRAG — это открытая система визуального retrieval-augmented generation (RAG), разработанная в SkyLab, BAIR и NLP Group Калифорнийского университета в Беркли. Вместо того чтобы разбирать веб-страницы или PDF-файлы на текстовые фрагменты — что теряет визуальную структуру, такую как таблицы, графики, диаграммы и макет, — PixelRAG отображает документы в виде тайлов скриншотов и выполняет поиск непосредственно по изображениям. Затем модель-читатель может отвечать на вопросы о визуальном контенте, который текстовый RAG упустил бы. Система построена на двух основных операциях: рендеринг (преобразование страниц или документов в тайлы изображений с помощью Playwright/CDP или poppler для PDF) и поиск (встраивание этих тайлов с помощью модели Qwen3-VL-Embedding, доработанной с помощью LoRA на данных скриншотов, а затем запрос к векторному индексу FAISS или Qdrant). Конвейер модульный: `pixelshot` отвечает за рендеринг, а `pixelrag chunk`, `embed`, `build-index`, `index` и `serve` покрывают остальную часть рабочего процесса. Каждый этап можно установить независимо с помощью pip extras. Хостинг-API на api.pixelrag.ai обслуживает предварительно созданный индекс из 8,28 миллиона страниц Wikipedia без необходимости настройки или API-ключа. Он принимает как текстовые, так и графические запросы. Браузерное демо доступно на pixelrag.ai, а блокнот Colab предоставляет краткое руководство. Для локального использования система поддерживает Linux (CUDA) и macOS (Apple Silicon/MPS) с автоматическим выбором устройства. Пользователи могут создавать индексы из собственных документов с помощью YAML-файла конфигурации, а затем обслуживать их через поисковую конечную точку на основе FastAPI. Опция бэкенда Qdrant добавляет настраиваемое квантование, векторы с дисковым хранением, фильтрацию по полезной нагрузке и общий доступ к коллекциям на нескольких серверах. PixelRAG также поставляется в виде плагина для Claude Code под названием pixelbrowse, который позволяет Claude делать скриншоты страниц и читать изображения напрямую — видеть графики, таблицы и макет так, как это сделал бы человек. Интеграция opencode через npm-пакет @startrail/pixelbrowse предоставляет тот же инструмент скриншотов для пользователей opencode. Конвейер обучения находится в отдельном uv-проекте в каталоге train/, который дорабатывает Qwen3-VL-Embedding-2B с помощью LoRA для поиска по веб-страницам. Предварительно обученные адаптеры и полный набор обучающих данных опубликованы на Hugging Face, а конвейер курирования данных (генерация запросов с помощью LLM, фильтрация, майнинг сложных негативов) задокументирован для пользователей, которые хотят адаптировать другие базовые модели встраивания. Проект лицензирован под Apache-2.0.