Sobre el proyecto
PixelRAG es un sistema de generación aumentada por recuperación (RAG) visual de código abierto desarrollado en el SkyLab, BAIR y el Grupo NLP de la Universidad de California, Berkeley. En lugar de analizar páginas web o PDFs en fragmentos de texto, lo que elimina la estructura visual como tablas, gráficos y diagramas, PixelRAG renderiza los documentos como mosaicos de capturas de pantalla y realiza búsquedas directamente sobre las imágenes. Un modelo de lectura puede entonces responder preguntas sobre contenido visual que el RAG basado en texto pasaría por alto.
El sistema se basa en dos operaciones principales: renderizado (conversión de páginas a mosaicos de imagen mediante Playwright/CDP o poppler para PDFs) y búsqueda (incrustación de estos mosaicos con un modelo Qwen3-VL-Embedding LoRA-fine-tuned en datos de capturas de pantalla, consultando luego un índice vectorial FAISS o Qdrant). La tubería es modular: `pixelshot` maneja el renderizado, mientras que `pixelrag chunk`, `embed`, `build-index`, `index` y `serve` cubren el resto del flujo de trabajo. Cada etapa se puede instalar independientemente mediante extras de pip.
Una API alojada en api.pixelrag.ai sirve un índice preconstruido de 8.28 millones de páginas de Wikipedia sin necesidad de configuración ni clave API. Acepta consultas tanto de texto como de imagen. Hay una demostración en el navegador disponible en pixelrag.ai y un cuaderno Colab para comenzar rápidamente.
Para uso local, el sistema admite Linux (CUDA) y macOS (Apple Silicon/MPS) con selección automática de dispositivo. Los usuarios pueden construir índices desde sus propios documentos utilizando un archivo de configuración YAML, sirviéndolos luego a través de un punto final de búsqueda basado en FastAPI. La opción de backend Qdrant añade cuantización configurable, vectores respaldados en disco, filtrado de cargas útiles y compartición de colecciones entre múltiples servidores.
PixelRAG también se entrega como un plugin de Claude Code llamado pixelbrowse, que permite a Claude tomar capturas de pantalla y leer las imágenes directamente, viendo gráficos, tablas y diseño como lo haría un humano. Una integración con opencode a través del paquete npm @startrail/pixelbrowse proporciona la misma herramienta de captura para usuarios de opencode.
La tubería de entrenamiento reside en un proyecto uv separado bajo train/, que ajusta finamente Qwen3-VL-Embedding-2B para la recuperación de páginas web. Los adaptadores preentrenados y el conjunto completo de datos de entrenamiento están publicados en Hugging Face, y la tubería de curación de datos (generación de consultas aumentada por LLM, filtrado, minería de negativos difíciles) está documentada para usuarios que deseen adaptar otras bases de incrustación.
El proyecto está licenciado bajo Apache-2.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.