Sobre el proyecto

LightRAG es un framework de código abierto de generación aumentada por recuperación (RAG) construido en torno a grafos de conocimiento, posicionado como una alternativa ligera a Microsoft GraphRAG. Combina la indexación estructurada en grafos con incrustaciones vectoriales en una arquitectura de doble capa, con el objetivo de tender un puente entre el RAG vectorial tradicional basado en fragmentos y el RAG basado en grafos. Capacidades principales descritas en el README: - Indexación estructurada en grafos que captura dependencias semánticas entre entidades, destinada a superar el contexto fragmentado en la recuperación basada en fragmentos. - Recuperación de doble nivel con cinco modos de consulta: local (entidades y atributos específicos), global (temas macro y relaciones entre documentos), híbrido (local + global), naive (similitud vectorial simple sobre fragmentos de texto) y mix (local + global + naive, predeterminado). - Actualizaciones incrementales y eliminación selectiva: cuando se elimina un documento, el sistema puede utilizar la caché LLM generada durante la indexación para reconstruir las entidades y relaciones afectadas. - Múltiples motores de análisis de documentos: MinerU, Docling y un motor nativo que procesa imágenes, tablas y fórmulas en documentos de Word y Markdown, además de una detección inteligente opcional de encabezados para archivos .docx utilizando modelos spaCy. - Cuatro estrategias de fragmentación de texto: longitud fija, carácter recursivo, semántica vectorial y semántica de párrafo; esta última alinea los límites de los fragmentos con encabezados, párrafos y tablas. - Procesamiento multimodal (v1.5+) que conecta imágenes, fórmulas y tablas con el texto principal a través del grafo de conocimiento, con integración de RAG-Anything para PDFs, imágenes, documentos de Office, tablas y fórmulas. - Configuración de LLM por roles con cuatro roles: EXTRACT, QUERY, KEYWORD y VLM, cada uno configurable de forma independiente. - Backends de almacenamiento que incluyen valores predeterminados en memoria con persistencia en archivos locales, además de PostgreSQL, MongoDB, Neo4j, Milvus, OpenSearch y otros; se recomienda PostgreSQL para producción. - Soporte para citas de atribución de fuentes, soporte para rerankers, integración de evaluación RAGAS y trazado con Langfuse. Despliegue y uso: - Instalable desde PyPI como lightrag-hku con un extra api, o desde el código fuente utilizando uv o pip; un Makefile proporciona objetivos como make dev y make env-base. - Se admite el despliegue con Docker Compose, con imágenes oficiales GHCR firmadas mediante Sigstore Cosign; existe una guía de configuración de Apple Container para Apple Silicon sin Docker Desktop. - Un asistente de configuración interactivo genera configuraciones .env y docker-compose.final.yml para ajustes de LLM, incrustaciones, reranker, almacenamiento, servidor, autenticación y SSL. - El servidor expone una interfaz web y una API REST; el README advierte que la autenticación (LIGHTRAG_API_KEY o AUTH_ACCOUNTS con TOKEN_SECRET) debe configurarse antes de exponer el servicio a la red, y que las rutas /api/* compatibles con Ollama permanecen abiertas por defecto a menos que se establezca WHITELIST_PATHS. - Las dependencias opcionales del sistema incluyen libcairo para la rasterización SVG en el análisis nativo de markdown/textpack, y modelos de idioma spaCy para la detección inteligente de encabezados en docx. La guía del README sobre modelos sugiere un modelo rápido sin razonamiento para la extracción, un modelo más potente para responder consultas, un modelo ligero sin razonamiento para la extracción de palabras clave y un modelo multimodal para tareas VLM; los modelos de incrustación deben elegirse antes de la indexación y mantenerse consistentes, sugiriendo BAAI/bge-m3 para despliegues locales. El proyecto está asociado con un artículo de arXiv (2410.05779) y se describe como aceptado en EMNLP 2025.