Sobre el proyecto
RAGFlow es un motor RAG de código abierto diseñado para transformar datos complejos y no estructurados en sistemas de IA listos para producción. Se centra en la comprensión profunda de documentos y proporciona un flujo de trabajo optimizado para que las empresas integren LLMs con sus propios datos.
Las capacidades clave incluyen:
- Comprensión profunda de documentos para la extracción de conocimientos a partir de datos no estructurados con formatos complejos.
- Fragmentación (chunking) basada en plantillas que es inteligente y explicable.
- Soporte para diversas fuentes de datos, incluyendo Word, Slides, Excel, TXT, imágenes, copias escaneadas y páginas web.
- Citas fundamentadas para reducir las alucinaciones mediante la provisión de referencias rastreables a los fragmentos de texto.
- Un flujo de trabajo de orquestación RAG automatizado con LLMs configurables, modelos de embedding y re-ranking fusionado.
- Integración con flujos de trabajo Agentic, MCP y un ejecutor de código Python/JavaScript.
- Sincronización de datos desde fuentes externas como Confluence, S3, Notion, Discord y Google Drive.
El sistema puede ser auto-alojado a través de Docker y soporta varios motores de documentos, incluyendo Elasticsearch (por defecto) e Infinity.