Sobre el proyecto

RAGFlow es un motor RAG de código abierto diseñado para transformar datos complejos y no estructurados en sistemas de IA listos para producción. Se centra en la comprensión profunda de documentos y proporciona un flujo de trabajo optimizado para que las empresas integren LLMs con sus propios datos. Las capacidades clave incluyen: - Comprensión profunda de documentos para la extracción de conocimientos a partir de datos no estructurados con formatos complejos. - Fragmentación (chunking) basada en plantillas que es inteligente y explicable. - Soporte para diversas fuentes de datos, incluyendo Word, Slides, Excel, TXT, imágenes, copias escaneadas y páginas web. - Citas fundamentadas para reducir las alucinaciones mediante la provisión de referencias rastreables a los fragmentos de texto. - Un flujo de trabajo de orquestación RAG automatizado con LLMs configurables, modelos de embedding y re-ranking fusionado. - Integración con flujos de trabajo Agentic, MCP y un ejecutor de código Python/JavaScript. - Sincronización de datos desde fuentes externas como Confluence, S3, Notion, Discord y Google Drive. El sistema puede ser auto-alojado a través de Docker y soporta varios motores de documentos, incluyendo Elasticsearch (por defecto) e Infinity.