Sobre o projeto
RAGFlow é um motor RAG de código aberto projetado para transformar dados complexos e não estruturados em sistemas de IA prontos para produção. Ele foca na compreensão profunda de documentos e fornece um fluxo de trabalho simplificado para que empresas integrem LLMs com seus próprios dados.
As principais capacidades incluem:
- Compreensão profunda de documentos para extração de conhecimento de dados não estruturados com formatos complexos.
- Chunking baseado em templates que é inteligente e explicável.
- Suporte para diversas fontes de dados, incluindo Word, Slides, Excel, TXT, imagens, cópias digitalizadas e páginas da web.
- Citações fundamentadas para reduzir alucinações, fornecendo referências rastreáveis aos chunks de texto.
- Um fluxo de orquestração RAG automatizado com LLMs configuráveis, modelos de embedding e re-ranking fundido.
- Integração com fluxos de trabalho Agentic, MCP e um executor de código Python/JavaScript.
- Sincronização de dados de fontes externas, como Confluence, S3, Notion, Discord e Google Drive.
O sistema pode ser auto-hospedado via Docker e suporta vários motores de documentos, incluindo Elasticsearch (padrão) e Infinity.