À propos du projet
RAGFlow est un moteur RAG open-source conçu pour transformer des données complexes et non structurées en systèmes d'IA prêts pour la production. Il se concentre sur la compréhension approfondie des documents et propose un flux de travail optimisé pour permettre aux entreprises d'intégrer les LLM à leurs propres données.
Les capacités clés incluent :
- Une compréhension approfondie des documents pour l'extraction de connaissances à partir de données non structurées aux formats complexes.
- Un découpage (chunking) basé sur des modèles, intelligent et explicable.
- La prise en charge de diverses sources de données, notamment Word, Slides, Excel, TXT, images, copies scannées et pages web.
- Des citations fondées pour réduire les hallucinations en fournissant des références traçables vers les fragments de texte.
- Un flux d'orchestration RAG automatisé avec des LLM configurables, des modèles d'embedding et un re-ranking fusionné.
- L'intégration avec des flux de travail Agentic, MCP et un exécuteur de code Python/JavaScript.
- La synchronisation des données à partir de sources externes telles que Confluence, S3, Notion, Discord et Google Drive.
Le système peut être auto-hébergé via Docker et prend en charge divers moteurs de documents, dont Elasticsearch (par défaut) et Infinity.