À propos du projet
KAG (Knowledge Augmented Generation) est un framework construit sur le moteur OpenSPG et des grands modèles de langage, destiné au raisonnement logique et à la réponse à des questions factuelles sur des bases de connaissances de domaine vertical. Il se positionne comme une alternative au RAG classique par similarité vectorielle et au GraphRAG fondé sur OpenIE, afin de répondre à l'ambiguïté de la recherche par similarité et au bruit introduit par l'extraction ouverte d'information.
Idées principales décrites dans le README :
- Représentation des connaissances : s'appuie sur la hiérarchie DIKW pour faire évoluer la représentation SPG afin de la rendre plus adaptée aux LLM. Elle traite les données non structurées (actualités, événements, journaux, livres), les données structurées (transactions, statistiques, validations) et les règles expertes, en utilisant l'analyse de mise en page, l'extraction de connaissances, la normalisation des propriétés et l'alignement sémantique pour construire un graphe de connaissances métier unifié. Elle prend en charge à la fois l'extraction sans schéma et la construction experte contrainte par schéma sur les mêmes types de connaissances, ainsi que l'indexation mutuelle entre la structure du graphe et les segments de texte d'origine.
- Raisonnement hybride guidé par formes logiques : un solveur doté d'opérateurs de planification, de raisonnement et de récupération convertit les questions en langage naturel en processus de résolution combinant langage et symboles. Les étapes peuvent utiliser la recherche par correspondance exacte, la recherche textuelle, le calcul numérique ou le raisonnement sémantique, en intégrant récupération, raisonnement sur KG, raisonnement linguistique et calcul numérique.
Architecture : kg-builder (représentation et construction des connaissances) et kg-solver (moteur de résolution/raisonnement hybride) ; un composant kag-model est annoncé comme prévu pour une future publication open source.
Les notes de version récentes mentionnent la version 0.8.0 (2025.06.27) avec des modes de base de connaissances privé et réseau public, l'intégration du protocole MCP pour les sources de données LBS/WebSearch et les workflows d'agents, des types d'index intégrés (Outline, Summary, KnowledgeUnit, AtomicQuery, Chunk, Table), le découplage des bases de connaissances et des applications, et l'adaptation du modèle KAG-Thinker. La version 0.7 (2025.04.17) a refactorisé le KAG-Solver avec des modes de planification statique et itérative, ajouté des modes de raisonnement simple et approfondi, la sortie en streaming, le rendu d'index de graphe, un répertoire open_benchmark et un mode de construction léger. Des mises à jour antérieures ont ajouté la personnalisation de schémas de domaine, les tâches QFS, l'analyse visuelle de requêtes, le téléversement de documents Word et les paramètres de concurrence ; la version initiale date du 2024.10.25.
Déploiement : un mode produit utilise Docker Compose avec un fichier compose fourni et une interface web sur le port 8887 avec des identifiants par défaut ; un mode toolkit s'installe via pip depuis le dépôt cloné pour Python 3.10+ sur macOS, Linux ou Windows. La documentation est hébergée sur Yuque, avec un support communautaire via Discord et WeChat. Le projet est sous licence Apache-2.0 et cite un article arXiv (2409.13731).
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.