Sobre el proyecto

KAG (Knowledge Augmented Generation) es un framework construido sobre el motor OpenSPG y modelos de lenguaje grandes, orientado al razonamiento lógico y a la respuesta de preguntas factuales sobre bases de conocimiento de dominio vertical. Se posiciona como una alternativa al RAG convencional basado en similitud vectorial y al GraphRAG basado en OpenIE, abordando la ambigüedad en la recuperación por similitud y el ruido introducido por la extracción de información abierta. Ideas centrales descritas en el README: - Representación del conocimiento: hace referencia a la jerarquía DIKW para mejorar la representación SPG y hacerla amigable para los LLM. Maneja datos no estructurados (noticias, eventos, registros, libros), datos estructurados (transacciones, estadísticas, aprobaciones) y reglas expertas, utilizando análisis de diseño, extracción de conocimiento, normalización de propiedades y alineación semántica para construir un grafo de conocimiento empresarial unificado. Admite tanto extracción sin esquema como construcción experta restringida por esquema sobre los mismos tipos de conocimiento, además de indexación mutua entre la estructura del grafo y los fragmentos de texto originales. - Razonamiento híbrido guiado por formas lógicas: un solucionador con operadores de planificación, razonamiento y recuperación convierte preguntas en lenguaje natural en procesos combinados de resolución lenguaje-símbolo. Los pasos pueden usar recuperación por coincidencia exacta, recuperación de texto, cálculo numérico o razonamiento semántico, integrando recuperación, razonamiento sobre KG, razonamiento lingüístico y computación numérica. Arquitectura: kg-builder (representación y construcción del conocimiento) y kg-solver (motor de resolución/razonamiento híbrido); se indica que un componente kag-model está planificado para una futura publicación de código abierto. Las notas de versión recientes mencionan la versión 0.8.0 (2025.06.27) con modos de base de conocimiento privada y de red pública, integración del protocolo MCP para fuentes de datos LBS/WebSearch y flujos de trabajo de agentes, tipos de índice integrados (Outline, Summary, KnowledgeUnit, AtomicQuery, Chunk, Table), desacoplamiento de las bases de conocimiento respecto de las aplicaciones y adaptación del modelo KAG-Thinker. La versión 0.7 (2025.04.17) refactorizó KAG-Solver con modos de planificación estática e iterativa, añadió modos de razonamiento simple y profundo, salida en streaming, renderizado de índices de grafo, un directorio open_benchmark y un modo de construcción ligero. Actualizaciones anteriores añadieron personalización de esquemas de dominio, tareas QFS, análisis visual de consultas, carga de documentos Word y configuraciones de concurrencia; la versión inicial fue el 2024.10.25. Despliegue: un modo de producto usa Docker Compose con un archivo compose proporcionado y una interfaz web en el puerto 8887 con credenciales predeterminadas; un modo de kit de herramientas se instala mediante pip desde el repositorio clonado para Python 3.10+ en macOS, Linux o Windows. La documentación está alojada en Yuque, con soporte comunitario a través de Discord y WeChat. El proyecto tiene licencia Apache-2.0 y cita un artículo de arXiv (2409.13731).