프로젝트 소개

KAG(Knowledge Augmented Generation)는 OpenSPG 엔진과 대규모 언어 모델을 기반으로 구축된 프레임워크로, 버티컬 도메인 지식 베이스에 대한 논리적 추론과 사실적 질의응답을 목표로 합니다. 기존의 벡터 유사도 RAG와 OpenIE 기반 GraphRAG에 대한 대안으로 자리매김하며, 유사도 검색의 모호성과 개방형 정보 추출로 인한 노이즈 문제를 해결합니다. README에서 설명하는 핵심 아이디어: - 지식 표현: DIKW 계층을 참조하여 LLM 친화적으로 SPG 표현을 업그레이드합니다. 비정형 데이터(뉴스, 이벤트, 로그, 도서), 정형 데이터(거래, 통계, 승인) 및 전문가 규칙을 처리하며, 레이아 분석, 지식 추출, 속성 정규화 및 의미 정렬을 사용하여 통합 비즈니스 지식 그래프를 구축합니다. 동일한 지식 유형에 대해 스키마 없는 추출과 스키마 제약 기반 전문가 구성을 모두 지원하며, 그래프 구조와 원본 텍스트 청크 간의 상호 인덱을 제공합니다. - 논리 형식 기반 하이브리드 추론: 계획, 추론 및 검색 연산자를 갖춘 솔버가 자연어 질문을 언어와 기호를 결합한 해결 과정으로 변환합니다. 각 단계는 정확 일치 검색, 텍스트 검색, 수치 계산 또는 의미 추론을 사용할 수 있으며, 검색, KG 추론, 언어 추론 및 수치 연산을 통합합니다. 아키텍처: kg-builder(지식 표현 및 구축)와 kg-solver(하이브리드 해결/추론 엔진)로 구성되며, kag-model 컴포넌트는 향후 오픈소스로 공개될 예정이라고 명시되어 있습니다. 최근 릴리스 노트에는 버전 0.8.0(2025.06.27)이 언급되어 있으며, 사설 및 공용 네트워크 지식 베이스 모드, LBS/WebSearch 데이터 소스 및 에이전트 워크플로를 위한 MCP 프로토 통합, 내장 인덱스 유형(Outline, Summary, KnowledgeUnit, AtomicQuery, Chunk, Table), 지식 베이스와 애플리케이션의 분리, KAG-Thinker 모델 적응이 포함됩니다. 버전 0.7(2025.04.17)에서는 정적 및 반복 계획 모드를 갖춘 KAG-Solver를 리팩터링하고, 단순 및 심층 추론 모드, 스트리밍 출력, 그래프 인덱스 렌더링, open_benchmark 디렉터리, 경량 빌드 모드를 추가했습니다. 이전 업데이트에서는 도메인 스키마 사용자 정의, QFS 작업, 시각적 쿼리 분석, Word 문서 업로드 및 동시성 설정이 추가되었으며, 최초 릴리스는 2024.10.25였습니다. 배포: 제품 모드는 제공된 compose 파일과 함께 Docker Compose를 사용하며, 포트 8887에서 기본 자격 증명으로 웹 UI를 제공합니다. 툴 모드는 macOS, Linux 또는 Windows의 Python 3.10+에서 복제된 저장소로부터 pip를 통해 설치합니다. 문서는 Yuque에서 호스팅되며, 커뮤니티 지원은 Discord와 WeChat을 통해 제공됩니다. 이 프로젝트는 Apache-2.0 라이선스를 따르며 arXiv 논문(2409.13731)을 인용합니다.