프로젝트 소개

GraphRAG는 대규모 언어 모델을 사용하여 비정형 텍스트에서 의미 있는 구조화 데이터를 추출하도록 설계된 데이터 파이프라인 및 변환 제품군입니다. 핵심 아이디어는 질의응답을 위한 대상 컨텍스트를 형성하는 데 사용할 수 있는 지식 그래프 메모리 구조를 구축하여 LLM이 비공개 데이터나 서사 데이터에 대해 추론하는 능력을 향상시키는 것입니다. 이 저장소는 Microsoft Research에서 제공하며, 공식적으로 지원되는 Microsoft 제품이 아니라 연구 프로젝트라고 명시적으로 설명되어 있습니다. 2024년 7월 첫 릴리스 이후 이 프로젝트는 대체로 유지보수 모드에 들어갔습니다. 새로운 풀 리퀘스트를 받지 않거나 새 기능을 구현하지 않지만, 유지관리자는 특히 CVE를 해결하기 위해 적절히 버그 수정과 의존성 업데이트를 수행합니다. 시작하려면 공식 문서의 명령줄 퀵스타트를 사용하는 것이 권장됩니다. README는 GraphRAG 인덱싱이 비용이 많이 드는 작업일 수 있다고 강하게 경고하며, 사용자에게 모든 문서를 읽고 관련 프로세스와 비용을 이해한 뒤 작게 시작할 것을 촉구합니다. 또한 자체 데이터로 GraphRAG를 사용할 때 최상의 결과를 얻으려면 프롬프트 튜닝을 권장합니다. 기본 설정 그대로 사용하면 최적의 결과를 얻지 못할 수 있기 때문입니다. 버전 관리 지침은 주요 변경 사항 문서에서 제공됩니다. 사용자는 최신 구성 형식을 보장하기 위해 마이너 버전 업 간에 graphrag init --root [path] --force를 실행하고, 이전 데이터셋을 다시 인덱싱하지 않도록 메이저 버전 업 간에 제공된 마이그레이션 노트북을 실행하는 것이 좋습니다. 이는 구성과 프롬프트를 어쓸 수 있으므로 백업이 권장됩니다. 이 프로젝트에는 GraphRAG가 무엇인지, 무엇을 할 수 있는지, 의도된 용도, 평가 지표, 한계, 책임 있는 사용을 위한 운영 설정을 다루는 책임 있는 AI FAQ가 포함되어 있습니다. 또한 Microsoft 상표 및 개인정보 보호 정책을 따릅니다. 전반적으로 GraphRAG는 지식 그래프와 검색 증강 생성을 결합하는 모형 접근 방식을 제공하지만, 재 사용자는 도입 전에 연구 상태, 유지보수 모드의 한계, 잠재적으로 상당한 인덱싱 비용을 인지해야 합니다.