프로젝트 소개

Annoy-DataSync는 코드 기반 추론 패턴을 자연어 형식으로 변환하여 대규모 언어 모델의 추론 능력을 향상시키는 방법을 제시하는 연구 중심 저장소입니다. 이 프로젝트는 코드에서 보편적인 추론 원시 요소를 추출하면서 구문과 분리하는 2단계 접근 방식(Annoy 및 Annoy++)을 설명하며, 기호, 과학, 논리, 수학, 상식 및 코드 추론 작업에서 성능을 개선하는 것을 목표로 합니다. 저장소는 Hugging Face의 데이터셋(Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw 및 LCO Benchmark)과 Qwen 2.5 7B Coder, LLaMA 3.1 8B 및 DeepSeek v2 Lite Coder를 기반으로 미세 조정된 모델을 포함한 리소스를 제공합니다. 각 기본 모델에는 Annoy 및 Annoy++ 변형에 대한 1단계 및 2단계 체크포인트가 있습니다. 코드베이스는 완전한 데이터 처리 파이프라인을 포함합니다: 원시 코드 파일을 통합 형식으로 변환, API 기반 추론 수행, 입력/출력 쌍 구문 분석 및 생성, 예측 인스턴스 구축, 추론 실행, 코드 실행을 통한 결과 검증, 그리고 Annoy++ 변형을 위한 선택적 2차 수정 및 재검증. Python 3.11과 함께 requirements.txt 또는 environment.yaml을 통해 설정이 지원됩니다. 저장소는 환경이 다양한 유형의 Python 코드를 실행하기 위해 사용자 정의가 필요할 수 있다고 언급합니다. 학습은 LLaMA-Factory와 같은 외부 프레임워크에 맡겨집니다.