프로젝트 소개
DeepAnalyze는 중국 인민대학교와 칭화대학교 팀이 개발한 자율 데이터 과학을 위한 에이전트 대규모 언어 모델(agentic LLM)입니다. 목표는 인간의 개입 없이 데이터 준비, 분석, 모델링, 시각화, 보고서 생성을 포함한 데이터 과학 전체 프로세스를 완료하고, 다양한 데이터 소스에 대한 개방형 심층 연구를 지원하는 것입니다.
주요 기능
- 전체 데이터 과학 프로세스 지원: 데이터 준비, 분석, 모델링, 시각화, 보고서 생성 작업을 자동으로 실행합니다.
- 개방형 데이터 연구: 구조화 데이터(데이터베이스, CSV, Excel), 반구조화 데이터(JSON, XML, YAML), 비구조화 데이터(TXT, Markdown)를 처리하고 최종적으로 분석 보고서를 생성합니다.
- 풀스택 오픈소스: 모델(DeepAnalyze-8B), 코드, 학습 데이터(DataScience-Instruct-500K), 데모가 모두 공개되어 로컬 배포 또는 2차 개발이 용이합니다.
사용 방법
- 모델은 vLLM을 통해 배포할 수 있으며 OpenAI 스타일 API를 제공하고, 16GB~80GB VRAM 환경을 포괄하는 메모리 구성 권장 테이블과 양자화 모델 및 FP8 KV Cache를 지원합니다.
- WebUI, WebUI v2(HeyWhale API 및 Docker 기반 샌드박스 코드 실행 지원), JupyterUI, 명령줄 인터페이스(중국어·영어 지원) 등 다양한 인터페이스를 제공합니다.
- API 키 신청 채널과 사용 문서를 제공하며, 자체적으로 OpenAI 스타일 서비스를 구축할 수도 있습니다.
학습 및 평가
- DeepSeek-R1-0528-Qwen3-8B 또는 DeepAnalyze-8B 기반 미세 조정을 지원하며, 단일 능력 미세 조정, 다중 능력 에이전트 콜드 스타트 학습, 강화 학습 훈련 스크립트를 제공합니다.
- playground에서 대부분의 기존 데이터 과학 벤치마크 평가 프로세스를 통합하여 DeepAnalyze 또는 자체 개발 에이전트를 평가하기 쉽습니다.
생태계 및 관련 프로젝트
- 관련 프로젝트로는 SkillAdam(에이전트 기술 자동 최적화 플러그인), DeepPrep(데이터 준비 에이전트), CoDA-Bench(데이터 집약적 분석 작업용 코드 에이전트 벤치마크), DA-Studio(WebUI v2의 기반 시스템)가 있습니다.
- 학습 프레임워크는 ms-swift와 SkyRL을 기반으로 하며, 학습 데이터 소스에는 Reasoning-Table, Spider, BIRD, DABStep 등이 포함됩니다.
적용 시나리오
자동화된 데이터 분석, 대량 분석 보고서 생성, 또는 로컬 프라이빗 배포형 데이터 분석 어시스턴트가 필요한 사용자와 팀에 적합합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.