프로젝트 소개
Data-Prep-Kit는 LF AI & Data 재단이 호스팅하고 IBM Research가 시작한 오픈소스 프로젝트로, 대규모 언어 모델(LLM) 및 생성형 AI(GenAI) 애플리케이션 개발을 위한 비정형 데이터 준비를 가속화하도록 설계되었습니다.
### 핵심 기능 및 데이터 유형
이 툴킷은 사전 학습, 미세 조정, 지시 조정, 검색 증강 생성(RAG)을 포함한 다양한 LLM 워크플로우를 위해 비정형 데이터를 정제, 변환, 강화하는 데 도움을 줍니다. 현재 자연어, 코드, 이미지의 세 가지 주요 데이터 유형을 지원합니다.
### 주요 특징
- **모듈식 변환**: HTML, PDF 또는 ZIP 파일을 Parquet로 변환하는 데이터 수집, 중복 제거(정확 및 퍼지), 품질 주석, PII(개인 식별 정보) 마스킹, 토큰화, 분류를 위한 사전 구축 모듈 라이브러리를 지속적으로 확장 제공합니다.
- **확장성 및 성능**: 일반적인 Python 프레임워크를 기반으로 구축되었으며 분산 컴퓨팅을 위해 Ray와 통합되어 데이터 파이프라인을 단일 노트북에서 데이터 센터 클러스터까지 손쉽게 확장할 수 있습니다.
- **유연한 데이터 형식**: Parquet, ZIP, NDJSON 및 JSONL 파일 형식 처리를 지원합니다.
- **오케스트레이션 및 배포**: 변환은 Python 또는 Ray 작업으로 패키징되어 Kubernetes에 배포할 수 있습니다. 이 툴킷은 Tekton을 사용한 순차 변환 파이프라인 오케스트레이션을 지원합니다.
- **개발자 경험**: 대화형 Google Colab 노트북, 사용자 정의 변환 기여를 위한 상세 튜토리얼, RAG 파이프라인 구축과 같은 엔터프라이즈급 사용 사례를 위한 예제 레시피를 제공합니다.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.