프로젝트 소개

Daft는 AI 및 멀티모달 워크로드를 위해 설계된 고성능 데이터 엔진입니다. 사용자는 단일 프레임워크 내에서 이미지, 오디오, 비디오, 임베딩 및 구조화 데이터를 처리할 수 있으며, Python 네이티브에 Rust 기반 코어를 갖춘 것으로 설명됩니다. README에 강조된 주요 기능: - 네이티브 멀티모달 처리: 구조화 데이터와 함께 이미지, 오디오, 비디오, 임베딩을 하나의 프레임워크에서 처리합니다. - 내장 AI 연산: OpenAI, Transformers 또는 사용자 정의 모델을 사용하여 대규모로 LLM 프롬프트 실행, 임베딩 생성, 데이터 분류를 수행합니다. - Python 네이티브, Rust 기반: 핵심은 Python이고 내부는 Rust로 구성되어 JVM 복잡성을 피합니다. - 원활한 확장: 로컬에서 시작하여 Ray 또는 Kubernetes의 분산 클러스터로 확장합니다. - 보편적 연결: S3, GCS, Iceberg, Delta Lake, Hugging Face 및 Unity Catalog에서 데이터에 접근합니다. - 기본 제공 신뢰성: 지능형 메모리 관리와 합리적인 기본값을 제공합니다. 설치는 `pip install daft`를 통해 이루어지며 Python 3.10 이상이 필요합니다. README는 실제 전자상거래 데이터셋을 로드하고 제품 이미지를 처리하며 대규모 AI 추론을 실행하는 퀵스타트와 예제, 사용자 가이드, API 참조를 안내합니다. 벤치마킹 페이지도 참조됩니다. 이 프로젝트는 기여를 환영하며 좋은 첫 이슈를 나열합니다. Scarf를 통해 비식별 원격 측정을 수집하며, `DO_NOT_TRACK=true`로 설정하여 비활성화할 수 있습니다. README는 세션 ID나 사용자 식별자를 수집하지 않으며 독점 코드나 데이터를 수집하지 않는다고 명시합니다. README의 비교 표는 Daft를 Pandas, Polars, Modin, Ray Data, PySpark 및 Dask DF와 쿼리 최적화, 멀티모달 지원, 분산 실행, Arrow 지원, 벡터화 실행 및 외부 코어 처리 속성에서 비교합니다. Daft는 Apache 2.0 라이선스로 배포됩니다.