프로젝트 소개

NVIDIA cuDF("쿠디에프"로 발음)는 Apache 2.0 라이선스 하에 제공되는 GPU 가속 DataFrame 라이브러리로, 테이블 형식 데이터 처리를 위해 설계되었습니다. 이는 NVIDIA CUDA-X GPU 가속 라이브러리 제품군의 일부입니다. cuDF 생태계는 여러 라이브러리로 구성됩니다: - libcudf: Apache Arrow 호환 데이터 구조와 테이블 형식 데이터를 위한 기본 알고리즘을 갖춘 CUDA C++ 라이브러리입니다. - pylibcudf: libcudf에 대한 Cython 바인딩을 제공하는 Python 라이브러리입니다. - cudf: pandas API를 반영한 DataFrame 라이브러리를 제공하는 Python 라이브러리로, 기존 pandas 코드를 수정 없이 가속화하는 cudf.pandas를 포함합니다. 이는 `python -m cudf.pandas`로 호출하거나 Jupyter 확장으로 로드할 수 있습니다. - cudf-polars: Polars용 GPU 엔진을 제공하는 Python 라이브러리로, `collect(engine="gpu")`를 호출하여 지연 API 작업을 GPU에서 실행할 수 있습니다. - dask-cudf: Dask DataFrame용 GPU 백엔드를 제공하는 Python 라이브러리입니다. cuDF를 사용하는 주요 프로젝트로는 Spark RAPIDS(Apache Spark용 GPU 가속 플러그인), Velox-cuDF(GPU에서 Velox 계획을 실행하는 Velox 확장 모듈), Sirius(DuckDB 같은 라이브러리용 확장을 제공하는 GPU 네이티브 SQL 엔진)가 있습니다. 설치는 pip(CUDA 버전별 접미사 -cu12 또는 -cu13 포함), conda(rapidsai 채널 사용), 또는 소스에서 가능합니다. 이 라이브러리는 Parquet 파일 읽기, null 값이 있는 누락 행 제거, groupby 집계 수행 등 다양한 데이터 처리 작업을 지원합니다. 이 라이브러리는 커뮤니티 기여에 개방되어 있으며 NVIDIA가 적극적으로 유지 관리합니다. 질문과 토론은 RAPIDS Slack 워크스페이스에 게시할 수 있습니다.