Об этом проекте
NVIDIA cuDF (произносится «КУ-ди-эф») — это библиотека DataFrame с GPU-ускорением, лицензированная под Apache 2.0, предназначенная для обработки табличных данных. Она является частью набора библиотек NVIDIA CUDA-X с GPU-ускорением.
Экосистема cuDF состоит из нескольких библиотек:
- libcudf: библиотека на CUDA C++ со структурами данных, совместимыми с Apache Arrow, и фундаментальными алгоритмами для табличных данных.
- pylibcudf: библиотека Python, предоставляющая привязки Cython для libcudf.
- cudf: библиотека Python, предоставляющая библиотеку DataFrame, которая повторяет API pandas, а также cudf.pandas — ускоритель для существующего кода pandas без изменения кода, который можно вызвать через `python -m cudf.pandas` или загрузить как расширение Jupyter.
- cudf-polars: библиотека Python, предоставляющая GPU-движок для Polars, позволяющая выполнять операции ленивого API на GPU с помощью вызова `collect(engine="gpu")`.
- dask-cudf: библиотека Python, предоставляющая GPU-бэкенд для Dask DataFrames.
Известные проекты, использующие cuDF, включают Spark RAPIDS (плагин GPU-ускорения для Apache Spark), Velox-cuDF (модуль расширения Velox для выполнения планов Velox на GPU) и Sirius (нативный SQL-движок на GPU, предоставляющий расширения для таких библиотек, как DuckDB).
Установка доступна через pip (с суффиксами, зависящими от версии CUDA, например -cu12 или -cu13), conda (через канал rapidsai) или из исходного кода. Библиотека поддерживает чтение файлов Parquet, удаление строк с пропущенными значениями null и выполнение агрегаций groupby, среди прочих операций обработки данных.
Библиотека открыта для вклада сообщества и активно поддерживается NVIDIA. Вопросы и обсуждения можно размещать в рабочем пространстве RAPIDS Slack.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.