Об этом проекте

NVIDIA cuDF (произносится «КУ-ди-эф») — это библиотека DataFrame с GPU-ускорением, лицензированная под Apache 2.0, предназначенная для обработки табличных данных. Она является частью набора библиотек NVIDIA CUDA-X с GPU-ускорением. Экосистема cuDF состоит из нескольких библиотек: - libcudf: библиотека на CUDA C++ со структурами данных, совместимыми с Apache Arrow, и фундаментальными алгоритмами для табличных данных. - pylibcudf: библиотека Python, предоставляющая привязки Cython для libcudf. - cudf: библиотека Python, предоставляющая библиотеку DataFrame, которая повторяет API pandas, а также cudf.pandas — ускоритель для существующего кода pandas без изменения кода, который можно вызвать через `python -m cudf.pandas` или загрузить как расширение Jupyter. - cudf-polars: библиотека Python, предоставляющая GPU-движок для Polars, позволяющая выполнять операции ленивого API на GPU с помощью вызова `collect(engine="gpu")`. - dask-cudf: библиотека Python, предоставляющая GPU-бэкенд для Dask DataFrames. Известные проекты, использующие cuDF, включают Spark RAPIDS (плагин GPU-ускорения для Apache Spark), Velox-cuDF (модуль расширения Velox для выполнения планов Velox на GPU) и Sirius (нативный SQL-движок на GPU, предоставляющий расширения для таких библиотек, как DuckDB). Установка доступна через pip (с суффиксами, зависящими от версии CUDA, например -cu12 или -cu13), conda (через канал rapidsai) или из исходного кода. Библиотека поддерживает чтение файлов Parquet, удаление строк с пропущенными значениями null и выполнение агрегаций groupby, среди прочих операций обработки данных. Библиотека открыта для вклада сообщества и активно поддерживается NVIDIA. Вопросы и обсуждения можно размещать в рабочем пространстве RAPIDS Slack.