À propos du projet

NVIDIA cuDF (prononcé « KOO-dee-eff ») est une bibliothèque de DataFrames accélérée par GPU, sous licence Apache 2.0, conçue pour le traitement de données tabulaires. Elle fait partie de la suite CUDA-X de bibliothèques accélérées par GPU de NVIDIA. L'écosystème cuDF comprend plusieurs bibliothèques : - libcudf : une bibliothèque CUDA C++ avec des structures de données conformes à Apache Arrow et des algorithmes fondamentaux pour les données tabulaires. - pylibcudf : une bibliothèque Python fournissant des liaisons Cython pour libcudf. - cudf : une bibliothèque Python fournissant une bibliothèque de DataFrames qui reflète l'API pandas, ainsi que cudf.pandas, un accélérateur sans changement de code pour le code pandas existant, invocable via `python -m cudf.pandas` ou chargé comme extension Jupyter. - cudf-polars : une bibliothèque Python fournissant un moteur GPU pour Polars, permettant d'exécuter des opérations d'API paresseuses sur le GPU en appelant `collect(engine="gpu")`. - dask-cudf : une bibliothèque Python fournissant un backend GPU pour les DataFrames Dask. Parmi les projets notables utilisant cuDF figurent Spark RAPIDS (un plugin d'accélération GPU pour Apache Spark), Velox-cuDF (un module d'extension Velox pour exécuter des plans Velox sur le GPU) et Sirius (un moteur SQL natif GPU fournissant des extensions pour des bibliothèques comme DuckDB). L'installation est possible via pip (avec des suffixes spécifiques à la version CUDA, comme -cu12 ou -cu13), conda (via le canal rapidsai) ou à partir des sources. La bibliothèque prend en charge la lecture de fichiers Parquet, la suppression de lignes manquantes avec des valeurs nulles et l'exécution d'agrégations groupby, entre autres opérations de traitement de données. La bibliothèque est ouverte aux contributions de la communauté et est activement maintenue par NVIDIA. Les questions et discussions peuvent être publiées dans l'espace de travail RAPIDS Slack.