Sobre el proyecto
NVIDIA cuDF (pronunciado "KOO-dee-eff") es una biblioteca de DataFrames acelerada por GPU, con licencia Apache 2.0, diseñada para el procesamiento de datos tabulares. Forma parte del conjunto de bibliotecas aceleradas por GPU NVIDIA CUDA-X.
El ecosistema cuDF consta de varias bibliotecas:
- libcudf: Una biblioteca CUDA C++ con estructuras de datos compatibles con Apache Arrow y algoritmos fundamentales para datos tabulares.
- pylibcudf: Una biblioteca Python que proporciona enlaces Cython para libcudf.
- cudf: Una biblioteca Python que ofrece una biblioteca de DataFrames que refleja la API de pandas, junto con cudf.pandas, un acelerador sin cambios de código para código pandas existente que se puede invocar mediante `python -m cudf.pandas` o cargar como extensión de Jupyter.
- cudf-polars: Una biblioteca Python que proporciona un motor GPU para Polars, permitiendo que operaciones de API diferidas se ejecuten en la GPU llamando a `collect(engine="gpu")`.
- dask-cudf: Una biblioteca Python que proporciona un backend GPU para Dask DataFrames.
Proyectos notables que usan cuDF incluyen Spark RAPIDS (un complemento acelerador GPU para Apache Spark), Velox-cuDF (un módulo de extensión de Velox para ejecutar planes de Velox en la GPU) y Sirius (un motor SQL nativo de GPU que proporciona extensiones para bibliotecas como DuckDB).
La instalación está disponible mediante pip (con sufijos específicos de versión CUDA como -cu12 o -cu13), conda (a través del canal rapidsai) o desde el código fuente. La biblioteca admite la lectura de archivos Parquet, la eliminación de filas con valores nulos y agregaciones groupby, entre otras operaciones de procesamiento de datos.
La biblioteca está abierta a contribuciones de la comunidad y es mantenida activamente por NVIDIA. Las preguntas y discusiones se pueden publicar en el espacio de trabajo RAPIDS Slack.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.