Sobre o projeto
NVIDIA cuDF (pronunciado "KOO-dee-eff") é uma biblioteca de DataFrame acelerada por GPU, licenciada sob Apache 2.0, projetada para processamento de dados tabulares. Ela faz parte do conjunto de bibliotecas aceleradas por GPU NVIDIA CUDA-X.
O ecossistema cuDF consiste em várias bibliotecas:
- libcudf: Uma biblioteca CUDA C++ com estruturas de dados compatíveis com Apache Arrow e algoritmos fundamentais para dados tabulares.
- pylibcudf: Uma biblioteca Python que fornece bindings Cython para libcudf.
- cudf: Uma biblioteca Python que fornece uma biblioteca DataFrame que espelha a API do pandas, juntamente com cudf.pandas, um acelerador de mudança zero de código para código pandas existente que pode ser invocado via `python -m cudf.pandas` ou carregado como uma extensão Jupyter.
- cudf-polars: Uma biblioteca Python que fornece um mecanismo GPU para Polars, permitindo que operações de API lazy sejam executadas na GPU chamando `collect(engine="gpu")`.
- dask-cudf: Uma biblioteca Python que fornece um backend GPU para Dask DataFrames.
Projetos notáveis que usam cuDF incluem Spark RAPIDS (um plugin acelerador GPU para Apache Spark), Velox-cuDF (um módulo de extensão Velox para executar planos Velox na GPU) e Sirius (um mecanismo SQL nativo GPU que fornece extensões para bibliotecas como DuckDB).
A instalação está disponível via pip (com sufixos específicos de versão CUDA, como -cu12 ou -cu13), conda (via canal rapidsai) ou a partir do código-fonte. A biblioteca suporta leitura de arquivos Parquet, remoção de linhas ausentes com valores nulos e agregações groupby, entre outras operações de processamento de dados.
A biblioteca está aberta a contribuições da comunidade e é mantida ativamente pela NVIDIA. Perguntas e discussões podem ser postadas no espaço de trabalho RAPIDS Slack.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.