Sobre o projeto

NVIDIA cuDF (pronunciado "KOO-dee-eff") é uma biblioteca de DataFrame acelerada por GPU, licenciada sob Apache 2.0, projetada para processamento de dados tabulares. Ela faz parte do conjunto de bibliotecas aceleradas por GPU NVIDIA CUDA-X. O ecossistema cuDF consiste em várias bibliotecas: - libcudf: Uma biblioteca CUDA C++ com estruturas de dados compatíveis com Apache Arrow e algoritmos fundamentais para dados tabulares. - pylibcudf: Uma biblioteca Python que fornece bindings Cython para libcudf. - cudf: Uma biblioteca Python que fornece uma biblioteca DataFrame que espelha a API do pandas, juntamente com cudf.pandas, um acelerador de mudança zero de código para código pandas existente que pode ser invocado via `python -m cudf.pandas` ou carregado como uma extensão Jupyter. - cudf-polars: Uma biblioteca Python que fornece um mecanismo GPU para Polars, permitindo que operações de API lazy sejam executadas na GPU chamando `collect(engine="gpu")`. - dask-cudf: Uma biblioteca Python que fornece um backend GPU para Dask DataFrames. Projetos notáveis que usam cuDF incluem Spark RAPIDS (um plugin acelerador GPU para Apache Spark), Velox-cuDF (um módulo de extensão Velox para executar planos Velox na GPU) e Sirius (um mecanismo SQL nativo GPU que fornece extensões para bibliotecas como DuckDB). A instalação está disponível via pip (com sufixos específicos de versão CUDA, como -cu12 ou -cu13), conda (via canal rapidsai) ou a partir do código-fonte. A biblioteca suporta leitura de arquivos Parquet, remoção de linhas ausentes com valores nulos e agregações groupby, entre outras operações de processamento de dados. A biblioteca está aberta a contribuições da comunidade e é mantida ativamente pela NVIDIA. Perguntas e discussões podem ser postadas no espaço de trabalho RAPIDS Slack.