这个项目能做什么
NVIDIA cuDF(发音为“KOO-dee-eff”)是一个采用 Apache 2.0 许可、专为表格数据处理设计的 GPU 加速 DataFrame 库。它是 NVIDIA CUDA-X GPU 加速库套件的一部分。
cuDF 生态系统由多个库组成:
- libcudf:一个 CUDA C++ 库,提供符合 Apache Arrow 的数据结构和表格数据的基础算法。
- pylibcudf:一个 Python 库,为 libcudf 提供 Cython 绑定。
- cudf:一个 Python 库,提供镜像 pandas API 的 DataFrame 库,以及 cudf.pandas,一个可通过 `python -m cudf.pandas` 调用或作为 Jupyter 扩展加载的零代码更改加速器,用于现有 pandas 代码。
- cudf-polars:一个 Python 库,为 Polars 提供 GPU 引擎,允许通过调用 `collect(engine="gpu")` 在 GPU 上运行惰性 API 操作。
- dask-cudf:一个 Python 库,为 Dask DataFrame 提供 GPU 后端。
使用 cuDF 的知名项目包括 Spark RAPIDS(Apache Spark 的 GPU 加速器插件)、Velox-cuDF(一个 Velox 扩展模块,用于在 GPU 上执行 Velox 计划)和 Sirius(一个 GPU 原生 SQL 引擎,为 DuckDB 等库提供扩展)。
安装可通过 pip(带有 CUDA 版本特定后缀,如 -cu12 或 -cu13)、conda(通过 rapidsai 频道)或从源码进行。该库支持读取 Parquet 文件、删除包含空值的缺失行以及执行 groupby 聚合等数据处理操作。
该库欢迎社区贡献,并由 NVIDIA 积极维护。问题和讨论可在 RAPIDS Slack 工作区中发布。
评论
0 评分人数达到10人后显示
登录后参与讨论。