عن المشروع

NVIDIA cuDF (تُنطق "KOO-dee-eff") هي مكتبة DataFrame مسرّعة بواسطة GPU مرخصة بموجب Apache 2.0، مصممة لمعالجة البيانات الجدولية. وهي جزء من مجموعة مكتبات NVIDIA CUDA-X المسرّعة بواسطة GPU. يتكون نظام cuDF البيئي من عدة مكتبات: - libcudf: مكتبة CUDA C++ تحتوي على هياكل بيانات متوافقة مع Apache Arrow وخوارزميات أساسية للبيانات الجدولية. - pylibcudf: مكتبة Python توفر روابط Cython لـ libcudf. - cudf: مكتبة Python توفر مكتبة DataFrame تعكس واجهة pandas، بالإضافة إلى cudf.pandas، وهي مسرّع بدون تغيير في الكود لشفرة pandas الحالية يمكن استدعاؤها عبر `python -m cudf.pandas` أو تحميلها كإضافة Jupyter. - cudf-polars: مكتبة Python توفر محرك GPU لـ Polars، مما يسمح بتشغيل عمليات API الكسولة على GPU عن طريق استدعاء `collect(engine="gpu")`. - dask-cudf: مكتبة Python توفر خلفية GPU لـ Dask DataFrames. من المشاريع البارزة التي تستخدم cuDF: Spark RAPIDS (إضافة مسرّع GPU لـ Apache Spark)، وVelox-cuDF (وحدة تمديد Velox لتنفيذ خطط Velox على GPU)، وSirius (محرك SQL أصلي لـ GPU يوفر إضافات لمكتبات مثل DuckDB). التثبيت متاح عبر pip (مع لواحق خاصة بإصدار CUDA مثل -cu12 أو -cu13)، أو conda (عبر قناة rapidsai)، أو من المصدر. تدعم المكتبة قراءة ملفات Parquet، وإزالة الصفوف المفقودة ذات القيم الفارغة، وإجراء تجميعات groupby، من بين عمليات معالجة البيانات الأخرى. المكتبة مفتوحة لمساهمات المجتمع وتتم صيانتها بنشاط من قبل NVIDIA. يمكن نشر الأسئلة والمناقشات في مساحة عمل RAPIDS Slack.