इस प्रोजेक्ट के बारे में
NVIDIA cuDF (उच्चारण "KOO-dee-eff") एक Apache 2.0 लाइसेंस प्राप्त, GPU-त्वरित DataFrame लाइब्रेरी है जो सारणीबद्ध डेटा प्रोसेसिंग के लिए डिज़ाइन की गई है। यह NVIDIA CUDA-X GPU-त्वरित लाइब्रेरीज़ के सुइट का हिस्सा है।
cuDF इकोसिस्टम में कई लाइब्रेरीज़ शामिल हैं:
- libcudf: एक CUDA C++ लाइब्रेरी जिसमें Apache Arrow संगत डेटा संरचनाएं और सारणीबद्ध डेटा के लिए मौलिक एल्गोरिदम हैं।
- pylibcudf: एक Python लाइब्रेरी जो libcudf के लिए Cython बाइंडिंग प्रदान करती है।
- cudf: एक Python लाइब्रेरी जो pandas API को प्रतिबिंबित करने वाली DataFrame लाइब्रेरी प्रदान करती है, साथ ही cudf.pandas, जो मौजूदा pandas कोड के लिए एक शून्य-कोड-परिवर्तन त्वरक है, जिसे `python -m cudf.pandas` के माध्यम से या Jupyter एक्सटेंशन के रूप में लोड किया जा सकता है।
- cudf-polars: एक Python लाइब्रेरी जो Polars के लिए GPU इंजन प्रदान करती है, जिससे lazy API संचालन GPU पर चल सकते हैं, `collect(engine="gpu")` कॉल करके।
- dask-cudf: एक Python लाइब्रेरी जो Dask DataFrames के लिए GPU बैकएंड प्रदान करती है।
cuDF का उपयोग करने वाली उल्लेखनीय परियोजनाओं में Spark RAPIDS (Apache Spark के लिए एक GPU त्वरक प्लगइन), Velox-cuDF (Velox योजनाओं को GPU पर निष्पादित करने के लिए एक Velox एक्सटेंशन मॉड्यूल), और Sirius (एक GPU-नेटिव SQL इंजन जो DuckDB जैसी लाइब्रेरीज़ के लिए एक्सटेंशन प्रदान करता है) शामिल हैं।
स्थापना pip (CUDA संस्करण-विशिष्ट प्रत्यय जैसे -cu12 या -cu13 के साथ), conda (rapidsai चैनल के माध्यम से), या स्रोत से उपलब्ध है। लाइब्रेरी Parquet फ़ाइलें पढ़ने, null मानों वाली पंक्तियों को हटाने, और groupby एग्रीगेशन करने जैसे विभिन्न डेटा प्रोसेसिंग संचालन का समर्थन करती है।
लाइब्रेरी सामुदायिक योगदान के लिए खुली है और NVIDIA द्वारा सक्रिय रूप से बनाए रखी जाती है। प्रश्न और चर्चाएं RAPIDS Slack वर्कस्पेस में पोस्ट की जा सकती हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.