منصوبے کے بارے میں
Hugging Face Datasets ایک ہلکی پھلکی Python لائبریری ہے جو دو اہم صلاحیتوں پر مرکوز ہے: عوامی ڈیٹاسیٹس کے لیے ایک لائن والے ڈیٹا لوڈرز، اور موثر، قابل تولید ڈیٹا پری پروسیسنگ۔
ڈیٹا لوڈ کرنا
- `load_dataset()` Hugging Face Hub یا مقامی فائلوں سے ڈیٹاسیٹس حاصل کرتا ہے۔ Hub میں ڈیٹاسیٹس کا ایک بڑا اور بڑھتا ہوا مجموعہ موجود ہے جس میں تصویر، آڈیو، متن (سینکڑوں زبانیں اور بولیاں)، 3D طبی امیجنگ، ویڈیو، اور AI ایجنٹ ٹریس شامل ہیں۔
- مقامی فارمیٹس میں CSV، JSON، JSONL، Parquet، Arrow، HDF5، XML، سادہ متن، PNG، JPEG، WAV، MP3، PDF اور NIfTI شامل ہیں۔
- ڈیٹاسیٹس Python آبجیکٹس سے بھی بنائے جا سکتے ہیں: ڈکشنریز، لسٹیں، Pandas DataFrames، یا جنریٹرز۔
ڈیٹا پروسیس کرنا
- `dataset.map()` مثالوں پر صارف کے فنکشنز لاگو کرتا ہے، جس میں بیچنگ اور ملٹی پروسیسنگ (`num_proc`) متوازی رفتار کے لیے شامل ہے۔
- نتائج کیش ہوتے ہیں، لہذا بار بار پروسیسنگ کے مراحل دوبارہ شمار نہیں ہوتے۔
- Apache Arrow بیک اینڈ صفر کاپی، میموری میپڈ اسٹوریج فراہم کرتا ہے، جس سے ڈیٹاسیٹس دستیاب RAM سے بڑے ہو سکتے ہیں۔
- اسٹریمنگ موڈ (`streaming=True`) ڈیٹا کو پہلے ڈاؤن لوڈ کیے بغیر فوری طور پر iterate کرتا ہے، جو بہت بڑے یا ڈسک محدود ورک لوڈز کے لیے مفید ہے۔
انٹرآپریبلٹی
- NumPy، Pandas، Polars، Arrow، PyTorch، TensorFlow، JAX اور Spark کے ساتھ مقامی تبدیلی۔
- مماثلت تلاش کے لیے بلٹ ان FAISS اور Elasticsearch انڈیکس سپورٹ۔
- ایک `Json()` فیچر قسم لچکدار ساختہ ڈیٹا کو ہینڈل کرتی ہے۔
بنیادی کلاسیں
- `Dataset`: میموری میں یا میموری میپڈ، انڈیکسنگ، سلائسنگ، بے ترتیب رسائی اور کیشنگ کو سپورٹ کرتا ہے۔
- `IterableDataset`: lazy اور streamable، آؤٹ آف کور پروسیسنگ کے لیے۔
- دونوں `DatasetDict` / `IterableDatasetDict` میں لپیٹے گئے ہیں تاکہ ملٹی اسپلٹ ڈیٹاسیٹس جیسے train/test/validation کے لیے۔
انسٹالیشن اور اضافی چیزیں
- pip (`pip install datasets`) یا conda (`conda install -c huggingface -c conda-forge datasets`) کے ذریعے انسٹال کیا جا سکتا ہے۔
- اختیاری اضافی چیزیں آڈیو، ویژن، PDFs/NIfTI، اور PyTorch، TensorFlow اور JAX کے لیے فریم ورک انٹیگریشنز کا احاطہ کرتی ہیں۔
کمیونٹی اور تولیدی صلاحیت
- پروجیکٹ دستاویز کرتا ہے کہ Hub پر ویب، Python یا Git کے ذریعے ڈیٹاسیٹس کیسے اپ لوڈ اور شیئر کیے جائیں۔
- صارفین کو تولیدی صلاحیت کے لیے ڈیٹاسیٹ ریویژن پن کرنے کی ترغیب دی جاتی ہے۔
- شراکتیں خوش آئند ہیں، جس میں مسائل، پل ریکویسٹ، کوڈ اسٹائل (Ruff)، ٹیسٹنگ اور دستاویزات کا احاطہ کرنے والی شراکت گائیڈ موجود ہے۔
- لائبریری کو EMNLP 2021 سسٹم ڈیموسٹریشن پیپر میں بیان کیا گیا ہے اور حوالہ کے لیے ورژن شدہ Zenodo DOIs موجود ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.