منصوبے کے بارے میں
Hugging Face Tokenizers ایک اعلیٰ کارکردگی والی ٹوکنائزیشن لائبریری ہے جو تحقیق اور پروڈکشن دونوں کے لیے ڈیزائن کی گئی ہے۔ یہ Rust کور امپلیمنٹیشن فراہم کرتی ہے جس میں Python اور Node.js کے لیے بائنڈنگز شامل ہیں، اور اس کا مقصد صنعت کا معیاری ٹوکنائزیشن انجن بننا ہے۔
اہم خصوصیات میں شامل ہیں:
- متعدد ٹوکنائزیشن ماڈلز کی حمایت: BPE، Unigram، WordPiece، اور WordLevel۔
- مکمل پائپ لائن اجزاء: Normalizer، PreTokenizer، Model، PostProcessor، اور Decoder۔
- رفتار اور کارکردگی کے لیے بہتر بنایا گیا، ہارڈویئر کے مطابق ڈھلے کرنلز (NEON، AVX-512، SSE، SIMD128) اور پورٹیبل متبادل کے ساتھ۔
- ماڈیولر استعمال کے لیے ذیلی کریٹس: `tk-encode` (انفرنس انجن)، `bitcannon` (بٹ اسٹریم پری ٹوکنائزیشن)، `tk-serialize` (ریڈر)، `tk-convert` (لیگیسی کنورژن)، `tk-train` (ٹریننگ)، اور `bitmap_gen` (صرف ڈیولپمنٹ کے لیے ٹیبل جنریٹر)۔
- `from_pretrained` کے ذریعے Hugging Face ماڈلز کے ساتھ آسان انٹیگریشن۔
- v1.0.0 کے روڈ میپ میں ٹریننگ کی بحالی، زیرو کاپی کے ساتھ بیچ انکوڈنگ، PyTorch/JAX/NumPy انٹرآپ کے لیے dlpack API، اور مزید شامل ہیں۔
انسٹالیشن: `pip install --pre tokenizers`
استعمال کی مثال:
```python
from tokenizers import Tokenizer
tokenizer = Tokenizer.from_pretrained("meta-llama/Llama-3.1-8B")
tokenizer.encode("Hello, y'all! How are you 😁 ?")
```
یہ لائبریری Hugging Face اور کمیونٹی کی جانب سے فعال طور پر تیار کی جا رہی ہے، جس کا فوکس کارکردگی اور وسیع زبان کی حمایت پر ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.