منصوبے کے بارے میں
اسٹانزا اسٹینفورڈ NLP گروپ کی سرکاری پائتھون قدرتی زبان کی پروسیسنگ لائبریری ہے۔ یہ 60 سے زائد انسانی زبانوں میں درست NLP ٹولز چلانے کی سہولت فراہم کرتی ہے اور جاوا اسٹینفورڈ CoreNLP سافٹ ویئر تک رسائی کے لیے ایک سرکاری پائتھون ریپر بھی شامل کرتی ہے۔
اہم خصوصیات
- ٹوکنائزیشن، کثیر الفاظ ٹوکن کی توسیع، POS/مورفولوجیکل ٹیگنگ، لیمیٹائزیشن، انحصار پارسنگ، اور نامزد ادارہ شناخت (NER) کے لیے پہلے سے تربیت یافتہ ماڈلز کے ساتھ عصبی پائپ لائن
- تمام Universal Dependencies ٹری بینکس v2.8 کی معاونت، ساتھ ہی زیادہ بولی جانے والی زبانوں کے لیے NER ماڈلز
- حیاتیاتی ادب اور کلینیکل نوٹس سے نحوی تجزیے اور NER کے لیے بائیو میڈیکل اور کلینیکل انگریزی ماڈل پیکجز
- پائتھون کلائنٹ کے ذریعے جاوا اسٹینفورڈ CoreNLP کی مکمل فعالیت تک رسائی
- حسب ضرورت CoNULL-U یا BIOES فارمیٹ شدہ ڈیٹا سے ماڈل کی تربیت
- Google Colab پر دستیاب انٹرایکٹو ڈیمو نوٹ بکس
تنصیب
اسٹانزا کے لیے پائتھون 3.6 یا اس سے جدید درکار ہے اور اسے pip یا Anaconda کے ذریعے انسٹال کیا جا سکتا ہے:
```
pip install stanza
conda install -c stanfordnlp stanza
```
بنیادی استعمال
```
import stanza
stanza.download('en')
nlp = stanza.Pipeline('en')
doc = nlp('Barack Obama was born in Hawaii.')
doc.sentences[0].print_dependencies()
```
کارکردگی کے مشوروں میں یہ شامل ہے کہ ایک وقت میں ایک جملہ پروسیس کرنے کے بجائے دستاویزات کو ایک ساتھ بیچ کیا جائے (خالی لائنوں سے الگ کر کے) تاکہ پائپ لائن کی رفتار زیادہ سے زیادہ ہو۔
حسب ضرورت ماڈل کی تربیت کے لیے صارفین کو ریپوزٹری کلون کر کے سورس سے تربیت چلانی ہوگی۔ ٹوکنائزر، MWT ایکسپینڈر، POS ٹیگر، لیمیٹائزر، اور انحصار پارسر کے لیے CoNLL-U فارمیٹ شدہ ڈیٹا درکار ہے؛ NER ماڈلز کے لیے BIOES فارمیٹ درکار ہے۔
لائسنس: Apache License, Version 2.0
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.