প্রকল্প সম্পর্কে
Stanza হলো স্ট্যানফোর্ড NLP গ্রুপের অফিসিয়াল পাইথন প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP) লাইব্রেরি। এটি ৬০+ মানব ভাষায় নির্ভুল NLP টুলস চালানোর সমর্থন প্রদান করে এবং Java Stanford CoreNLP সফটওয়্যার অ্যাক্সেস করার জন্য একটি অফিসিয়াল পাইথন র্যাপার অন্তর্ভুক্ত করে।
মূল বৈশিষ্ট্য
- টোকেনাইজেশন, মাল্টি-ওয়ার্ড টোকেন এক্সপানশন, POS/মরফোলজিক্যাল ট্যাগিং, লেমাটাইজেশন, ডিপেন্ডেন্সি পার্সিং এবং নামযুক্ত সত্তা শনাক্তকরণের (NER) জন্য প্রাক-প্রশিক্ষিত মডেলসহ নিউরাল পাইপলাইন
- ইউনিভার্সাল ডিপেন্ডেন্সিজ ট্রিব্যাংক v2.8-এর জন্য সমর্থন, সাথে বহুল ব্যবহৃত ভাষার জন্য NER মডেল
- বায়োমেডিক্যাল এবং ক্লিনিকাল ইংরেজি মডেল প্যাকেজ যা বায়োমেডিক্যাল সাহিত্য এবং ক্লিনিকাল নোট থেকে সিনট্যাকটিক বিশ্লেষণ এবং NER-এর জন্য
- পাইথন ক্লায়েন্টের মাধ্যমে Java Stanford CoreNLP-এর সম্পূর্ণ কার্যকারিতা অ্যাক্সেস
- কাস্টম CoNLL-U বা BIOES ফরম্যাটের ডেটা থেকে মডেল প্রশিক্ষণ
- Google Colab-এ ইন্টারেক্টিভ ডেমো নোটবুক
ইনস্টলেশন
Stanza-এর জন্য Python 3.6 বা পরবর্তী সংস্করণ প্রয়োজন এবং এটি pip বা Anaconda দিয়ে ইনস্টল করা যায়:
```
pip install stanza
conda install -c stanfordnlp stanza
```
মৌলিক ব্যবহার
```
import stanza
stanza.download('en')
nlp = stanza.Pipeline('en')
doc = nlp('Barack Obama was born in Hawaii.')
doc.sentences[0].print_dependencies()
```
পারফরম্যান্স টিপসের মধ্যে রয়েছে একবারে একটি বাক্য প্রসেস করার পরিবর্তে পাইপলাইনের গতি সর্বোচ্চ করতে ডকুমেন্টগুলো একসাথে ব্যাচ করা (খালি লাইন দিয়ে আলাদা করা)।
কাস্টম মডেল প্রশিক্ষণের জন্য, ব্যবহারকারীদের রিপোজিটরি ক্লোন করে সোর্স থেকে প্রশিক্ষণ চালাতে হয়। টোকেনাইজার, MWT এক্সপ্যান্ডার, POS ট্যাগার, লেমাটাইজার এবং ডিপেন্ডেন্সি পার্সারের জন্য CoNLL-U ফরম্যাটের ডেটা প্রয়োজন; NER মডেলের জন্য BIOES ফরম্যাট প্রয়োজন।
লাইসেন্স: Apache License, Version 2.0
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.