প্রকল্প সম্পর্কে

Stanza হলো স্ট্যানফোর্ড NLP গ্রুপের অফিসিয়াল পাইথন প্রাকৃতিক ভাষা প্রক্রিয়াকরণ (NLP) লাইব্রেরি। এটি ৬০+ মানব ভাষায় নির্ভুল NLP টুলস চালানোর সমর্থন প্রদান করে এবং Java Stanford CoreNLP সফটওয়্যার অ্যাক্সেস করার জন্য একটি অফিসিয়াল পাইথন র্যাপার অন্তর্ভুক্ত করে। মূল বৈশিষ্ট্য - টোকেনাইজেশন, মাল্টি-ওয়ার্ড টোকেন এক্সপানশন, POS/মরফোলজিক্যাল ট্যাগিং, লেমাটাইজেশন, ডিপেন্ডেন্সি পার্সিং এবং নামযুক্ত সত্তা শনাক্তকরণের (NER) জন্য প্রাক-প্রশিক্ষিত মডেলসহ নিউরাল পাইপলাইন - ইউনিভার্সাল ডিপেন্ডেন্সিজ ট্রিব্যাংক v2.8-এর জন্য সমর্থন, সাথে বহুল ব্যবহৃত ভাষার জন্য NER মডেল - বায়োমেডিক্যাল এবং ক্লিনিকাল ইংরেজি মডেল প্যাকেজ যা বায়োমেডিক্যাল সাহিত্য এবং ক্লিনিকাল নোট থেকে সিনট্যাকটিক বিশ্লেষণ এবং NER-এর জন্য - পাইথন ক্লায়েন্টের মাধ্যমে Java Stanford CoreNLP-এর সম্পূর্ণ কার্যকারিতা অ্যাক্সেস - কাস্টম CoNLL-U বা BIOES ফরম্যাটের ডেটা থেকে মডেল প্রশিক্ষণ - Google Colab-এ ইন্টারেক্টিভ ডেমো নোটবুক ইনস্টলেশন Stanza-এর জন্য Python 3.6 বা পরবর্তী সংস্করণ প্রয়োজন এবং এটি pip বা Anaconda দিয়ে ইনস্টল করা যায়: ``` pip install stanza conda install -c stanfordnlp stanza ``` মৌলিক ব্যবহার ``` import stanza stanza.download('en') nlp = stanza.Pipeline('en') doc = nlp('Barack Obama was born in Hawaii.') doc.sentences[0].print_dependencies() ``` পারফরম্যান্স টিপসের মধ্যে রয়েছে একবারে একটি বাক্য প্রসেস করার পরিবর্তে পাইপলাইনের গতি সর্বোচ্চ করতে ডকুমেন্টগুলো একসাথে ব্যাচ করা (খালি লাইন দিয়ে আলাদা করা)। কাস্টম মডেল প্রশিক্ষণের জন্য, ব্যবহারকারীদের রিপোজিটরি ক্লোন করে সোর্স থেকে প্রশিক্ষণ চালাতে হয়। টোকেনাইজার, MWT এক্সপ্যান্ডার, POS ট্যাগার, লেমাটাইজার এবং ডিপেন্ডেন্সি পার্সারের জন্য CoNLL-U ফরম্যাটের ডেটা প্রয়োজন; NER মডেলের জন্য BIOES ফরম্যাট প্রয়োজন। লাইসেন্স: Apache License, Version 2.0