প্রকল্প সম্পর্কে
HanLP (Han Language Processing) একটি প্রোডাকশন-গ্রেড বহুভাষিক প্রাকৃতিক ভাষা প্রক্রিয়াকরণ টুলকিট, যা PyTorch এবং TensorFlow 2.x ডুয়াল-ইঞ্জিনের উপর ভিত্তি করে তৈরি। প্রকল্পটির লক্ষ্য অত্যাধুনিক NLP প্রযুক্তিকে বাস্তবায়নে সহজলভ্য করা, যার বৈশিষ্ট্যগুলির মধ্যে রয়েছে সম্পূর্ণ কার্যকারিতা, উচ্চ নির্ভুলতা, উচ্চ কর্মক্ষমতা, আপ-টু-ডেট কর্পোরা, পরিষ্কার আর্কিটেকচার এবং কাস্টমাইজেশন ক্ষমতা।
কার্যকারিতা কভারেজ:
- টোকেনাইজেশন (মোটা ও সূক্ষ্ম)
- POS ট্যাগিং (CTB, PKU, 863 ইত্যাদি মান)
- নামযুক্ত সত্তা শনাক্তকরণ (PKU, MSRA, OntoNotes ইত্যাদি মান)
- নির্ভরতা-ভিত্তিক সিনট্যাক্স পার্সিং (SD, UD, PMT)
- উপাদান-ভিত্তিক সিনট্যাক্স পার্সিং (চাইনিজ ট্রি ব্যাংক)
- সেম্যান্টিক নির্ভরতা বিশ্লেষণ (CSDP)
- সেম্যান্টিক রোল লেবেলিং (চাইনিজ প্রপোজিশন ব্যাংক)
- অ্যাবস্ট্রাক্ট মিনিং রিপ্রেজেন্টেশন (CAMR)
- কোরেফারেন্স রেজোলিউশন
- সেম্যান্টিক টেক্সট সিমিলারিটি
- টেক্সট স্টাইল ট্রান্সফরমেশন
- কীওয়ার্ড ও ফ্রেজ এক্সট্রাকশন
- এক্সট্র্যাক্টিভ ও জেনারেটিভ অটো-সামারি
- টেক্সট গ্রামার কারেকশন
- টেক্সট ক্লাসিফিকেশন ও সেন্টিমেন্ট বিশ্লেষণ
- ভাষা শনাক্তকরণ
- ওয়ার্ড ভেক্টর ও ক্লোজ টেস্ট
- সরলীকৃত-ঐতিহ্যবাহী চীনা রূপান্তর, ফোনেটিক ট্রান্সক্রিপশন, নতুন শব্দ আবিষ্কার, টেক্সট ক্লাস্টারিং (1.x সংস্করণের রেফারেন্স)
বহুভাষিক সমর্থন: বৃহৎ-স্কেল বহুভাষিক কর্পোরার সাহায্যে, HanLP 2.1 সরলীকৃত ও ঐতিহ্যবাহী চীনা, ইংরেজি, জাপানি, রুশ, ফরাসি, জার্মান সহ ১৩০টি ভাষায় ১০টি যৌথ কাজ এবং বিভিন্ন একক কাজ সমর্থন করে।
দুই ধরনের API:
1. লাইটওয়েট RESTful API: আকার মাত্র কয়েক কিলোবাইট, দ্রুত উন্নয়ন ও মোবাইল অ্যাপের জন্য উপযুক্ত, GPU পরিবেশের প্রয়োজন নেই, দ্রুত ইনস্টলেশন। Python, Golang, Java ক্লায়েন্ট প্রদান করে।
2. উচ্চ-ক্ষমতাসম্পন্ন native API: PyTorch, TensorFlow-এর মতো ডিপ লার্নিং প্রযুক্তির উপর নির্ভরশীল, পেশাদার NLP ইঞ্জিনিয়ার, গবেষক এবং স্থানীয় বৃহৎ ডেটা পরিস্থিতির জন্য উপযুক্ত। Python 3.6 থেকে 3.10 প্রয়োজন, Windows সমর্থিত, ইউনিক্স-সদৃশ সিস্টেম সুপারিশকৃত, CPU-তে চলতে পারে, GPU/TPU সুপারিশকৃত।
মডেল প্রকার:
- মাল্টি-টাস্ক মডেল: দ্রুত, কম মেমরি ব্যবহার, এক কলেই একাধিক কাজ সম্পন্ন করতে পারে।
- সিঙ্গেল-টাস্ক মডেল: উচ্চ নির্ভুলতা, আরও নমনীয়, পাইপলাইন মোডে একত্রিত করা যায়।
কাস্টমাইজেশন ক্ষমতা: দক্ষ trie-ট্রি কাস্টম অভিধান, এবং বাধ্যতামূলক, একীভূতকরণ, সংশোধন তিনটি নিয়ম সমর্থন করে; নিয়মের ফলাফল পরবর্তী পরিসংখ্যানগত মডেলগুলিতে নির্বিঘ্নে প্রয়োগ করা যায়, দ্রুত নতুন ডোমেইনে মানিয়ে নেওয়া যায়।
আউটপুট ফরম্যাট: যেকোনো API, ডেভেলপমেন্ট ভাষা বা প্রাকৃতিক ভাষা নির্বিশেষে, আউটপুট সর্বদা JSON ফরম্যাটে, dict-সামঞ্জস্যপূর্ণ Document অবজেক্টে থাকে, যাতে টোকেনাইজেশন, POS, নামযুক্ত সত্তা, সেম্যান্টিক রোল, নির্ভরতা সিনট্যাক্স, সেম্যান্টিক নির্ভরতা, উপাদান সিনট্যাক্স ইত্যাদি ক্ষেত্র অন্তর্ভুক্ত থাকে। Python-এর RESTful ও native API মনোস্পেসড ফন্ট-ভিত্তিক ভিজ্যুয়ালাইজেশনও সমর্থন করে, যা সরাসরি কনসোলে ভাষাগত কাঠামো প্রদর্শন করতে পারে।
প্রকল্পটি কাস্টম ডোমেইন মডেল প্রশিক্ষণের পথও প্রদান করে এবং EMNLP পেপার সাইটেশন অন্তর্ভুক্ত করে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.