প্রকল্প সম্পর্কে

বৃহৎ আকারের চীনা প্রাকৃতিক ভাষা প্রক্রিয়াকরণ কর্পাস প্রকল্প (nlp_chinese_corpus) চীনা প্রাকৃতিক ভাষা প্রক্রিয়াকরণ ক্ষেত্রের বিকাশে উচ্চমানের কর্পাস অবদান রাখার লক্ষ্যে তৈরি করা হয়েছে। প্রকল্পটি একাধিক লক্ষ থেকে কোটি পর্যায়ে স্ট্রাকচার্ড চীনা ডেটাসেট অন্তর্ভুক্ত করে, যা বৃহৎ মডেল প্রি-ট্রেনিং, শব্দ ভেক্টর ট্রেনিং, টেক্সট শ্রেণিবিন্যাস, প্রশ্নোত্তর সিস্টেম এবং মেশিন অনুবাদ ইত্যাদি কাজে ব্যাপকভাবে ব্যবহারযোগ্য। প্রধানভাবে নিম্নলিখিত ডেটাসেট অন্তর্ভুক্ত: 1. উইকিপিডিয়া (wiki2019zh): ১০ লাখটি সুসংগঠিত চীনা প্রবেশী অন্তর্ভুক্ত করে, id, url, title এবং text ফিল্ড প্রদান করে, সাধারণ চীনা প্রি-ট্রেনিং কর্পাস বা জ্ঞান প্রশ্নোত্তর নির্মাণের জন্য উপযুক্ত। 2. সংবাদ কর্পাস (news2016zh): ২৫ লাখটি সংবাদ অন্তর্ভুক্ত করে, ৬৩ হাজারটি মিডিয়া উৎসের পরিধি, শিরোনাম, কীওয়ার্ড, বর্ণনা, মূল টেক্সট এবং প্রকাশের সময় অন্তর্ভুক্ত করে, সংবাদ শ্রেণিবিন্যাস, শিরোনাম এবং কীওয়ার্ড জেনারেশনের জন্য উপযুক্ত। 3. বৈকি প্রশ্নোত্তর (baike2018qa): ১৫ লাখটি পূর্ব-ফিল্টার করা উচ্চমানের প্রশ্ন এবং উত্তর অন্তর্ভুক্ত করে, প্রায় ৫০০টি বিষয়ের মধ্যে শ্রেণিবদ্ধ, সুপারভাইজড ট্রেনিং, বাক্য সাদৃশ্যতা গণনা এবং প্রশ্নোত্তর সিস্টেম নির্মাণের জন্য উপযুক্ত। 4. কমিউনিটি প্রশ্নোত্তর (webtext2019zh): ৪১ লাখটি উচ্চমানের প্রশ্নোত্তর অন্তর্ভুক্ত করে, লাইক সংখ্যা দ্বারা ফিল্টার করা (কমপক্ষে ৩টি লাইক), ২৮ হাজারটি বিষয়ের পরিধি, অতি বৃহৎ NLP মডেল ট্রেনিং, বিষয় পূর্বাভাস এবং cQA সিস্টেমের জন্য উপযুক্ত। 5. চীনা-ইংরেজি অনুবাদ কর্পাস (translation2019zh): ৫২ লাখ জোড়া চীনা-ইংরেজি সমান্তরাল কর্পাস অন্তর্ভুক্ত করে, মেশিন অনুবাদ সিস্টেম ট্রেনিং বা চীনা কর্পাস আলাদাভাবে নিষ্কাশনের জন্য ব্যবহারযোগ্য।