منصوبے کے بارے میں
بڑے پیمانے پر چینی قدرتی زبان پروسیسنگ کارپس پروجیکٹ (nlp_chinese_corpus) کا مقصد چینی قدرتی زبان پروسیسنگ کے میدان کی ترقی میں اعلیٰ معیار کے کارپس کا حصہ ڈالنا ہے۔ اس پروجیکٹ میں کئی لاکھ سے کروڑوں تک کے متعدد ساختی چینی ڈیٹا سیٹ شامل ہیں، جو بڑے ماڈل کی پیشگی تربیت، لفظ ویکٹر کی تربیت، متن کی درجہ بندی، سوال و جواب کے نظام، اور مشینی ترجمہ جیسے کاموں میں وسیع پیمانے پر استعمال کیے جا سکتے ہیں۔
بنیادی طور پر درج ذیل ڈیٹا سیٹ شامل ہیں:
1. ویکیپیڈیا (wiki2019zh): اس میں 10 لاکھ اچھی ساختہ چینی اندراجات شامل ہیں، جن میں id، url، title اور text فیلڈز فراہم کیے گئے ہیں، جو عام چینی پیشگی تربیتی کارپس یا علمی سوال و جواب کی تعمیر کے لیے موزوں ہیں۔
2. خبروں کا کارپس (news2016zh): اس میں 25 لاکھ خبریں شامل ہیں، جن میں 63,000 میڈیا ذرائع شامل ہیں، جن میں عنوان، کلیدی الفاظ، تفصیل، مرکزی متن اور اشاعت کا وقت موجود ہے، جو خبروں کی درجہ بندی، عنوان اور کلیدی الفاظ کی تخلیق کے لیے موزوں ہے۔
3. انسائیکلوپیڈیا قسم کے سوال و جواب (baike2018qa): اس میں 15 لاکھ پہلے سے فلٹر شدہ اعلیٰ معیار کے سوالات اور جوابات شامل ہیں، جو تقریباً 500 موضوعات میں درجہ بند ہیں، جو نگرانی شدہ تربیت، جملے کی مماثلت کا حساب، اور سوال و جواب کے نظام کی تعمیر کے لیے موزوں ہیں۔
4. کمیونٹی سوال و جواب (webtext2019zh): اس میں 41 لاکھ اعلیٰ معیار کے سوال و جواب شامل ہیں، جنہیں پسندیدگی کی تعداد کی بنیاد پر فلٹر کیا گیا ہے (کم از کم 3 پسندیدگیاں)، جو 28,000 موضوعات پر محیط ہیں، جو بڑے پیمانے پر NLP ماڈلز کی تربیت، موضوع کی پیش گوئی، اور cQA نظام کے لیے موزوں ہیں۔
5. چینی-انگریزی ترجمہ کارپس (translation2019zh): اس میں 52 لاکھ چینی-انگریزی متوازی کارپس شامل ہیں، جو مشینی ترجمہ کے نظام کی تربیت یا الگ سے چینی کارپس نکالنے کے لیے استعمال کیے جا سکتے ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.