প্রকল্প সম্পর্কে

Cantonese-LLM-Lab একটি ওপেন-সোর্স প্রকল্প যা ক্যান্টনিজ বৃহৎ ভাষা মডেল ফাইন-টিউনিং, মূল্যায়ন এবং দেশীয় Ascend হার্ডওয়্যার অভিযোজনকে কেন্দ্র করে গড়ে উঠেছে, মূলত সেই গবেষক ও প্রকৌশলীদের জন্য যারা ক্যান্টনিজ প্রশ্নোত্তর মডেল পুনরুৎপাদন বা উন্নত করতে চান। প্রকল্পটি LLM পর্যালোচনার উপর নির্ভর করে না, বরং একটি পুনর্ব্যবহারযোগ্য বস্তুনিষ্ঠ মূল্যায়ন ফ্রেমওয়ার্ক প্রদান করে: HKMMLU অফিসিয়াল মান অনুযায়ী পূর্ণ মূল্যায়ন, অফিসিয়াল ক্যান্টনিজ-ম্যান্ডারিন পারস্পরিক অনুবাদ টাস্ক, লিখিত ক্যান্টনিজ বিশুদ্ধতা, অবক্ষয় সনাক্তকরণ এবং পারপ্লেক্সিটি, এবং সকল প্রশ্নের জন্য জোড়াভিত্তিক McNemar নির্ভুল পরীক্ষা করা হয়। প্রকল্পটিতে ছয়টি প্রধান অংশ রয়েছে: প্রথমটি হলো উপরে উল্লিখিত মূল্যায়ন ফ্রেমওয়ার্ক; দ্বিতীয়টি হলো প্রম্পট অ্যাবলেশন পদ্ধতি, যা 2×2 (ভাষা × ফরম্যাট স্ক্যাফোল্ড) ব্যবহার করে পরীক্ষা করে যে র‌্যাংকিং প্রম্পট নির্বাচনের দ্বারা প্রভাবিত হয় কিনা; তৃতীয়টি হলো রিলিজ গেট, যা নন-ইনফিরিওরিটি পরীক্ষা এবং δ সংবেদনশীলতা পরীক্ষা ব্যবহার করে; চতুর্থটি হলো LoRA ডায়াগনস্টিক টুল, যা মডিউল অনুযায়ী ‖ΔW‖/‖W‖ গণনা করে; পঞ্চমটি হলো বহু-উৎস ক্যান্টনিজ SFT ডেটা পুনর্নির্মাণ স্ক্রিপ্ট, যার মধ্যে রয়েছে সরলীকৃত-ঐতিহ্যবাহী চীনা অক্ষর স্বাভাবিকীকরণ, দুই-স্তরের ডিডুপ্লিকেশন এবং আগে ভাগ করে পরে প্রশিক্ষণ; ষষ্ঠটি হলো Ascend 910C অভিযোজন রেকর্ড, যার মধ্যে রয়েছে CUDA থেকে মাইগ্রেশনে মাত্র ৪ লাইন পরিবর্তন, নেটিভ W8A8 কোয়ান্টাইজেশন, গ্রাফ মোড অপ্টিমাইজেশনের নেতিবাচক ফলাফল, এবং ত্রুটি বার্তা প্রকৃত মূল কারণের সাথে মেলে না এমন সমস্যা। রিপোজিটরিতে সম্পূর্ণ মূল্যায়ন, প্রশিক্ষণ এবং ডিপ্লয়মেন্ট স্ক্রিপ্ট প্রদান করা হয়েছে, যার মধ্যে eval/ এর অধীনে একাধিক মূল্যায়ন ও পরিসংখ্যান টুল, data/build_yue_sft.py ডেটা নির্মাণ স্ক্রিপ্ট, train/ এর অধীনে LoRA প্রশিক্ষণ ও মার্জ স্ক্রিপ্ট, এবং deploy/ এর অধীনে CUDA ও Ascend ডিপ্লয়মেন্ট নির্দেশিকা রয়েছে। ফলাফল নথিতে 8B এবং 30B-A3B দুটি মডেল লাইনের বিস্তারিত তুলনা, প্রম্পট অ্যাবলেশন, ডেটা অ্যাবলেশন এবং কোয়ান্টাইজেশন পরীক্ষা লিপিবদ্ধ করা হয়েছে। মডেল ওজন Hugging Face-এর গেটেড রিপোজিটরিতে প্রকাশিত হয়েছে, যার মধ্যে রয়েছে bf16 মার্জ সংস্করণ, Ascend নেটিভ W8A8 ডায়নামিক কোয়ান্টাইজড সংস্করণ, int4 সংস্করণ, শুধুমাত্র পাবলিক ডেটা দিয়ে প্রশিক্ষিত অ্যাবলেশন সংস্করণ এবং LoRA adapter। কোড MIT লাইসেন্সের অধীনে রয়েছে, মূল্যায়নে ব্যবহৃত ডেটাসেটগুলো তাদের নিজ নিজ লাইসেন্স অনুসরণ করে।