প্রকল্প সম্পর্কে

Annoy-DataSync হলো একটি গবেষণা কেন্দ্রিক রিপোজিটরি যা কোড ভিত্তিক যুক্তি প্রদর্শন প্যাটার্নকে প্রাকৃতিক ভাষার ফরম্যাটে রূপান্তর করার একটি পদ্ধতি প্রদর্শন করে, যার লক্ষ্য লার্জ ল্যাঙ্গুয়েজ মডেলের যুক্তি প্রদর্শন ক্ষমতা বাড়ানো। প্রকল্পটি একটি দুই-পর্যায়ের পদ্ধতি (Annoy এবং Annoy++) বর্ণনা করে যা কোড থেকে সার্বজনীন যুক্তি প্রদর্শন প্রাইমিটিভ বের করে সেগুলোকে সিনট্যাক্স থেকে বিচ্ছিন্ন করে, যার লক্ষ্য প্রতীকী, বৈজ্ঞানিক, লজিক্যাল, গাণিতিক, সাধারণ জ্ঞান ভিত্তিক এবং কোড যুক্তি প্রদর্শন টাস্কে কর্মক্ষমতা উন্নত করা। রিপোজিটরিটি প্রকাশিত রিসোর্স প্রদান করছে, যার মধ্যে Hugging Face-এ ডেটাসেট (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw এবং LCO বেঞ্চমার্ক) এবং Qwen 2.5 7B Coder, LLaMA 3.1 8B এবং DeepSeek v2 Lite Coder ভিত্তিক ফাইন-টিউন করা মডেল রয়েছে। প্রতিটি বেস মডেলের Annoy এবং Annoy++ উভয় ভেরিয়েন্টের জন্য পর্যায় 1 এবং পর্যায় 2 চেকপয়েন্ট উপলব্ধ। কোডবেসটিতে সম্পূর্ণ ডেটা প্রসেসিং পাইপলাইন রয়েছে: কাঁচা কোড ফাইলকে ইউনিফর্ম ফরম্যাটে রূপান্তর করা, API ভিত্তিক ইনফারেন্স করা, ইনপুট/আউটপুট জোড়া পার্স করা ও তৈরি করা, প্রেডিকশন ইনস্ট্যান্স তৈরি করা, ইনফারেন্স চালানো, কোড এক্সিকিউশনের মাধ্যমে ফলাফল যাচাই করা এবং Annoy++ ভেরিয়েন্টের জন্য ঐচ্ছিকভাবে দ্বিতীয় বার সংশোধন ও পুনরায় যাচাই করা। পাইথন 3.11 সহ requirements.txt বা environment.yaml এর মাধ্যমে সেটআপ করা সম্ভব। রিপোজিটরিতে উল্লেখ করা আছে যে বিভিন্ন ধরনের পাইথন কোড চালানোর জন্য পরিবেশটি কাস্টমাইজ করার প্রয়োজন হতে পারে। প্রশিক্ষণ কাজ LLaMA-Factory এর মতো বাহ্যিক ফ্রেমওয়ার্কের মাধ্যমে করা হয়।