منصوبے کے بارے میں
Annoy-DataSync ایک تحقیقی نوعیت کا ذخیرہ ہے جو کوڈ پر مبنی استدلال کے نمونوں کو قدرتی زبان کی شکلوں میں تبدیل کرنے کا طریقہ پیش کرتا ہے تاکہ بڑے زبان کے ماڈلز کی استدلال کی صلاحیتوں کو بہتر بنایا جا سکے۔ یہ پروجیکٹ دو مرحلوں پر مشتمل طریقہ (Annoy اور Annoy++) بیان کرتا ہے جو کوڈ سے عالمگیر استدلال کے بنیادی عناصر کو نکالتا ہے اور انہیں نحو سے الگ کرتا ہے، جس کا مقصد علامتی، سائنسی، منطقی، ریاضیاتی، عام فہم، اور کوڈ استدلال کے کاموں میں کارکردگی بہتر کرنا ہے۔
ذخیرے میں جاری کردہ وسائل شامل ہیں: Hugging Face پر ڈیٹاسیٹس (Annoy-PythonEdu-Rs، Annoy-PythonEdu-Rs-Raw، اور LCO بینچ مارک) اور Qwen 2.5 7B Coder، LLaMA 3.1 8B، اور DeepSeek v2 Lite Coder پر مبنی باریک ٹیون شدہ ماڈلز۔ ہر بنیادی ماڈل میں Annoy اور Annoy++ دونوں اقسام کے لیے مرحلہ 1 اور مرحلہ 2 کے چیک پوائنٹس موجود ہیں۔
کوڈ بیس میں ڈیٹا پروسیسنگ کی مکمل پائپ لائن شامل ہے: خام کوڈ فائلوں کو یکساں فارمیٹ میں تبدیل کرنا، API پر مبنی اندازہ لگانا، ان پٹ/آؤٹ پٹ جوڑے بنانا اور پارس کرنا، پیش گوئی کی مثالیں بنانا، اندازہ چلانا، کوڈ پر عمل کرکے نتائج کی تصدیق کرنا، اور Annoy++ قسم کے لیے اختیاری طور پر دوسرے مرحلے کی نظرثانی اور دوبارہ تصدیق کرنا۔ سیٹ اپ Python 3.11 کے ساتھ requirements.txt یا environment.yaml کے ذریعے تعاون یافتہ ہے۔ ذخیرے میں نوٹ کیا گیا ہے کہ مختلف اقسام کے Python کوڈ پر عمل کرنے کے لیے ماحول کو حسب ضرورت بنانے کی ضرورت پڑ سکتی ہے۔ تربیت بیرونی فریم ورکس جیسے LLaMA-Factory پر چھوڑ دی گئی ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.