عن المشروع
Annoy-DataSync هو مستودع موجه للبحث يقدم طريقة لتحويل أنماط التفكير المستندة إلى الكود إلى صيغ باللغة الطبيعية لتعزيز استدلال نماذج اللغة الكبيرة. يصف المشروع نهجًا من مرحلتين (Annoy و Annoy++) يستخرج العناصر الأساسية للاستدلال الشاملة من الكود مع فصلها عن البنية النحوية، بهدف تحسين الأداء في مهام الاستدلال الرمزي، والعلمي، والمنطقي، والرياضي، والمنطقي العام، والبرمجي.
يوفر المستودع موارد مطلقة تشمل مجموعات بيانات على Hugging Face (Annoy-PythonEdu-Rs، Annoy-PythonEdu-Rs-Raw، و LCO Benchmark) ونماذج معدلة بدقة تستند إلى Qwen 2.5 7B Coder، و LLaMA 3.1 8B، و DeepSeek v2 Lite Coder. يحتوي كل نموذج أساسي على نقاط تفتيش للمرحلة الأولى والمرحلة الثانية لكل من متغيري Annoy و Annoy++.
يتضمن الكود خط أنابيب كامل لمعالجة البيانات: تحويل ملفات الكود الخام إلى تنسيق موحد، إجراء استدلال قائم على واجهة برمجة التطبيقات، تحليل وإنشاء أزواج المدخلات/المخرجات، بناء حالات التنبؤ، تشغيل الاستدلال، التحقق من النتائج عبر تنفيذ الكود، واختياريًا إجراء مراجعة ثانية وإعادة تحقق لمتغير Annoy++. يتم دعم الإعداد عبر requirements.txt أو environment.yaml مع Python 3.11. يشير المستودع إلى أن البيئة قد تحتاج إلى تخصيص لتنفيذ أنواع مختلفة من كود Python. يُترك التدريب لإطارات عمل خارجية مثل LLaMA-Factory.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.