इस प्रोजेक्ट के बारे में

Annoy-DataSync एक रिसर्च-ओरिएंटेड रिपॉजिटरी है जो कोड-आधारित रीजनिंग पैटर्न को नेचुरल लैंग्वेज फॉर्मेट में बदलने की एक विधि प्रस्तुत करती है ताकि लार्ज लैंग्वेज मॉडल रीजनिंग को बेहतर बनाया जा सके। यह प्रोजेक्ट एक दो-चरणीय दृष्टिकोण (Annoy और Annoy++) का वर्णन करता है जो कोड से सार्वभौमिक रीजनिंग प्रिमिटिव्स को निकालता है और उन्हें सिंटैक्स से अलग करता है, जिसका उद्देश्य सिंबॉलिक, वैज्ञानिक, लॉजिकल, गणितीय, कॉमनसेंस और कोड रीजनिंग कार्यों में प्रदर्शन में सुधार करना है। यह रिपॉजिटरी रिलीज़ किए गए संसाधन प्रदान करती है जिनमें Hugging Face पर डेटासेट (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw, और LCO Benchmark) और Qwen 2.5 7B Coder, LLaMA 3.1 8B, और DeepSeek v2 Lite Coder पर आधारित फाइन-ट्यून किए गए मॉडल शामिल हैं। प्रत्येक बेस मॉडल के लिए Annoy और Annoy++ वेरिएंट दोनों के लिए Stage 1 और Stage 2 चेकपॉइंट हैं। कोडबेस में एक संपूर्ण डेटा प्रोसेसिंग पाइपलाइन शामिल है: रॉ कोड फाइलों को एकीकृत फॉर्मेट में बदलना, API-आधारित इन्फरेंस करना, इनपुट/आउटपुट जोड़े को पार्स और जेनरेट करना, प्रेडिक्शन इंस्टेंस बनाना, इन्फरेंस चलाना, कोड एक्जीक्यूशन के माध्यम से परिणामों को सत्यापित करना, और Annoy++ वेरिएंट के लिए वैकल्पिक रूप से दूसरे टर्न का रिवीजन और पुनः-सत्यापन करना। सेटअप को requirements.txt या environment.yaml के माध्यम से Python 3.11 के साथ समर्थित किया जाता है। रिपॉजिटरी में नोट किया गया है कि विभिन्न प्रकार के Python कोड को निष्पादित करने के लिए एनवायरनमेंट को अनुकूलित करने की आवश्यकता हो सकती है। ट्रेनिंग को LLaMA-Factory जैसे बाहरी फ्रेमवर्क पर छोड़ा गया है।