À propos du projet
Annoy-DataSync est un dépôt orienté recherche présentant une méthode de transformation des motifs de raisonnement basés sur le code en formats en langage naturel pour améliorer le raisonnement des grands modèles de langage. Le projet décrit une approche en deux étapes (Annoy et Annoy++) qui extrait des primitives de raisonnement universelles à partir du code tout en les découplant de la syntaxe, dans le but d'améliorer les performances sur les tâches de raisonnement symbolique, scientifique, logique, mathématique, de bon sens et de code.
Le dépôt fournit des ressources publiées, notamment des jeux de données sur Hugging Face (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw et le LCO Benchmark) ainsi que des modèles affinés basés sur Qwen 2.5 7B Coder, LLaMA 3.1 8B et DeepSeek v2 Lite Coder. Chaque modèle de base possède des points de contrôle de l'étape 1 et de l'étape 2 pour les variantes Annoy et Annoy++.
Le codebase comprend un pipeline complet de traitement des données : conversion des fichiers de code bruts en un format unifié, exécution d'inférences basées sur des API, analyse et génération de paires entrée/sortie, construction d'instances de prédiction, exécution de l'inférence, vérification des résultats par exécution de code, et exécution optionnelle d'une révision de second tour et d'une re-vérification pour la variante Annoy++. L'installation est prise en charge via requirements.txt ou environment.yaml avec Python 3.11. Le dépôt note que l'environnement peut nécessiter une personnalisation pour exécuter différents types de code Python. L'entraînement est laissé à des frameworks externes tels que LLaMA-Factory.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.