Sobre el proyecto

Annoy-DataSync es un repositorio orientado a la investigación que presenta un método para transformar patrones de razonamiento basados en código a formatos de lenguaje natural con el fin de mejorar el razonamiento de los grandes modelos de lenguaje. El proyecto describe un enfoque de dos etapas (Annoy y Annoy++) que extrae primitivas de razonamiento universales del código al mismo tiempo que las desacopla de la sintaxis, con el objetivo de mejorar el rendimiento en tareas de razonamiento simbólico, científico, lógico, matemático, de sentido común y de código. El repositorio proporciona recursos publicados, incluidos conjuntos de datos en Hugging Face (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw y el LCO Benchmark) y modelos ajustados basados en Qwen 2.5 7B Coder, LLaMA 3.1 8B y DeepSeek v2 Lite Coder. Cada modelo base tiene puntos de control de Etapa 1 y Etapa 2 para las variantes Annoy y Annoy++. El código incluye un pipeline completo de procesamiento de datos: conversión de archivos de código sin procesar a un formato unificado, realización de inferencia basada en API, análisis y generación de pares de entrada/salida, construcción de instancias de predicción, ejecución de inferencia, verificación de resultados mediante ejecución de código y, opcionalmente, realización de una revisión de segunda vuelta y una nueva verificación para la variante Annoy++. La configuración es compatible con requirements.txt o environment.yaml con Python 3.11. El repositorio señala que el entorno puede necesitar personalización para ejecutar diferentes tipos de código Python. El entrenamiento se deja a marcos externos como LLaMA-Factory.