Sobre o projeto

Annoy-DataSync é um repositório orientado a pesquisa que apresenta um método para transformar padrões de raciocínio baseados em código em formatos de linguagem natural para aprimorar o raciocínio de grandes modelos de linguagem. O projeto descreve uma abordagem em dois estágios (Annoy e Annoy++) que extrai primitivas de raciocínio universais do código enquanto as desacopla da sintaxe, com o objetivo de melhorar o desempenho em tarefas de raciocínio simbólico, científico, lógico, matemático, de senso comum e de código. O repositório fornece recursos publicados, incluindo conjuntos de dados no Hugging Face (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw e o LCO Benchmark) e modelos ajustados baseados em Qwen 2.5 7B Coder, LLaMA 3.1 8B e DeepSeek v2 Lite Coder. Cada modelo base possui checkpoints do Estágio 1 e Estágio 2 para ambas as variantes Annoy e Annoy++. A base de código inclui um pipeline completo de processamento de dados: conversão de arquivos de código brutos em um formato unificado, execução de inferência baseada em API, análise e geração de pares de entrada/saída, construção de instâncias de predição, execução de inferência, verificação de resultados por meio de execução de código e, opcionalmente, realização de uma revisão de segunda rodada e re-verificação para a variante Annoy++. A configuração é suportada através de requirements.txt ou environment.yaml com Python 3.11. O repositório observa que o ambiente pode precisar de personalização para executar diferentes tipos de código Python. O treinamento é deixado para frameworks externos como LLaMA-Factory.