这个项目能做什么

Annoy-DataSync是一个面向研究的代码库,提出了一种将基于代码的推理模式转化为自然语言格式的方法,以增强大语言模型的推理能力。该项目描述了一个两阶段方法(Annoy和Annoy++),从代码中提取通用推理原语,同时将其与语法解耦,旨在提升符号、科学、逻辑、数学、常识和代码推理任务的表现。 该代码库提供了已发布的资源,包括Hugging Face上的数据集(Annoy-PythonEdu-Rs、Annoy-PythonEdu-Rs-Raw和LCO基准测试)以及基于Qwen 2.5 7B Coder、LLaMA 3.1 8B和DeepSeek v2 Lite Coder微调的模型。每个基础模型都有Annoy和Annoy++变体的第一阶段和第二阶段检查点。 代码库包含完整的数据处理流水线:将原始代码文件转换为统一格式,执行基于API的推理,解析并生成输入/输出对,构建预测实例,运行推理,通过代码执行验证结果,并可选择性地为Annoy++变体执行第二轮修订和重新验证。通过requirements.txt或environment.yaml支持Python 3.11环境设置。代码库指出,环境可能需要定制以执行不同类型的Python代码。训练交由外部框架(如LLaMA-Factory)处理。