Об этом проекте
Annoy-DataSync — это исследовательский репозиторий, представляющий метод преобразования паттернов рассуждений на основе кода в форматы естественного языка для улучшения рассуждений больших языковых моделей. Проект описывает двухэтапный подход (Annoy и Annoy++), который извлекает универсальные примитивы рассуждений из кода, отделяя их от синтаксиса, с целью повышения производительности в задачах символьного, научного, логического, математического, здравого смысла и кодового рассуждения.
Репозиторий предоставляет опубликованные ресурсы, включая наборы данных на Hugging Face (Annoy-PythonEdu-Rs, Annoy-PythonEdu-Rs-Raw и LCO Benchmark) и дообученные модели на основе Qwen 2.5 7B Coder, LLaMA 3.1 8B и DeepSeek v2 Lite Coder. Каждая базовая модель имеет контрольные точки этапов 1 и 2 для вариантов Annoy и Annoy++.
Кодовая база включает полный конвейер обработки данных: преобразование исходных файлов кода в единый формат, выполнение вывода на основе API, анализ и генерацию пар ввода-вывода, создание экземпляров предсказаний, запуск вывода, проверку результатов через выполнение кода и, при необходимости, выполнение второго прохода ревизии и повторной проверки для варианта Annoy++. Настройка поддерживается через requirements.txt или environment.yaml с Python 3.11. В репозитории отмечается, что среда может потребовать настройки для выполнения различных типов Python-кода. Обучение оставлено внешним фреймворкам, таким как LLaMA-Factory.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.