Об этом проекте
YuE2 — проект генерации музыки от группы multimodal-art-projection (HKUST, M·A·P, Tokenwave.AI, NYU, Stanford, MBZUAI, NOIZ, ACE Studio). Заявленная цель — объединить символьную и аудиогенерацию музыки: получив текст и стилевой промпт, модель сначала пишет план мелодии и аккордов, а затем реализует этот план как полноценную песню с вокалом и аккомпанементом.
Ключевые возможности, описанные в README:
- Символьное планирование как white-box интерфейс. Сгенерированная композиция представляет собой редактируемую партитуру (нотация ABC), которую человек или агент может прочитать, проиграть, проверить и изменить до рендеринга. Мелодия и аккорды становятся явными средствами управления.
- Zero-shot каверы. Исходную запись можно транскрибировать с помощью сопутствующей модели SheetSage2, а полученную партитуру мелодии — перерендерить в новом стиле. README рекомендует cot="melody" с партитурой без символов аккордов, чтобы аккомпанемент адаптировался к новому стилю.
- Агентное редактирование музыки. План можно экспортировать, переработать (гармония, мелодия, темп, форма, текст) и перерендерить как новую полную запись. README отмечает, что редактирование создаёт новую запись и не сохраняет исходную волновую форму вне правки.
- Пакет агентных навыков (skills/yue2-music/SKILL.md), описывающий, как агент может генерировать песни, транскрибировать и делать каверы записей, редактировать партитуры ABC, проверять музыкальные инварианты и организовывать прослушивание для сравнения.
Архитектура и конвейер: единый AR–NAR Mixture-of-Transformers backbone авторегрессионно предсказывает токены партитуры и семантические токены, затем генерирует акустические латенты с помощью flow matching; VAE декодирует латенты в стереоаудио 48 кГц. Поэтапный Python API предоставляет plan() → generate_semantic() → synthesize() → decode(). Режимы генерации включают cot="full" (редактируемый план мелодии и аккордов, по умолчанию), cot="melody" (план мелодии со свободным аккомпанементом, рекомендуется для каверов), cot="off" (напрямую из текста и стиля) и abc=... для подачи собственной партитуры.
Требования и быстрый старт: Linux, Python 3.12, NVIDIA GPU с поддержкой BF16 и 24 ГБ VRAM. Установка — через pip install . из клона репозитория, затем examples/generate.py. Файлы модели скачиваются с Hugging Face при первом использовании. Выходные данные сохраняют партитуру, семантические токены, акустические латенты, настройки генерации и идентификаторы моделей вместе с аудио.
Сопутствующие модели и ресурсы: YuE2-3B (генерация, планирование, каверы, редактирование), YuE2-Vae и YuE2-Vae-legacy (декодеры), SheetSage2 (транскрипция аудио в партитуру), MERT-v2-FullSong и MERT-v2-30s (музыкальные представления) и набор данных для оценки WildSongBench. Извлечение признаков MERT2 для генерации опционально.
README приводит результаты бенчмарков на WildSongBench (192 промпта, автоматическая оценка), сравнивая YuE2 с несколькими проприетарными и открытыми системами, и результаты zero-shot каверов на 948 произведениях. Также приводятся результаты MERT2 на MARBLE и GTZAN и результаты SheetSage2 на бенчмарках транскрипции. Это собственные заявленные показатели проекта; сам README отмечает, что рейтинги зависят от метрики, а небольшие разрывы между верхними средними не устанавливают статистическую значимость.
Лицензирование: собственный код, агентный навык и документация — Apache 2.0; веса модели лицензируются отдельно по CC BY-NC 4.0; сторонние компоненты сохраняют свои исходные лицензии. Код, документация и лицензия более ранней версии YuE-v1 сохранены в отдельной ветке.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.