Об этом проекте
MOSS-TTS-Nano — это открытая мультиязычная модель синтеза речи от MOSI.AI и команды OpenMOSS. С примерно 0,1 млрд параметров она нацелена на генерацию речи в реальном времени и может работать на CPU без GPU, что упрощает развертывание для локальных демо, веб-серверов и легкой интеграции.
Основные характеристики, описанные в README:
- Компактный размер модели — около 0,1 млрд параметров.
- Нативный аудиовыход 48 кГц, 2 канала (стерео).
- Мультиязычная поддержка 20 языков, включая китайский, английский, немецкий, испанский, французский, японский, итальянский, венгерский, корейский, русский, персидский, арабский, польский, португальский, чешский, датский, шведский, греческий и турецкий.
- Чистая авторегрессионная архитектура на основе аудиотокенизатора и LLM-конвейера.
- Потоковый вывод с низкой задержкой в реальном времени и быстрым первым аудио.
- Оптимизация для CPU: потоковая генерация может работать на 4-ядерном процессоре.
- Поддержка длинных текстов с автоматическим клонированием голоса по фрагментам.
- Открытые пути развертывания через прямые Python-скрипты и упакованный CLI.
Быстрый старт: README рекомендует чистое Python-окружение, клонирование репозитория, установку зависимостей и установку проекта в режиме editable, чтобы команда moss-tts-nano стала доступна. Загрузка моделей по умолчанию использует OpenMOSS-Team/MOSS-TTS-Nano и OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano. Клонирование голоса — основной рекомендуемый рабочий процесс, продемонстрированный в infer.py с использованием пути к аудио-подсказке и входного текста. Локальное веб-демо FastAPI можно запустить с помощью app.py и открыть по адресу 127.0.0.1:18083.
ONNX CPU-инференс: версия ONNX CPU рекомендуется для легкого локального развертывания. Она устраняет зависимость от PyTorch во время инференса, работает на ONNX Runtime CPU, поддерживает прямое эталонное аудио, встроенные голоса и потоковое декодирование в реальном времени, и описывается как почти в 2 раза более эффективная по обработке, чем оригинальная версия в тестах проекта. На MacBook Air M4 наблюдался плавный инференс с одним ядром CPU. Точки входа ONNX включают infer_onnx.py, app_onnx.py и упакованный CLI с флагом --backend onnx. Выполнение CUDA опционально через onnxruntime-gpu и --execution-provider cuda. Отсутствующие файлы моделей загружаются при первом запуске из репозиториев ONNX на Hugging Face.
Дополнительные инструменты: пример Android ONNX Runtime в examples/android_onnx_runtime загружает экспортированные ONNX-графы на устройство и записывает WAV-файл. Экспортер в onnx/ преобразует локальный чекпоинт в формате Hugging Face в каталог ONNX-модели только для TTS. Упакованный CLI предлагает команды moss-tts-nano generate и moss-tts-nano serve с опциями для эталонной речи, текстовых файлов, выбора бэкенда и провайдера выполнения. Код и учебные материалы для дообучения предоставлены в каталоге finetuning.
В репозитории также документирован MOSS-Audio-Tokenizer-Nano — легкий токенизатор с примерно 20 миллионами параметров на основе архитектуры Cat (Causal Audio Tokenizer with Transformer). Он поддерживает стереовход и выход 48 кГц, сжимает аудио в поток токенов 12,5 Гц и использует RVQ с 16 кодовыми книгами при переменных битрейтах от 0,125 кбит/с до 2 кбит/с. Таблицы и графики оценки сравнивают качество реконструкции с открытыми токенизаторами с не более чем 120 млн параметров на данных речи, аудио и музыки.
Также описано более широкое семейство MOSS-TTS, включая MOSS-TTS, MOSS-TTS-Local-Transformer, MOSS-TTSD-v1.0, MOSS-VoiceGenerator, MOSS-SoundEffect и MOSS-TTS-Realtime, со ссылками на веса моделей на Hugging Face и ModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.