VoxCPM2 — система синтеза речи с голоса на текст без дискретной токенизации от OpenBMB. 2B-параметровая модель на базе диффузионной авторегрессионной архитектуры поддерживает 30 языков, генерацию речи из текстового описания голоса, контролируемое клонирование и вывод аудио 48 кГц.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONNVIDIA NeMo Speech — это фреймворк на PyTorch с лицензией Apache-2.0 для создания, настройки и развертывания моделей речи ИИ, охватывающий автоматическое распознавание речи, синтез речи из текста и речевые LLM, с предобученными чекпоинтами и путями установки через Docker/uv.
ESPnet — это набор инструментов для обработки речи сквозного типа на базе PyTorch, охватывающий ASR, TTS, перевод речи, улучшение, диаризацию и другое, с воспроизводимыми рецептами и предобученными моделями.
FunTTS — это библиотека синтеза речи с унифицированным интерфейсом, поддерживающая бесшовное переключение между различными TTS-движками, генерацию субтитров, многопользовательские диалоги и асинхронную обработку.
Speech To Speech — модульный фреймворк для создания голосовых агентов на базе open-source моделей, реализующий полную цепочку VAD → STT → LLM → TTS с поддержкой OpenAI Realtime API через WebSocket и WebRTC.