Об этом проекте

Voicebox — это студия голосового ИИ с открытым исходным кодом, предназначенная для локального запуска на вашем компьютере. Она позиционирует себя как бесплатная альтернатива облачным сервисам, таким как ElevenLabs и WisprFlow. Проект охватывает как вывод голоса (преобразование текста в речь и клонирование голоса), так и ввод (диктовка с преобразованием речи в текст), включая встроенную локальную LLM для дополнительной обработки и профили голосовых персонажей. Основные возможности, описанные в репозитории: - **Клонирование голоса и TTS**: Клонирование с нулевым обучением (zero-shot) на основе короткого образца, а также более 50 предустановленных голосов. Включено семь движков TTS (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA и Kokoro), поддерживающих до 23 языков в зависимости от движка. - **Преобразование речи в текст**: Работает на базе локальной модели OpenAI Whisper с выбором размера от Base до Turbo, используя MLX на Apple Silicon или PyTorch на CUDA/ROCm/DirectML/CPU. - **Глобальная диктовка**: Системная горячая клавиша позволяет пользователям диктовать текст в любое активное поле ввода. В README упоминается вставка текста с учетом целевого приложения, проверка разрешений на доступ к функциям универсального доступа и мониторинг ввода на macOS. - **Аудиообработка**: Восемь эффектов, созданных на основе библиотеки pedalboard от Spotify, включая изменение высоты тона, реверберацию, задержку, хорус, компрессор, усиление и фильтры с возможностью сохранения пресетов. - **Голосовой вывод для агентов**: Встроенный сервер MCP (Model Context Protocol) предоставляет такие инструменты, как voicebox.speak, voicebox.transcribe, voicebox.list_captures и voicebox.list_profiles. Агенты, поддерживающие MCP (например, Claude Code, Cursor, Windsurf и Cline), могут общаться с пользователем клонированным голосом через один вызов инструмента. - **Локальная конфиденциальность**: Модели, голосовые данные и записи остаются на компьютере пользователя. - **Редактор историй**: Многодорожечная временная шкала для создания диалогов, подкастов и повествований с функцией перетаскивания и синхронизированным воспроизведением. - **Записи**: Диктовки, внутриигровые записи и загруженные файлы сохраняются вместе с аудио и транскрипцией; их можно повторно транскрибировать, редактировать или использовать как образцы голоса. - **API**: Доступен REST API по адресу http://127.0.0.1:17493 для функций /generate, /speak, /transcribe и /profiles, документация находится по адресу /docs. - **Платформы**: Готовые сборки для macOS (Apple Silicon и Intel) и Windows, а также поддержка Docker и инструкции по сборке из исходного кода для Linux. Технически настольное приложение построено на Tauri (Rust) и React/TypeScript с бэкендом на FastAPI (Python), хранилищем SQLite и выводом через MLX или PyTorch в зависимости от платформы и GPU. В планах развития, указанных в README, упоминаются автозаполнение для Windows/Linux, дополнительные движки STT, потоковая транскрипция, сквозные речевые LLM и архитектура плагинов. Проект доступен на GitHub.