NVIDIA NeMo Speech — это фреймворк на PyTorch с лицензией Apache-2.0 для создания, настройки и развертывания моделей речи ИИ, охватывающий автоматическое распознавание речи, синтез речи из текста и речевые LLM, с предобученными чекпоинтами и путями установки через Docker/uv.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONFunTTS — это библиотека синтеза речи с унифицированным интерфейсом, поддерживающая бесшовное переключение между различными TTS-движками, генерацию субтитров, многопользовательские диалоги и асинхронную обработку.
vtmate — это набор инструментов для голосового ИИ в терминале с ультра-низкой задержкой, поддержкой 41 языка и интегрированными системами TTS/STT. Он обеспечивает живые голосовые беседы, дебаты, клонирование голоса, экспорт сессий и режим фонового демона с глобальными горячими клавишами для бесшовного взаимодействия с ИИ.
OpenCreator — open-source AI workspace combining multimodal content creation (video translation, downloading, image/video generation, smart dubbing) with a general Agent environment, using Codex CLI as its execution engine.
Unsloth — это десктопное приложение и фреймворк для локального запуска и обучения больших языковых моделей (LLM) и диффузионных моделей на Windows, macOS и Linux.
Verba — это офлайн-приложение для изучения языков через разговоры с ИИ-тренером. Оно работает локально с Ollama или собственным API-ключом, предлагая исправления, адаптивное чтение и SRS, а также встроенные функции речи и диктовки.
Расширение для браузеров Google Chrome и Mozilla Firefox, обеспечивающее двуязычный перевод субтитров для видео на YouTube в режиме реального времени.
LocalAI — это открытый self-hosted движок для ИИ, который запускает LLM, модели зрения, голоса, изображений и видео на любом железе, включая CPU. Поддерживает API OpenAI, Anthropic и ElevenLabs, модульные бэкенды по запросу, multi-user аутентификацию и встроенные агенты с RAG и MCP.
VoxCPM2 — система синтеза речи с голоса на текст без дискретной токенизации от OpenBMB. 2B-параметровая модель на базе диффузионной авторегрессионной архитектуры поддерживает 30 языков, генерацию речи из текстового описания голоса, контролируемое клонирование и вывод аудио 48 кГц.
Pixelle-Video — это AI-движок для полностью автоматического создания коротких видео. Пользователь вводит тему, а система сама пишет сценарий, генерирует иллюстрации или видео, синтезирует речь, добавляет фоновую музыку и собирает готовый ролик. Поддерживаются различные LLM, ComfyUI/RunningHub и API DashScope, OpenAI, Seedream, Seedance, Kling.
Терминальный практический курс по Python: написание кода в модальном редакторе в стиле Neovim с офлайн-сопровождением локального TTS-голоса. Включает упражнения, симуляцию Cloud/DevOps (git, Docker, AWS, Terraform, Ansible, CI/CD) и сохранение прогресса.
ChatTTS — это открытая модель текста в речь для диалоговых сценариев, поддерживающая английский и китайский языки с многоголосовым выводом и точным контролем над смехом, паузами и интонацией.
GPT-SoVITS — open-source few-shot voice conversion and TTS with zero-shot (5s) and few-shot (1min) cloning. Supports zh, ja, en, ko, yue via WebUI tools for separation, ASR, segmentation.
Инструмент с открытым исходным кодом для перевода видео, транскрипции аудио, ИИ-озвучки и перевода субтитров с поддержкой локального развёртывания и онлайн-API.