SpeechRecognition — это библиотека Python для распознавания речи, поддерживающая множество движков и API, как онлайн, так и офлайн, включая CMU Sphinx, Google, Azure, IBM, Vosk, Whisper и OpenAI.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONMimora — это бесплатный, полностью локальный тренажер произношения для английского и испанского языков. Он использует локальные модели TTS, распознавания речи и LLM для генерации фраз и оценки попыток пользователя с обратной связью на уровне слов, не требуя облачных сервисов или API-ключей.
Высокопроизводительная реализация модели автоматического распознавания речи (ASR) OpenAI Whisper на C/C++, разработанная для легковесного и кроссплатформенного развертывания.
Premove ITN — это открытая библиотека контекстной обратной нормализации текста для английских транскриптов голосовых агентов. Она преобразует речь ASR в канонические письменные формы, используя конвейер генерации, оценки и декодирования с контекстным скорингом DeBERTa.
Быстрая переработка модели OpenAI Whisper с использованием CTranslate2, обеспечивающая повышенную скорость транскрибации и сниженное потребление памяти.
Hugging Face Transformers — это фреймворк определения моделей для машинного обучения, охватывающий текст, зрение, аудио и мультимодальные задачи. Он предоставляет унифицированный API для инференса и обучения с доступом к более чем 1 миллиону предобученных чекпоинтов.
SenseVoiceSmall — открытая речевая фундаментальная модель для ASR, определения языка, распознавания эмоций и аудиособытий; поддерживает китайский, кантонский, английский, японский и корейский языки с быстрым неавторегрессионным выводом.
ESPnet — это набор инструментов для обработки речи сквозного типа на базе PyTorch, охватывающий ASR, TTS, перевод речи, улучшение, диаризацию и другое, с воспроизводимыми рецептами и предобученными моделями.
WhisperLiveKit — это open-source конвейер распознавания речи с ultra-low latency. Поддерживает транскрипцию, диаризацию и перевод на 200 языков через WebSocket и API, совместимые с OpenAI/Deepgram.
Batchalign3 — это аудио- и ML-конвейер TalkBank для создания и обогащения транскриптов CHAT, включающий ASR, принудительное выравнивание, нейроморфотаггинг, перевод и сегментацию высказываний. Поставляется с CLI, Python-пакетом, мостом PyO3, панелью React и экспериментальной оболочкой Tauri.