SpeechRecognition — это библиотека Python для распознавания речи, поддерживающая множество движков и API, как онлайн, так и офлайн, включая CMU Sphinx, Google, Azure, IBM, Vosk, Whisper и OpenAI.
Открытый код. Новые возможности.
Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.
Немного любопытства. Мир открытого кода.
THE FIRST COLLECTIONВысокопроизводительная реализация модели автоматического распознавания речи (ASR) OpenAI Whisper на C/C++, разработанная для легковесного и кроссплатформенного развертывания.
Bolo — это бесплатное самохозяинское приложение для диктовки с нажатием на клавишу для macOS, написанное на Rust. Оно позволяет удерживать горячую клавишу, говорить, и транскрипция вставляется в курсор с помощью AI-сервиса речи-в-текст от Telnyx, с опциональной очисткой LLM и локальной историей транскрипций.
SkyClass Distill — это инструмент конвейера для преобразования обучающих видео в структурированные преподавательские навыки (Teaching Skills), поддерживающий сбор видео, транскрибацию, извлечение доказательств и дистилляцию с помощью LLM.
TypeNo — бесплатный open-source инструмент для macOS, который локально транскрибирует речь и мгновенно вставляет текст: без аккаунтов, настроек и облачной обработки, с упором на конфиденциальность.
Velo AI Studio — это open-source, браузерный инструмент для создания видео, предназначенный для сборки озвученных видео из сценариев, аудио и визуальных активов, созданных с помощью ИИ.
Быстрая переработка модели OpenAI Whisper с использованием CTranslate2, обеспечивающая повышенную скорость транскрибации и сниженное потребление памяти.
SenseVoiceSmall — открытая речевая фундаментальная модель для ASR, определения языка, распознавания эмоций и аудиособытий; поддерживает китайский, кантонский, английский, японский и корейский языки с быстрым неавторегрессионным выводом.
LazyEdit — это локальный AI-инструментарий для видеопроизводства, обеспечивающий полный цикл создания, обработки и опциональной публикации контента.
Инструмент с открытым исходным кодом для перевода видео, транскрипции аудио, ИИ-озвучки и перевода субтитров с поддержкой локального развёртывания и онлайн-API.
Handy — это бесплатное приложение с открытым исходным кодом для преобразования речи в текст на рабочем столе, работающее полностью офлайн. Нажмите сочетание клавиш, говорите, и текст появится в любом поле ввода с помощью моделей Whisper или Parakeet.
WhisperLiveKit — это open-source конвейер распознавания речи с ultra-low latency. Поддерживает транскрипцию, диаризацию и перевод на 200 языков через WebSocket и API, совместимые с OpenAI/Deepgram.
Lamitype — бесплатное приложение macOS для распознавания речи с упором на конфиденциальность и традиционный китайский язык. Локально запускает Qwen3-ASR на Apple Silicon, поддерживает живые субтитры, перевод и облачную диктовку.
Локальный мультимодальный плагин LLM для Unreal Engine 5, обеспечивающий офлайн-вывод для текста, преобразования речи в текст и текста в речь.
Speech To Speech — модульный фреймворк для создания голосовых агентов на базе open-source моделей, реализующий полную цепочку VAD → STT → LLM → TTS с поддержкой OpenAI Realtime API через WebSocket и WebRTC.
Douvo — это легковесное приложение для голосового ввода на macOS для Apple Silicon, использующее Doubao ASR с опциональной локальной или удалённой AI-постобработкой для очистки текста, перевода и редактирования выделенного текста.
Lexos — это управляемый событиями движок обработки документов на базе ИИ, объединяющий шлюз на Go, Python-воркеры, очереди Redis и локально размещенные модели для офлайн-RAG, суммаризации и транскрипции речи.