OPEN SOURCE, OPEN TO EVERYONE

Открытый код. Новые возможности.

Находите качественные проекты с открытым исходным кодом, отправляйте проекты анонимно, заявляйте права на свои проекты и редактируйте их.

Выбор редакции · Находите хороший open source4109найдено

Немного любопытства. Мир открытого кода.

THE FIRST COLLECTION
Topic: speech-recognition清除
НОВОЕ

SpeechRecognition — это библиотека Python для распознавания речи, поддерживающая множество движков и API, как онлайн, так и офлайн, включая CMU Sphinx, Google, Azure, IBM, Vosk, Whisper и OpenAI.

ИИРазработкаMultimodal AI
mimoravikonix
НОВОЕ

Mimora — это бесплатный, полностью локальный тренажер произношения для английского и испанского языков. Он использует локальные модели TTS, распознавания речи и LLM для генерации фраз и оценки попыток пользователя с обратной связью на уровне слов, не требуя облачных сервисов или API-ключей.

ИИПродуктивностьAI assistants
whisper.cppggml-org
НОВОЕ

Высокопроизводительная реализация модели автоматического распознавания речи (ASR) OpenAI Whisper на C/C++, разработанная для легковесного и кроссплатформенного развертывания.

ИИModel runtime
premove-itnpremove-ai
НОВОЕ

Premove ITN — это открытая библиотека контекстной обратной нормализации текста для английских транскриптов голосовых агентов. Она преобразует речь ASR в канонические письменные формы, используя конвейер генерации, оценки и декодирования с контекстным скорингом DeBERTa.

ИИРазработкаModel runtime
НОВОЕ

Быстрая переработка модели OpenAI Whisper с использованием CTranslate2, обеспечивающая повышенную скорость транскрибации и сниженное потребление памяти.

ИИModel runtime
transformershuggingface
НОВОЕ

Hugging Face Transformers — это фреймворк определения моделей для машинного обучения, охватывающий текст, зрение, аудио и мультимодальные задачи. Он предоставляет унифицированный API для инференса и обучения с доступом к более чем 1 миллиону предобученных чекпоинтов.

ИИРазработкаTraining & evaluation
sensevoiceQwenAudio
НОВОЕ

SenseVoiceSmall — открытая речевая фундаментальная модель для ASR, определения языка, распознавания эмоций и аудиособытий; поддерживает китайский, кантонский, английский, японский и корейский языки с быстрым неавторегрессионным выводом.

ИИРазработкаModel runtime
espnetespnet
НОВОЕ

ESPnet — это набор инструментов для обработки речи сквозного типа на базе PyTorch, охватывающий ASR, TTS, перевод речи, улучшение, диаризацию и другое, с воспроизводимыми рецептами и предобученными моделями.

ИИРазработкаModel runtime
whisperlivekitQuentinFuxa
НОВОЕ

WhisperLiveKit — это open-source конвейер распознавания речи с ultra-low latency. Поддерживает транскрипцию, диаризацию и перевод на 200 языков через WebSocket и API, совместимые с OpenAI/Deepgram.

ИИРазработкаModel runtime
talkbank-toolsFranklinChen
НОВОЕ

Batchalign3 — это аудио- и ML-конвейер TalkBank для создания и обогащения транскриптов CHAT, включающий ASR, принудительное выравнивание, нейроморфотаггинг, перевод и сегментацию высказываний. Поставляется с CLI, Python-пакетом, мостом PyO3, панелью React и экспериментальной оболочкой Tauri.

ИИРазработкаModel runtime