SpeechRecognition은 CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, OpenAI 등 온라인 및 오프라인 다양한 엔진과 API를 지원하는 Python 음성 인식 라이브러리입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONPremove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.
Hugging Face Transformers는 텍스트, 비전, 오디오 및 멀티모달 작업을 위한 머신러닝 모델 정의 프레임워크입니다. 100만 개 이상의 사전 학습된 체크포인트와 함께 추론 및 학습을 위한 통합 API를 제공합니다.
SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
ESPnet은 PyTorch 기반의 종단 간 음성 처리 툴킷으로, ASR, TTS, 음성 번역, 향상, 화자 분리 등 다양한 작업을 지원하며 재현 가능한 레시피와 사전 학습 모델을 제공합니다.
WhisperLiveKit(WLK)는 초저지연 실시간 음성 인식 파이프라인입니다. Faster-Whisper, NLLB 등 다양한 백엔드를 지원하며 WebSocket 및 OpenAI/Deepgram 호환 API를 통해 실시간 transcription, 화자 분할, 200개 언어 번역을 제공합니다.
Batchalign3는 CHAT 전사본을 생성하고 강화하기 위한 TalkBank 오디오 및 ML 파이프라인으로, ASR, 강제 정렬, 신경 형태소 태깅, 번역 및 발화 분할을 다룹니다. CLI, Python 패키지, PyO3 브리지, React 대시보드 및 실험적 Tauri 데스크톱 셸을 제공합니다.