SpeechRecognition은 CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, OpenAI 등 온라인 및 오프라인 다양한 엔진과 API를 지원하는 Python 음성 인식 라이브러리입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONMimora는 영어와 스페인어 학습자를 위한 무료, 완전 로컬 발음 트레이너입니다. 온디바이스 TTS, 음성 인식, 그리고 로컬 LLM을 사용하여 문장을 생성하고, 단어 수준의 피드백과 함께 사용자의 시도를 점수화합니다. 클라우드나 API 키가 필요하지 않습니다.
OpenAI의 Whisper 자동 음성 인식(ASR) 모델을 위한 고성능 C/C++ 구현체로, 가볍고 교차 플랫폼 배포가 가능하도록 설계되었습니다.
Premove ITN은 영어 음성 에이전트 대본을 위한 오픈소스 컨텍스트 인지 역텍스트 정규화 도구로, DeBERTa 컨텍스트 점수를 사용하는 생성-점수-디코드 파이프라인을 통해 음성 ASR 출력을 표준 서면 형식으로 변환합니다.
CTranslate2를 사용하여 OpenAI의 Whisper 모델을 빠르게 재구현한 프로젝트로, 전사 속도 향상과 메모리 사용량 감소를 제공합니다.
Hugging Face Transformers는 텍스트, 비전, 오디오 및 멀티모달 작업을 위한 머신러닝 모델 정의 프레임워크입니다. 100만 개 이상의 사전 학습된 체크포인트와 함께 추론 및 학습을 위한 통합 API를 제공합니다.
SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
ESPnet은 PyTorch 기반의 종단 간 음성 처리 툴킷으로, ASR, TTS, 음성 번역, 향상, 화자 분리 등 다양한 작업을 지원하며 재현 가능한 레시피와 사전 학습 모델을 제공합니다.
WhisperLiveKit(WLK)는 초저지연 실시간 음성 인식 파이프라인입니다. Faster-Whisper, NLLB 등 다양한 백엔드를 지원하며 WebSocket 및 OpenAI/Deepgram 호환 API를 통해 실시간 transcription, 화자 분할, 200개 언어 번역을 제공합니다.
Batchalign3는 CHAT 전사본을 생성하고 강화하기 위한 TalkBank 오디오 및 ML 파이프라인으로, ASR, 강제 정렬, 신경 형태소 태깅, 번역 및 발화 분할을 다룹니다. CLI, Python 패키지, PyO3 브리지, React 대시보드 및 실험적 Tauri 데스크톱 셸을 제공합니다.