sensevoiceQwenAudio
신규SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONSenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
WhisperLiveKit(WLK)는 초저지연 실시간 음성 인식 파이프라인입니다. Faster-Whisper, NLLB 등 다양한 백엔드를 지원하며 WebSocket 및 OpenAI/Deepgram 호환 API를 통해 실시간 transcription, 화자 분할, 200개 언어 번역을 제공합니다.
WebSocket 및 WebRTC 위에서 OpenAI Realtime 이벤트 세트를 구현하는 낮은 지연 시간의 모듈형 음성 에이전트 파이프라인(VAD → STT → LLM → TTS).
SpeechRecognition은 CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, OpenAI 등 온라인 및 오프라인 다양한 엔진과 API를 지원하는 Python 음성 인식 라이브러리입니다.