텍스트, 음성 인식(STT) 및 음성 합성(TTS)의 오프라인 추론을 제공하는 Unreal Engine 5용 로컬 멀티모달 LLM 플러그인입니다.
오픈 소스. 새로운 가능성.
우수한 오픈 소스 프로젝트를 발견하고, 익명으로 프로젝트를 제출하며, 내 프로젝트를 신청해 편집하세요.
호기심으로 오픈 소스의 세계를 발견하세요.
THE FIRST COLLECTIONWebSocket 및 WebRTC 위에서 OpenAI Realtime 이벤트 세트를 구현하는 낮은 지연 시간의 모듈형 음성 에이전트 파이프라인(VAD → STT → LLM → TTS).
Douvo는 Apple Silicon용 경량 macOS 음성 입력 앱으로, Doubao ASR을 사용하며 텍스트 정리, 번역, 선택 텍스트 편집을 위한 로컬 또는 원격 AI 후처리를 선택적으로 제공합니다.
Lexos는 Go 게이트웨이, Python 워커, Redis 큐, 자체 호스팅 모델을 결합한 이벤트 기반 AI 문서 처리 엔진으로, 오프라인 RAG, 요약, 음성 전사를 지원합니다.
SpeechRecognition은 CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, OpenAI 등 온라인 및 오프라인 다양한 엔진과 API를 지원하는 Python 음성 인식 라이브러리입니다.
OpenAI의 Whisper 자동 음성 인식(ASR) 모델을 위한 고성능 C/C++ 구현체로, 가볍고 교차 플랫폼 배포가 가능하도록 설계되었습니다.
Bolo는 Rust로 작성된 무료, 자체 호스팅 macOS 푸시-투-토크 받아쓰기 앱입니다. 핫키를 누르고 말하면, Telnyx AI 음성-텍스트 변환을 통해 전사된 내용이 커서 위치에 붙여넣어집니다. 선택적으로 LLM 정리와 로컬 전사 기록을 지원합니다.
SkyClass Distill은 교육 영상을 구조화된 교육 기술(Teaching Skills)로 변환하는 파이프라인 도구로, 영상 수집, 전사, 증거 추출 및 LLM 증류를 지원합니다.
TypeNo는 음성 녹음을 로컬에서 처리해 텍스트로 바로 붙여넣는 무료 오픈소스 macOS 음성 입력 앱입니다. 계정 없이, 설정 없이, 프라이버시를 최우선으로 합니다.
Velo AI Studio는 스크립트, 오디오, AI 생성 시각 자산으로부터 내레이션 비디오를 조립하도록 설계된 오픈소스 브라우저 기반 비디오 제작 도구입니다.
CTranslate2를 사용하여 OpenAI의 Whisper 모델을 빠르게 재구현한 프로젝트로, 전사 속도 향상과 메모리 사용량 감소를 제공합니다.
SenseVoiceSmall은 ASR, 언어 식별, 감정 인식, 오디오 이벤트 감지를 지원하는 오픈소스 음성 파운데이션 모델로, 중국어, 광둥어, 영어, 일본어, 한국어를 지원하며 빠른 비자기회귀 추론을 제공합니다.
LazyEdit는 엔드-투-엔드 콘텐츠 제작, 처리 및 선택적 게시를 위한 로컬 우선 AI 지원 비디오 워크플로우입니다.
오픈소스 비디오 번역, 음성 전사, AI 더빙, 자막 번역 도구로 로컬 및 라인 API를 지원합니다.
Handy는 완전히 오프라인으로 작동하는 무료 오픈소스 크로스플랫폼 음성-텍스트 변환 데스크톱 앱입니다. 단축키를 누르고 말하면 Whisper 또는 Parakeet 모델을 사용해 변환된 텍스트를 어떤 입력 필드에든 붙여넣어 줍니다.
WhisperLiveKit(WLK)는 초저지연 실시간 음성 인식 파이프라인입니다. Faster-Whisper, NLLB 등 다양한 백엔드를 지원하며 WebSocket 및 OpenAI/Deepgram 호환 API를 통해 실시간 transcription, 화자 분할, 200개 언어 번역을 제공합니다.
Lamitype는 무료, 오픈소스, 개인정보 보호 우선의 macOS 음성-텍스트 변환 앱으로, 기본적으로 Apple Silicon에서 Qwen3-ASR 모델을 로컬로 실행하며, 번체 중국어 우선 출력, 실시간 자막, 텍스트 번역 및 교정을 지원하고 선택적 클라우드 받아쓰기 기능을 제공합니다.