프로젝트 소개

Voicebox는 사용자의 로컬 머신에서 실행되도록 설계된 오픈소스 AI 음성 스튜디오로, ElevenLabs나 WisprFlow 같은 클라우드 서비스의 무료 대안을 지향한다. 음성 출력(텍스트 음성 변환 및 음성 클로닝)과 음성 입력(음성 텍스트 변환 받아쓰기)을 모두 지원하며, 선택적 정교화와 프로필별 음성 개성을 위해 번들된 로컬 LLM을 포함한다. 리포지토리에 설명된 주요 기능: - **음성 클로닝 및 TTS**: 짧은 참조 샘플을 이용한 제로샷 클로닝과 50개 이상의 큐레이션된 프리셋 음성을 제공한다. Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA, Kokoro 등 7개의 TTS 엔진이 포함되어 있으며, 엔진에 따라 최대 23개 언어를 지원한다. - **음성 텍스트 변환**: 로컬에서 OpenAI Whisper를 기반으로 하며, Base부터 Turbo까지 모델 크기 옵션을 제공한다. Apple Silicon에서는 MLX, CUDA/ROCm/DirectML/CPU에서는 PyTorch를 통해 실행된다. - **전역 받아쓰기**: 시스템 전체 단축키를 통해 현재 포커스된 모든 텍스트 필드에 받아쓰기를 할 수 있다. README는 macOS에서 접근성 검증이 완료된 입력 삽입과 접근성 및 입력 모니터링에 대한 첫 실행 권한 안내를 포함한 대상 인식 붙여넣기를 언급한다. - **오디오 후처리**: Spotify의 pedalboard 라이브러리 기반으로 구축된 8가지 효과를 제공하며, 피치 시프트, 리버브, 딜레이, 코러스, 컴프레서, 게인, 필터와 재사용 가능한 프리셋이 포함된다. - **에이전트 음성 출력**: 내장된 MCP(Model Context Protocol) 서버는 `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures`, `voicebox.list_profiles` 같은 도구를 노출한다. Claude Code, Cursor, Windsurf, Cline 같은 MCP 지원 에이전트는 단일 도구 호출로 클로닝된 음성을 사용해 사용자에게 말할 수 있다. - **로컬 프라이버시**: 모델, 음성 데이터, 캡처 결과는 모두 사용자의 머신에 유지된다. - **Stories 편집기**: 대화, 팟캐스트, 내러티브를 위한 멀티트랙 타임라인으로, 드래그 앤 드롭 구성과 동기화된 재생을 지원한다. - **Captures**: 받아쓰기, 앱 내 녹음, 업로드는 오디오와 텍스트 기록과 함께 보관되며, 재전사, 정교화, 편집, 음성 샘플로 승격할 수 있다. - **API**: `http://127.0.0.1:17493`에서 `/generate`, `/speak`, `/transcribe`, `/profiles`를 위한 REST API를 사용할 수 있으며, 문서는 `/docs`에서 제공된다. - **플랫폼**: macOS(Apple Silicon 및 Intel)와 Windows용 즉시 다운로드를 제공하며, Docker 지원과 Linux용 소스 빌드 안내도 포함된다. 기술적으로 데스크톱 앱은 Tauri(Rust)와 React/TypeScript로 구축되었으며, FastAPI Python 백엔드, SQLite 저장소, 플랫폼과 GPU에 따라 MLX 또는 PyTorch 추론을 사용한다. README의 로드맵은 Windows/Linux 자동 붙여넣기, 추가 STT 엔진, 스트리밍 전사, 엔드투엔드 음성 LLM, 플러그인 아키텍처에 대한 향후 작업을 언급한다. 이 프로젝트는 GitHub에서 README에 표시된 라이선스 배지와 함께 제공되며, 리포지토리에 기여 가이드라인이 포함되어 있다.