프로젝트 소개
VoiceStudio는 클라우드 음성 서비스의 오픈소스 완전 로컬 대안으로, 음성 복제, 음성 설계, 비디오 더빙, 받아쓰기, 전사 및 오디오북 제작을 다룹니다. 이 프로젝트는 646개 언어 지원을 내세우며, 로컬 워크플로우가 사용자 자체 하드웨어에서 실행되고 원격 서비스는 선택 사항이며 사용 분석은 동의가 필요하다고 설명합니다.
핵심 기능은 세 영역으로 그룹화됩니다. 생성(Create): 참조 녹음에서 음성을 복제하거나 설명에서 새 음성을 설계합니다. 제작(Produce): 시간 지정 음성으로 비디오를 더빙하고, 스토리와 오디오북을 생성하며, 배치 작업을 실행합니다. 연결(Connect): 에이전트용 로컬 API와 MCP 서버를 노출하고, 선택적 원격 작업자를 지원합니다.
기본 엔진은 k2-fsa/OmniVoice 기반으로 설명되는 VoiceStudio이며, 다른 엔진을 선택할 수 있고 기능 및 엔진 카탈로그는 문서에 제공됩니다. 하드웨어 요구 사항은 엔진에 따라 다르며, 성능 문서에서 기대치를 다룹니다. 모델은 요청 시 다운로드되며, 앱은 필수 모델 설치 전에 프롬프트를 표시합니다.
설치 옵션에는 curl 스크립트를 통한 macOS 및 Linux용 원커맨드 설치 프로그램이 포함되며, 최신 Electron 릴리스 설치, 특정 버전 설치, 현재 main 브랜치 빌드, 또는 데이터를 유지하면서 제거를 지원합니다. 릴리스 다운로드에는 curl과 SHA-256 도구가 필요하고, main 빌드에는 Git, Node.js 22+, Bun, Rust/Cargo 및 플랫폼 빌드 도구가 필요합니다. macOS, Windows, Linux 및 Docker용 플랫폼 가이드가 있으며, 릴리스는 직접 다운로드할 수 있습니다. 또한 Claude Code, Codex 및 Cursor 같은 코딩 에이전트를 위한 에이전트 지향 설치 프롬프트와 하드웨어 감지, 기존 데이터 재사용, 모델 다운로드 전 질문, 테스트 생성을 다루는 에이전트 가이드가 있습니다. 스킬은 npx skills add debpalash/VoiceStudio로 추가할 수 있으며, 오디오 워크플로우 스킬 또는 유지관리자 스킬을 선택할 수 있습니다.
소스에서 실행은 Bun을 사용합니다: 저장소를 클론하고, bun install을 실행하고, bun run setup:api로 Python 종속성을 준비한 다음 bun run dev를 실행합니다. 스모크 테스트 명령은 격리된 패키지 Electron 앱을 빌드하고 실행하며, 선택적 네트워크 관리 런타임 설치 확인을 포함합니다.
README는 Electron이 유일하게 유지관리되는 데스크톱 앱이며 버전 0.5.3이 마지막 Tauri 릴리스였다고 명시합니다. 기존 Tauri 사용자는 마이그레이션 문서를 참조하며, Tauri 소스는 추가 업데이트 없이 보관됩니다. 루트 개발, 빌드, 테스트 및 릴리스 명령은 Electron을 대상으로 합니다.
문서는 문제 해결, 모델 다운로드, 엔진 가이드, 벤치마크, 로컬 음성 플랫폼 API, MCP 통합 및 예제, 기여, Electron 설정 및 변경 로그를 다룹니다. 프로젝트는 AGPL-3.0 라이선스이며, 모델 라이선스와 책임 있는 사용에 대한 별도 고지를 포함합니다. README는 상업적 사용 전 모델 라이선스 검토와 허가를 받은 음성 복제를 권고합니다. 후원 및 기부 채널이 나열되어 있습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.