프로젝트 소개
VoxCPM2는 OpenBMB에서 출시한 오픈소스 텍스트-음성 변환 시스템으로, discrete tokenization을 피하고 end-to-end diffusion autoregressive 아키텍처를 통해 연속적인 음성 표현을 생성합니다. 최신 2B 파라미터 릴리즈는 다국어 음성 데이터로 학습되었으며, 쓰촨어, 광둥어, 우어 같은 중국어 방언을 포함한 30개 언어를 지원합니다.
README에 기술된 주요 기능은 언어 태그 없이 다국어 합성, 성별, 연령, 어조, 감정, 말하기 속도 등 자연어 설명을 통한 음성 설계, 짧은 참고 클립을 이용한 제어 가능한 음성 모방(선택적 스타일 가이드 포함), 그리고 참고 오디오와 그 음원 텍스트(transcript)를 모두 사용해 음성에 뉘앙스를 재현하는 'ultimate cloning' 모드가 있습니다. AudioVAE V2의 비대칭 인코딩/디코딩 설계는 16kHz 참고 오디오를 받아 내부 super-resolution 기능과 함께 48kHz 오디오를 출력합니다.
이 프로젝트는 Python API, CLI, 웹 데모를 제공하며 스트리밍 생성도 지원합니다. 배포 옵션으로는 고속 서빙을 위한 Nano-vLLM, OpenAI 호환 /v1/audio/speech 엔드포인트를 위한 vLLM-Omni, 그리고 CPU, Metal, CUDA, Vulkan에서 GGUF 가중치로 온디바이스 C++ 추론을 위한 llama.cpp-omni가 있습니다. SFT와 LoRA를 통한 파인튜닝도 지원하며, 가중치와 코드는 상업적 사용이 가능한 Apache-2.0 라이선스로 공개되었습니다.
README에는 Seed-TTS-eval에서의 벤치마크 결과와 리스크 및 한계도 나와 있습니다. 이 개요는 저장소 README에만 기반하며 성능 주장을 독립적으로 검증하지 않습니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.