프로젝트 소개
VibeVoice는 Microsoft의 오픈소스 음성 AI 프로젝트로, Automatic Speech Recognition(ASR)과 Text-to-Speech(TTS) 모델을 모두 포함한다. 핵심 기술적 특징은 초저프레임률 7.5Hz로 작동하는 연속 음성 토크나이저를 사용하여 오디오 충실도를 유지하면서 긴 시퀀스에 대한 계산 효율성을 개선하고, 다음 토큰 확산 프레임워크와 결합한 것이다.
저장소에 문서화된 주요 모델 및 기능:
1. VibeVoice-ASR: 단일 패스에서 최대 60분의 연속 오디오를 처리할 수 있는 통합 음성-텍스트 모델이다. 화자(ID), 시간표시, 내용으로 구성된 구조화된 텍스트 변환을 산출한다. 도메인 특화 용어용 사용자 지정 핫워드를 지원하며, 50개 이상 언어를 본국적으로 지원한다. 오디오가 도착하는 대로 변환하는 스트리밍 변형도 존재한다. Hugging Face Transformers에 통합되어 있으며 vLLM 추론을 지원한다.
2. VibeVoice-ASR-BitNet: 이종 양자화(I8_S + I2_S)를 사용하는 에지 CPU 추론 엔진으로, 모델을 4.62GB에서 1.58GB로 압축하여 GPU 없이 CPU 스레드에서 실시간 추론을 가능하게 한다.
3. VibeVoice-TTS: 최대 4명의 서로 다른 화자로 단일 패스에서 최대 90분 동안 음성을 합성할 수 있는 장편 다중 화자 TTS 모델이다. 영어와 중국어를 포함한 여러 언어와 표현적인 음성을 지원한다. 참고: 오용 사례 이후 책임 있는 AI 관련 고려사항으로 TTS 코드가 저장소에서 삭제되었다.
4. VibeVoice-Realtime-0.5B: 스트리밍 텍스트 입력과 강력한 장편 음성 생성을 지원하는 경량(0.5B 파라미터) 실시간 스트리밍 TTS 모델로, 실험적 다국어 음성을 지원한다.
저장소에는 문서, ASR 파인튜닝 코드, 데모, Hugging Face의 모델 가중치 링크가 포함되어 있다. 본 프로젝트는 연구 및 개발 목적으로만 설계되었으며, 추가 테스트 없이 상업적 또는 실제 응용에 권장되지 않는다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.