프로젝트 소개
MOSS-TTS Family는 다양한 오디오 생성 작업을 위한 5개의 프로덕션 준비 완료 모델을 제공합니다. MOSS-TTS(플래그십)는 장문 안정성, 토큰 수준의 길이 제어, 병음(Pinyin)/IPA 발음 제어, 다국어 및 코드 스위칭 합성을 갖춘 고충실도 제로샷 음성 클로닝을 제공합니다. MOSS-TTSD는 팟캐스트와 더빙을 위한 표현력 있는 다중 화자 대화 생성을 전문으로 합니다. MOSS-VoiceGenerator는 참조 음성 없이 텍스트 프롬프트만으로 다양한 음성과 스타일을 생성합니다. MOSS-TTS-Realtime는 180ms TTFB로 음성 에이전트를 위한 저지연 스트리밍을 가능하게 합니다. MOSS-SoundEffect는 48kHz로 최대 30초 길이의 환경음, 도시 풍경, 생물 소리, 음악 프래그먼트를 생성합니다.
두 가지 핵심 아키텍처가 있습니다. MossTTSDelay(딜레이 패턴 스케줄링을 적용한 멀티헤드 병렬 RVQ)은 긴 컨텍스트 안정성과 프로덕션 준비성을 강조하며, MossTTSLocal(깊이 트랜스포머를 갖춘 시간 동기 RVQ 블록)은 스트리밍을 위한 경량 유연성을 강조합니다. MossTTSRealtime는 멀티턴 컨텍스트 인식을 위한 계층적 텍스트-오디오 모델링을 추가합니다.
공개된 체크포인트는 1.7B에서 8B 파라미터 범위이며, v1.5 업데이트를 통해 언어 태그 기반의 더 강력한 다국어 합성, 더 안정적인 음성 클로닝, 개선된 긴 참조-짧은 텍스트 처리, 문장부호를 따르는 프로소디, `[pause X.Ys]` 마커를 통한 명시적 일시정지 제어가 추가되었습니다. MOSS-TTS-Local-Transformer-v1.5는 MOSS-Audio-Tokenizer-v2를 사용해 네이티브 48kHz 스테레오 출력을 지원합니다.
추론 백엔드로는 SGLang-Omni(MossTTSLocal에 대한 Day-0 지원), vLLM-Omni(전 시리즈 지원), 그리고 PyTorch 없는 배포를 위한 ONNX Runtime 기반 llama.cpp(GGUF 가중치 제공)가 포함됩니다. 파인튜닝 튜토리얼은 MossTTSDelay, MossTTSLocal, MossTTSRealtime 아키텍처를 다룹니다. 모델은 Hugging Face와 ModelScope에 호스팅되어 있으며, SGLang을 통한 OpenAI 호환 API 엔드포인트를 제공합니다.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.