프로젝트 소개

MOSS-TTS-Nano는 MOSI.AI와 OpenMOSS 팀이 개발한 오픈소스 다국어 음성 생성 모델입니다. 약 0.1B 파라미터로 실시간 음성 생성을 목표로 하며, GPU 없이 CPU에서 실행할 수 있어 로컬 데모, 웹 서빙 및 경량 통합에 적합한 간단한 배포를 지원합니다. README에 설명된 주요 특징: - 약 0.1B 파라미터의 초소형 모델 크기. - 기본 48kHz, 2채널(스테레오) 오디오 출력. - 중국어, 영어, 독일어, 스페인어, 프랑스어, 일본어, 이탈리아어, 헝가리어, 한국어, 러시아어, 페르시아어, 아랍어, 폴란드어, 포르투갈어, 체코어, 덴마크어, 스웨덴어, 그리스어, 터키어 등 20개 언어를 포함한 다국어 지원. - 오디오 토크나이저와 LLM 파이프라인을 기반으로 한 순수 자기회귀 아키텍처. - 낮은 실시간 지연 시간과 빠른 첫 오디오 출력을 제공하는 스트리밍 추론. - CPU 친화적: 4코어 CPU에서 스트리밍 생성 실행 가능. - 자동 청크 음성 복제를 통한 긴 텍스트 처리 기능. - 직접 Python 스크립트 및 패키지화된 CLI를 통한 오픈소스 배포 경로. 빠른 시작: README는 깨끗한 Python 환경, 저장소 클론, 요구 사항 설치 및 프로젝트를 편집 가능한 모드로 설치하여 moss-tts-nano 명령을 사용할 수 있도록 권장합니다. 기본 모델 로딩은 OpenMOSS-Team/MOSS-TTS-Nano와 OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano를 사용합니다. 음성 복제가 주요 권장 워크플로우이며, infer.py를 사용하여 프롬프트 오디오 경로와 입력 텍스트로 시연됩니다. 로컬 FastAPI 웹 데모는 app.py로 실행할 수 있으며 127.0.0.1:18083에서 열립니다. ONNX CPU 추론: 경량 로컬 배포를 위해 ONNX CPU 버전이 권장됩니다. 추론 중 PyTorch 의존성을 제거하고, ONNX Runtime CPU에서 실행되며, 직접 참조 오디오, 내장 음성 및 실시간 스트리밍 디코딩을 지원하며, 프로젝트 테스트에서 원본 버전보다 약 2배 더 효율적인 처리 성능을 보인다고 설명됩니다. MacBook Air M4에서 단일 CPU 코어로 원활한 추론이 관찰되었습니다. ONNX 진입점에는 infer_onnx.py, app_onnx.py 및 --backend onnx 옵션이 있는 패키지화된 CLI가 포함됩니다. CUDA 실행은 onnxruntime-gpu 및 --execution-provider cuda를 통해 선택적으로 사용할 수 있습니다. 누락된 모델 파일은 첫 실행 시 ONNX Hugging Face 저장소에서 다운로드됩니다. 추가 도구: examples/android_onnx_runtime 아래의 Android ONNX Runtime 예제는 내보낸 ONNX 그래프를 기기에서 로드하고 WAV 파일을 작성합니다. onnx/ 아래의 내보내기 도구는 로컬 Hugging Face 형식 체크포인트를 TTS 전용 ONNX 모델 디렉토리로 변환합니다. 패키지화된 CLI는 moss-tts-nano generate 및 moss-tts-nano serve 명령을 제공하며, 프롬프트 음성, 텍스트 파일, 백엔드 선택 및 실행 제공자 옵션을 지원합니다. 파인튜닝 코드와 튜토리얼은 finetuning 디렉토리에 제공됩니다. 저장소는 또한 Cat(Causal Audio Tokenizer with Transformer) 아키텍처를 기반으로 한 약 2천만 파라미터의 경량 토크나이저인 MOSS-Audio-Tokenizer-Nano를 문서화합니다. 48kHz 스테레오 입력 및 출력을 지원하고, 오디오를 12.5Hz 토큰 스트림으로 압축하며, 0.125kbps에서 2kbps까지 다양한 비트레이트에서 16개 코드북을 사용하는 RVQ를 사용합니다. 평가 테이블과 플롯은 음성, 오디오 및 음악 데이터에서 120M 이하 파라미터의 오픈소스 토크나이저와 재구성 품질을 비교합니다. 더 넓은 MOSS-TTS 제품군도 설명되며, MOSS-TTS, MOSS-TTS-Local-Transformer, MOSS-TTSD-v1.0, MOSS-VoiceGenerator, MOSS-SoundEffect 및 MOSS-TTS-Realtime이 포함되고 Hugging Face 및 ModelScope의 모델 가중치 링크가 제공됩니다.