عن المشروع

توفر عائلة MOSS-TTS خمسة نماذج جاهزة للإنتاج لمهام متنوعة في توليد الصوت. يقدم MOSS-TTS (النموذج الرئيسي) استنساخًا صوتيًا عالي الدقة بدون أمثلة (zero-shot) مع استقرار في المحتوى الطويل، وتحكم في المدة على مستوى الرموز (token)، وتحكم في النطق عبر Pinyin/IPA، وتركيبًا متعدد اللغات مع التبديل بينها. يتخصص MOSS-TTSD في توليد حوارات تعبيرية متعددة المتحدثين للبودكاست والدبلجة. ينشئ MOSS-VoiceGenerator أصواتًا وأنماطًا متنوعة من نصوص وصفية دون الحاجة إلى كلام مرجعي. يتيح MOSS-TTS-Realtime بثًا منخفض زمن الاستجابة لوكلاء الصوت مع زمن وصول أول بايت صوتي (TTFB) يبلغ 180 مللي ثانية. يولّد MOSS-SoundEffect أصواتًا بيئية ومشاهد حضرية وأصواتًا حيوية ومقاطع موسيقية تصل مدتها إلى 30 ثانية بجودة 48 كيلوهرتز. هناك معماريان أساسيان: يركز MossTTSDelay (RVQ متوازي متعدد الرؤوس مع جدولة بنمط التأخير) على استقرار السياق الطويل والجاهزية للإنتاج، بينما يركز MossTTSLocal (كتل RVQ متزامنة زمنيًا مع محول عمق transformer) على المرونة الخفيفة للبث. يضيف MossTTSRealtime نمذجة هرمية للنص والصوت لإدراك السياق في المحادثات متعددة الأدوار. تتراوح نقاط التحقق (checkpoints) المطروحة بين 1.7 و8 مليار معامل، وتضيف تحديثات v1.5 تركيبًا متعدد اللغات أقوى عبر وسوم اللغات، واستنساخًا صوتيًا أكثر استقرارًا، وتعاملًا أفضل مع النصوص القصيرة ذات المراجع الطويلة، ونبرة تتبع علامات الترقيم، وتحكمًا صريحًا في التوقفات عبر علامات `[pause X.Ys]`. يستخدم MOSS-TTS-Local-Transformer-v1.5 أداة MOSS-Audio-Tokenizer-v2 لإخراج ستيريو أصلي بجودة 48 كيلوهرتز. تشمل خلفيات الاستدلال SGLang-Omni (بدعم من اليوم الأول لـ MossTTSLocal)، وvLLM-Omni (بدعم كامل للسلسلة)، وllama.cpp مع ONNX Runtime لنشر بدون PyTorch (مع توفر أوزان GGUF). تغطي دروس الضبط الدقيق معماريات MossTTSDelay وMossTTSLocal وMossTTSRealtime. النماذج مستضافة على Hugging Face وModelScope مع نقاط نهاية API متوافقة مع OpenAI عبر SGLang.