منصوبے کے بارے میں

MOSS-TTS Family متنوع آڈیو جنریشن ٹاسکس کے لیے پانچ پروڈکشن ریڈی ماڈلز فراہم کرتی ہے۔ MOSS-TTS (فلیگ شپ) طویل فارم استحکام، ٹوکن لیول دورانیہ کنٹرول، Pinyin/IPA تلفظ کنٹرول اور ملٹی لنگویل/کوڈ سوئچڈ سنتھیسس کے ساتھ ہائی فڈیلیٹی زیرو شاٹ وائس کلوننگ فراہم کرتا ہے۔ MOSS-TTSD پوڈکاسٹس اور ڈبنگ کے لیے اظہار بھری ملٹی اسپیکر ڈائیلاگ جنریشن میں مہارت رکھتا ہے۔ MOSS-VoiceGenerator ریفرنس اسپیچ کے بغیر ٹیکسٹ پرامپٹس سے متنوع آوازیں اور اسٹائلز تخلیق کرتا ہے۔ MOSS-TTS-Realtime وائس ایجنٹس کے لیے 180ms TTFB کے ساتھ کم لیٹینسی اسٹریمنگ ممکن بناتا ہے۔ MOSS-SoundEffect ماحولیاتی آوازیں، شہری مناظر، حیاتیاتی آوازیں اور 48kHz پر 30 سیکنڈ تک کے میوزیکل فریگمنٹس جنریٹ کرتا ہے۔ دو بنیادی آرکیٹیکچرز: MossTTSDelay (ڈیلے پیٹرن شیڈولنگ کے ساتھ ملٹی ہیڈ پیرالل RVQ) طویل کانٹیکسٹ استحکام اور پروڈکشن ریڈی نیس پر زور دیتا ہے؛ MossTTSLocal (ڈپتھ ٹرانسفارمر کے ساتھ ٹائم سنکرونس RVQ بلاکس) اسٹریمنگ کے لیے ہلکے پھلکے لچک پر زور دیتا ہے۔ MossTTSRealtime ملٹی ٹرن کانٹیکسٹ آگاہی کے لیے ہائیرارکیکل ٹیکسٹ آڈیو ماڈلنگ شامل کرتا ہے۔ جاری کردہ چیک پوائنٹس 1.7B سے 8B پیرامیٹرز پر مشتمل ہیں، جبکہ v1.5 اپڈیٹس زبان کے ٹیگز کے ذریعے مضبوط ملٹی لنگویل سنتھیسس، زیادہ مستحکم وائس کلوننگ، بہتر لانگ ریفرنس شارٹ ٹیکسٹ ہینڈلنگ، رموزِ اوقاف کی پیروی کرنے والی پروڈی اور `[pause X.Ys]` مارکرز کے ذریعے واضح پاز کنٹرول شامل کرتی ہیں۔ MOSS-TTS-Local-Transformer-v1.5 نیٹو 48kHz سٹیریو آؤٹ پٹ کے لیے MOSS-Audio-Tokenizer-v2 استعمال کرتا ہے۔ انفرنس بیک اینڈز میں SGLang-Omni (MossTTSLocal کے لیے ڈے 0 سپورٹ)، vLLM-Omni (مکمل سیریز سپورٹ) اور PyTorch فری تعیناتی کے لیے ONNX Runtime کے ساتھ llama.cpp شامل ہیں (GGUF ویٹس دستیاب ہیں)۔ فائن ٹیوننگ ٹیوٹوریلز MossTTSDelay، MossTTSLocal اور MossTTSRealtime آرکیٹیکچرز پر محیط ہیں۔ ماڈلز Hugging Face اور ModelScope پر میزبانی کیے گئے ہیں اور SGLang کے ذریعے OpenAI کمپیٹیبل API اینڈ پوائنٹس کے ساتھ دستیاب ہیں۔