منصوبے کے بارے میں
MOSS-TTS-Nano MOSI.AI اور OpenMOSS ٹیم کا ایک اوپن سورس کثیر لسانی تقریر پیدا کرنے والا ماڈل ہے۔ تقریباً 0.1B پیرامیٹرز کے ساتھ، یہ ریئل ٹائم تقریر پیدا کرنے کو نشانہ بناتا ہے اور بغیر GPU کے CPU پر چل سکتا ہے، جس سے مقامی ڈیمو، ویب سرونگ اور ہلکے انضمام کے لیے تعیناتی آسان ہوتی ہے۔
README میں بیان کردہ اہم خصوصیات:
- تقریباً 0.1B پیرامیٹرز کا چھوٹا ماڈل سائز۔
- مقامی 48 kHz، 2 چینل (سٹیریو) آڈیو آؤٹ پٹ۔
- 20 زبانوں کی کثیر لسانی حمایت، بشمول چینی، انگریزی، جرمن، ہسپانوی، فرانسیسی، جاپانی، اطالوی، ہنگری، کورین، روسی، فارسی، عربی، پولش، پرتگالی، چیک، ڈینش، سویڈش، یونانی اور ترکی۔
- آڈیو ٹوکنائزر اور LLM پائپ لائن پر مبنی خالص آٹو ریگریسو فن تعمیر۔
- کم ریئل ٹائم تاخیر اور تیز پہلی آڈیو کے ساتھ سٹریمنگ انفرنس۔
- CPU دوستانہ: سٹریمنگ جنریشن 4 کور CPU پر چل سکتی ہے۔
- خودکار چنکڈ وائس کلوننگ کے ساتھ طویل متن کی صلاحیت۔
- براہ راست Python اسکرپٹس اور پیکڈ CLI کے ذریعے اوپن سورس تعیناتی کے راستے۔
فوری آغاز: README ایک صاف Python ماحول، ریپوزٹری کلون کرنے، تقاضے انسٹال کرنے اور پروجیکٹ کو ایڈیٹیبل موڈ میں انسٹال کرنے کی تجویز دیتا ہے تاکہ moss-tts-nano کمانڈ دستیاب ہو جائے۔ ڈیفالٹ ماڈل لوڈنگ OpenMOSS-Team/MOSS-TTS-Nano اور OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano استعمال کرتی ہے۔ وائس کلوننگ اہم تجویز کردہ ورک فلو ہے، جس کا مظاہرہ infer.py کے ساتھ پرامپٹ آڈیو پاتھ اور ان پٹ ٹیکسٹ استعمال کرتے ہوئے کیا گیا ہے۔ ایک مقامی FastAPI ویب ڈیمو app.py کے ساتھ لانچ کیا جا سکتا ہے اور 127.0.0.1:18083 پر کھولا جا سکتا ہے۔
ONNX CPU انفرنس: ہلکی مقامی تعیناتی کے لیے ONNX CPU ورژن تجویز کیا جاتا ہے۔ یہ انفرنس کے دوران PyTorch انحصار کو ہٹاتا ہے، ONNX Runtime CPU پر چلتا ہے، براہ راست ریفرنس آڈیو، بلٹ ان آوازیں اور ریئل ٹائم سٹریمنگ ڈی کوڈ کو سپورٹ کرتا ہے، اور پروجیکٹ کے ٹیسٹوں میں اصل ورژن کے مقابلے میں تقریباً 2 گنا زیادہ پروسیسنگ موثر بتایا گیا ہے۔ MacBook Air M4 پر، ایک CPU کور کے ساتھ ہموار انفرنس دیکھا گیا۔ ONNX انٹری پوائنٹس میں infer_onnx.py، app_onnx.py اور پیکڈ CLI شامل ہیں جس میں --backend onnx ہے۔ CUDA عمل درآمد onnxruntime-gpu اور --execution-provider cuda کے ذریعے اختیاری ہے۔ غائب ماڈل فائلیں پہلی بار چلانے پر ONNX Hugging Face ریپوزٹریوں سے ڈاؤن لوڈ ہوتی ہیں۔
اضافی ٹولنگ: examples/android_onnx_runtime کے تحت ایک Android ONNX Runtime مثال ڈیوائس پر ایکسپورٹ شدہ ONNX گراف لوڈ کرتی ہے اور WAV فائل لکھتی ہے۔ onnx/ کے تحت ایک ایکسپورٹر مقامی Hugging Face فارمیٹ چیک پوائنٹ کو TTS-صرف ONNX ماڈل ڈائریکٹری میں تبدیل کرتا ہے۔ پیکڈ CLI moss-tts-nano generate اور moss-tts-nano serve کمانڈز پیش کرتا ہے، جس میں پرامپٹ اسپیچ، ٹیکسٹ فائلوں، بیک اینڈ انتخاب اور ایگزیکیوشن پرووائیڈر کے اختیارات ہیں۔ فائن ٹیوننگ کوڈ اور ٹیوٹوریلز finetuning ڈائریکٹری میں فراہم کیے گئے ہیں۔
ریپوزٹری MOSS-Audio-Tokenizer-Nano کی بھی دستاویز کرتی ہے، جو Cat (Causal Audio Tokenizer with Transformer) فن تعمیر پر مبنی تقریباً 20 ملین پیرامیٹرز کا ہلکا ٹوکنائزر ہے۔ یہ 48 kHz سٹیریو ان پٹ اور آؤٹ پٹ کو سپورٹ کرتا ہے، آڈیو کو 12.5 Hz ٹوکن سٹریم میں کمپریس کرتا ہے، اور 0.125 kbps سے 2 kbps تک متغیر بٹ ریٹس میں 16 کوڈ بکس کے ساتھ RVQ استعمال کرتا ہے۔ تشخیصی جدولیں اور پلاٹ تقریر، آڈیو اور موسیقی کے ڈیٹا پر 120M سے زیادہ پیرامیٹرز والے اوپن سورس ٹوکنائزرز کے مقابلے میں تعمیر نو کے معیار کا موازنہ کرتے ہیں۔
وسیع تر MOSS-TTS خاندان بھی بیان کیا گیا ہے، بشمول MOSS-TTS، MOSS-TTS-Local-Transformer، MOSS-TTSD-v1.0، MOSS-VoiceGenerator، MOSS-SoundEffect اور MOSS-TTS-Realtime، جن میں Hugging Face اور ModelScope پر ماڈل وزن کے لنکس شامل ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.