منصوبے کے بارے میں
ریئل ٹائم وائس کلوننگ، مقالے "Transfer Learning from Speaker Verification to Multispeaker Text-To-Speech Synthesis" (SV2TTS) کی ایک پیاد کاری ہے، جو اصل میں ماسٹرز تھیسس کے طور پر تیار کی گئی تھی۔ یہ چند سیکنڈ کی آڈیو سے آواز کی نقل تیار کرتی ہے اور پھر حقیقی وقت میں صوتی تقریر پیدا کرتی ہے۔
SV2TTS ایک تین مرحلوں پر مشتمل ڈیپ لرننگ فریم ورک ہے۔ پہلا مرحلہ چند سیکنڈ کی آڈیو سے آواز کی ڈیجیٹل نمائندگی بناتا ہے (GE2E پر مبنی اسپیکر انکوڈر)۔ دوسرے اور تیسرے مرحلے میں، اس نمائندگی کو بطور حوالہ استعمال کرتے ہوئے صوتی متن کے لیے تقریر تیار کی جاتی ہے، جس میں Tacotron پر مبنی سنتھیسائزر اور WaveRNN ووکوڈر استعمال ہوتے ہیں۔ یہ ریپوزٹری SV2TTS اور خود GE2E انکوڈر کی پیاد کاری کرتی ہے، اور ووکوڈر اور سنتھیسائزر اجزاء کے لیے fatchord/WaveRNN پر مبنی ہے۔
یہ پروجیکٹ ایک ٹول باکس فراہم کرتا ہے جس میں GUI (demo_toolbox.py) اور کمانڈ لائن انٹرفیس (demo_cli.py) دونوں شامل ہیں۔ ونڈوز اور لینکس کی معاونت کی جاتی ہے۔ سیٹ اپ کے لیے آڈیو فائلیں پڑھنے کے لیے ffmpeg اور پائتھون پیکیج مینجمنٹ کے لیے uv درکار ہے؛ ٹول باکس کو NVIDIA GPUs کے لیے CUDA ایکسٹرا یا CPU ایکسٹرا کے ساتھ چلایا جا سکتا ہے۔ پہلے سے تربیت یافتہ ماڈلز خودکار طور پر ڈاؤن لوڈ ہو جاتے ہیں، اور Hugging Face سے دستی ڈاؤن لوڈ بھی دستیاب ہے۔ LibriSpeech train-clean-100 جیسے اختیاری ڈیٹا سیٹ تجربات کے لیے استعمال کیے جا سکتے ہیں، تاہم صارفین اپنی آڈیو فائلیں بھی فراہم کر سکتے ہیں یا ٹول باکس میں براہ راست ریکارڈ کر سکتے ہیں۔
README میں نوٹ کیا گیا ہے کہ یہ ریپوزٹری پرانی ہو چکی ہے، اور بہت سی ادا شدہ SaaS خدمات اب بہتر آڈیو کوالٹی پیش کرتی ہیں۔ یہ قارئین کو حالیہ اسپیچ سنتھیسس تحقیق کے لیے Papers with Code اور زیادہ موجودہ اوپن سورس متبادل کے طور پر Chatterbox کی طرف اشارہ کرتا ہے۔
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.