منصوبے کے بارے میں
Pocket TTS ایک open-source text-to-speech (TTS) ایپلیکیشن ہے جسے Kyutai Labs نے تیار کیا ہے۔ یہ CPUs پر مؤثر طریقے سے چلنے کے لیے ڈیزائن کیا گیا ہے اور اسے GPUs یا web APIs کی ضرورت نہیں ہوتی۔ اس ماڈل میں تقریباً 100 ملین پیرامیٹرز ہیں اور اسے کم تاخیر کے ساتھ آڈیو جنریشن کے لیے بہتر بنایا گیا ہے۔ صرف 2 CPU cores استعمال کرتے ہوئے MacBook Air M4 پر پہلے آڈیو چنک تک تقریباً 200ms اور حقیقی وقت سے تقریباً 6 گنا تیز رفتار حاصل کی جاتی ہے۔
یہ پروجیکٹ Python 3.10 سے 3.14 تک کی معاونت کرتا ہے اور اسے PyTorch 2.5 یا بعد کے ورژن کی ضرورت ہوتی ہے (صرف CPU والی builds بھی معاون ہیں)۔ یہ ایک Python library API اور command-line interface (CLI) دونوں فراہم کرتا ہے، جن میں آڈیو بنانے کے لیے (generate)، مقامی HTTP سرور چلانے کے لیے (serve)، اور voice embeddings کو safetensors فائلوں میں ایکسپورٹ کرنے کے لیے (export-voice) کمانڈز شامل ہیں۔
اہم خصوصیات میں شامل ہیں:
- آڈیو نمونوں (wav یا mp3 فائلوں) سے voice cloning
- انگریزی، فرانسیسی، جرمن، پرتگالی، اطالوی اور ہسپانوی کے لیے کثیر لسانی معاونت
- لامحدود طور پر طویل متن ان پٹس کی معاونت کے ساتھ audio streaming
- مختلف آوازوں کے ساتھ پہلے سے تیار کردہ voice catalog جو Hugging Face پر دستیاب ہے
- اضافی زبانوں کے لیے کمیونٹی کی تربیت یافتہ ماڈلز، جن میں چیک، ہندی، کوریائی، فارسی، انڈونیشیائی اور اسٹونین شامل ہیں
- صارفین کی اپنی ماڈلز تربیت دینے کے لیے تربیتی کوڈ کی رہائی
اس پروجیکٹ میں کمیونٹی کی متعدد عملدرآمدیں اور انٹیگریشنز بھی ہیں، جن میں WebAssembly/براؤزر ورژن، Rust پورٹس، C++ عملدرآمدیں، Apple Silicon کے لیے MLX بیک اینڈ، اور Home Assistant، Discord، Unity اور ComfyUI جیسے پلیٹ فارمز کے ساتھ انٹیگریشنز شامل ہیں۔
README میں نوٹ کیا گیا ہے کہ GPU معاونت سرکاری طور پر معاون نہیں ہے لیکن ماڈل کو دستی طور پر CUDA پر منتقل کر کے حاصل کی جا سکتی ہے، جس سے کچھ ہارڈویئر ترتیبات پر ماپے گئے سپیڈ اپس حاصل ہوتے ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.