منصوبے کے بارے میں
Voicebox ایک open-source AI voice studio ہے جو آپ کی اپنی مشین پر مقامی طور پر چلنے کے لیے بنایا گیا ہے اور یہ ElevenLabs اور WisprFlow جیسی کلاؤڈ خدمات کے مفت متبادل کے طور پر سامنے آتا ہے۔ اس میں صوتی آؤٹ پٹ یعنی text-to-speech اور voice cloning کے ساتھ ساتھ صوتی ان پٹ یعنی speech-to-text dictation شامل ہے، جبکہ اختیاری بہتری اور ہر پروفائل کے لیے الگ صوتی شخصیت کے لیے ایک مقامی LLM بھی شامل کیا گیا ہے۔
ریپوزٹری میں بیان کردہ اہم صلاحیتیں:
- **Voice cloning اور TTS**: مختصر حوالہ نمونے سے zero-shot cloning کے ساتھ 50 سے زیادہ منتخب کردہ preset voices۔ سات TTS انجن شامل ہیں (Qwen3-TTS، Qwen CustomVoice، LuxTTS، Chatterbox Multilingual، Chatterbox Turbo، HumeAI TADA، اور Kokoro)، جو انجن کے لحاظ سے 23 زبانوں تک کا احاطہ کرتے ہیں۔
- **Speech-to-text**: مقامی طور پر OpenAI Whisper کے ذریعے چلتا ہے، جس میں Base سے Turbo تک ماڈل سائز کے اختیارات ہیں اور یہ Apple Silicon پر MLX یا CUDA/ROCm/DirectML/CPU پر PyTorch کے ذریعے چلتا ہے۔
- **Global dictation**: ایک system-wide hotkey صارفین کو کسی بھی فوکس شدہ ٹیکسٹ فیلڈ میں بول کر متن لکھنے دیتا ہے۔ README میں macOS پر accessibility-verified injection کے ساتھ target-aware paste اور Accessibility اور Input Monitoring کے لیے پہلی بار اجازتوں کے UX کا ذکر کیا گیا ہے۔
- **Audio post-processing**: Spotify کی pedalboard لائبریری پر مبنی آٹھ ایفیکٹس، جن میں pitch shift، reverb، delay، chorus، compressor، gain اور filters شامل ہیں، اور دوبارہ استعمال کے قابل پری سیٹس بھی ہیں۔
- **Agent voice output**: ایک بلٹ اِن MCP (Model Context Protocol) سرور `voicebox.speak`، `voicebox.transcribe`، `voicebox.list_captures` اور `voicebox.list_profiles` جیسے ٹولز فراہم کرتا ہے۔ Claude Code، Cursor، Windsurf اور Cline جیسے MCP-aware ایجنٹس ایک ہی ٹول کال کے ذریعے صارف سے کلون شدہ آواز میں بات کر سکتے ہیں۔
- **مقامی رازداری**: ماڈلز، صوتی ڈیٹا اور کیپچرز صارف کی اپنی مشین پر ہی رہتے ہیں۔
- **Stories editor**: گفتگو، پوڈکاسٹ اور بیانیوں کے لیے ایک کثیر ٹریک ٹائم لائن، جس میں drag-and-drop تشکیل اور ہم آہنگ پلے بیک شامل ہے۔
- **Captures**: Dictations، ایپ کے اندر ریکارڈنگز اور اپ لوڈز آڈیو اور متن کے ساتھ محفوظ رہتے ہیں، اور انہیں دوبارہ ٹرانسکرائب، بہتر، ایڈٹ یا صوتی نمونے کے طور پر استعمال کیا جا سکتا ہے۔
- **API**: ایک REST API `http://127.0.0.1:17493` پر دستیاب ہے جو `/generate`، `/speak`، `/transcribe` اور `/profiles` فراہم کرتی ہے، جبکہ دستاویزات `/docs` پر موجود ہیں۔
- **پلیٹ فارمز**: macOS (Apple Silicon اور Intel) اور Windows کے لیے تیار ڈاؤن لوڈز، ساتھ ہی Docker سپورٹ اور Linux کے لیے سورس سے بنانے کی ہدایات۔
تکنیکی طور پر یہ ڈیسک ٹاپ ایپ Tauri (Rust) اور React/TypeScript کے ساتھ بنائی گئی ہے، جس میں FastAPI Python بیک اینڈ، SQLite اسٹوریج، اور پلیٹ فارم اور GPU کے لحاظ سے MLX یا PyTorch inference استعمال ہوتی ہے۔ README میں موجود روڈ میپ میں مستقبل میں Windows/Linux auto-paste، اضافی STT انجن، اسٹریمنگ ٹرانسکرپشن، end-to-end speech LLMs اور پلگ ان آرکیٹیکچر پر کام کا ذکر ہے۔ یہ پروجیکٹ GitHub پر دستیاب ہے، README میں لائسنس بیج کا حوالہ دیا گیا ہے اور ریپوزٹری میں تعاون کی ہدایات بھی شامل ہیں۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.