इस प्रोजेक्ट के बारे में

Voicebox एक ओपन-सोर्स AI वॉयस स्टूडियो है जिसे आपकी अपनी मशीन पर स्थानीय रूप से चलाने के लिए डिज़ाइन किया गया है। यह ElevenLabs और WisprFlow जैसी क्लाउड सेवाओं के लिए एक मुफ्त विकल्प के रूप में कार्य करता है। इसमें वॉयस आउटपुट (टेक्स्ट-टू-स्पीच और वॉयस क्लोनिंग) और वॉयस इनपुट (स्पीच-टू-टेक्स्ट डिक्टेशन) दोनों शामिल हैं, साथ ही वैकल्पिक सुधार और प्रति-प्रोफ़ाइल वॉयस व्यक्तित्व के लिए एक बंडल स्थानीय LLM भी है। रिपॉजिटरी में वर्णित मुख्य क्षमताएं: - **वॉयस क्लोनिंग और TTS**: एक छोटे संदर्भ नमूने से ज़ीरो-शॉट क्लोनिंग, साथ ही 50+ क्यूरेटेड प्रीसेट आवाज़ें। सात TTS इंजन शामिल हैं (Qwen3-TTS, Qwen CustomVoice, LuxTTS, Chatterbox Multilingual, Chatterbox Turbo, HumeAI TADA, और Kokoro), जो इंजन के आधार पर 23 भाषाओं तक कवर करते हैं। - **स्पीच-टू-टेक्स्ट**: स्थानीय रूप से OpenAI Whisper द्वारा संचालित, जिसमें Base से Turbo तक मॉडल आकार के विकल्प हैं, जो Apple Silicon पर MLX के माध्यम से या CUDA/ROCm/DirectML/CPU पर PyTorch के माध्यम से चलते हैं। - **ग्लोबल डिक्टेशन**: एक सिस्टम-व्यापी हॉटकी उपयोगकर्ताओं को किसी भी केंद्रित टेक्स्ट फ़ील्ड में डिक्टेट करने की अनुमति देती है। README में macOS पर एक्सेसिबिलिटी-वेरिफाइड इंजेक्शन के साथ टारगेट-अवेयर पेस्ट और एक्सेसिबिलिटी और इनपुट मॉनिटरिंग के लिए फर्स्ट-रन अनुमतियों का उल्लेख है। - **ऑडियो पोस्ट-प्रोसेसिंग**: Spotify की pedalboard लाइब्रेरी पर निर्मित आठ प्रभाव, जिनमें पिच शिफ्ट, रिवर्ब, डिले, कोरस, कंप्रेसर, गेन और फिल्टर शामिल हैं, जिन्हें पुन: प्रयोज्य प्रीसेट के साथ उपयोग किया जा सकता है। - **एजेंट वॉयस आउटपुट**: एक इन-बिल्ट MCP (मॉडल कॉन्टेक्स्ट प्रोटोकॉल) सर्वर `voicebox.speak`, `voicebox.transcribe`, `voicebox.list_captures`, और `voicebox.list_profiles` जैसे टूल्स को उजागर करता है। Claude Code, Cursor, Windsurf, और Cline जैसे MCP-सक्षम एजेंट एक टूल कॉल के माध्यम से क्लोन की गई आवाज़ में उपयोगकर्ता से बात कर सकते हैं। - **स्थानीय गोपनीयता**: मॉडल, वॉयस डेटा और कैप्चर उपयोगकर्ता की मशीन पर ही रहते हैं। - **स्टोरीज एडिटर**: बातचीत, पॉडकास्ट और आख्यानों के लिए एक मल्टी-ट्रैक टाइमलाइन, जिसमें ड्रैग-एंड-ड्रॉप कंपोजिशन और सिंक्रोनाइज़्ड प्लेबैक की सुविधा है। - **कैप्चर**: डिक्टेशन, इन-ऐप रिकॉर्डिंग और अपलोड को ऑडियो और ट्रांसक्रिप्ट के साथ रखा जाता है, और इन्हें पुन: ट्रांसक्राइब, रिफाइन, संपादित या वॉयस सैंपल के रूप में प्रमोट किया जा सकता है। - **API**: `/generate`, `/speak`, `/transcribe`, और `/profiles` के लिए `http://127.0.0.1:17493` पर एक REST API उपलब्ध है, जिसके दस्तावेज़ `/docs` पर हैं। - **प्लेटफ़ॉर्म**: macOS (Apple Silicon और Intel) और Windows के लिए तैयार डाउनलोड, साथ ही Linux के लिए Docker सपोर्ट और सोर्स से बिल्ड करने के निर्देश उपलब्ध हैं। तकनीकी रूप से, डेस्कटॉप ऐप Tauri (Rust) और React/TypeScript के साथ बनाया गया है, जिसमें FastAPI Python बैकएंड, SQLite स्टोरेज और प्लेटफ़ॉर्म और GPU के आधार पर MLX या PyTorch इन्फरेंस का उपयोग किया गया है। README में विंडोज/लिनक्स ऑटो-पेस्ट, अतिरिक्त STT इंजन, स्ट्रीमिंग ट्रांसक्रिप्शन, एंड-टू-एंड स्पीच LLMs और प्लगइन आर्किटेक्चर पर भविष्य के काम का उल्लेख है।