इस प्रोजेक्ट के बारे में

Pocket TTS Kyutai Labs द्वारा विकसित एक ओपन-सोर्स टेक्स्ट-टू-स्पीच (TTS) एप्लिकेशन है, जिसे GPU या वेब APIs की आवश्यकता के बिना CPUs पर कुशलतापूर्वक चलाने के लिए डिज़ाइन किया गया है। मॉडल में लगभग 100 मिलियन पैरामीटर हैं और यह कम-विलंबता ऑडियो निर्माण के लिए अनुकूलित है, जो MacBook Air M4 पर केवल 2 CPU कोर का उपयोग करके पहले ऑडियो चंक तक लगभग 200ms और लगभग 6x रीयल-टाइम गति प्राप्त करता है। परियोजना Python 3.10 से 3.14 का समर्थन करती है और PyTorch 2.5 या बाद के संस्करण की आवश्यकता होती है (CPU-केवल बिल्ड समर्थित हैं)। यह एक Python लाइब्रेरी API और एक कमांड-लाइन इंटरफ़ेस (CLI) दोनों प्रदान करता है, जिसमें ऑडियो उत्पन्न करने (`generate`), स्थानीय HTTP सर्वर चलाने (`serve`), और safetensors फ़ाइलों में वॉयस एम्बेडिंग निर्यात करने (`export-voice`) के कमांड शामिल हैं। मुख्य विशेषताओं में शामिल हैं: - ऑडियो नमूनों (wav या mp3 फ़ाइलें) से वॉयस क्लोनिंग - अंग्रेजी, फ्रेंच, जर्मन, पुर्तगाली, इतालवी और स्पेनिश के लिए बहु-भाषा समर्थन - असीमित लंबे टेक्स्ट इनपुट के समर्थन के साथ ऑडियो स्ट्रीमिंग - Hugging Face पर विभिन्न आवाज़ों के साथ पूर्व-निर्मित वॉयस कैटलॉग - चेक, हिंदी, कोरियाई, फारसी, इंडोनेशियाई और एस्टोनियाई सहित अतिरिक्त भाषाओं के लिए समुदाय-प्रशिक्षित मॉडल - उपयोगकर्ताओं को अपने स्वयं के मॉडल प्रशिक्षित करने के लिए प्रशिक्षण कोड जारी किया गया परियोजना में कई समुदाय कार्यान्वयन और एकीकरण भी हैं, जिनमें WebAssembly/ब्राउज़र संस्करण, Rust पोर्ट, C++ कार्यान्वयन, Apple Silicon के लिए MLX बैकएंड, और Home Assistant, Discord, Unity, और ComfyUI जैसे प्लेटफार्मों के साथ एकीकरण शामिल हैं। README नोट करता है कि GPU समर्थन आधिकारिक रूप से समर्थित नहीं है, लेकिन मॉडल को CUDA में मैन्युअल रूप से स्थानांतरित करके प्राप्त किया जा सकता है, जिसमें कुछ हार्डवेयर कॉन्फ़िगरेशन पर मापी गई गति शामिल है।