इस प्रोजेक्ट के बारे में
चैटटीटीएस एक जनरेटिव टेक्स्ट-टू-स्पीच मॉडल है जो एलएलएम सहायक जैसे बातचीत-आधारित कार्यों के लिए विशेष रूप से डिज़ाइन किया गया है। रिपॉजिटरी में एल्गोरिथ्म इंफ्रास्ट्रक्चर, प्रीट्रेन्ड मॉडल वेट्स और सरल उदाहरण शामिल हैं जो इंफेरेंस चलाने के लिए हैं।
समर्थित भाषाएं अंग्रेजी और चीनी हैं, अतिरिक्त भाषाएं जल्द ही उपलब्ध होने वाली हैं। मॉडल को चीनी और अंग्रेजी ऑडियो डेटा पर प्रशिक्षित किया गया है, और हगिंगफेस पर ओपन-सोर्स रिलीज को 40,000 घंटे के प्रीट्रेन्ड मॉडल के रूप में वर्णित किया गया है जिसमें SFT नहीं है।
रीडमी में वर्णित मुख्य क्षमताएं:
- बातचीत-आधारित कार्यों के लिए अनुकूलित टीटीएस, बहु-बोलने वाले समर्थन के साथ।
- हंसी, रुकावट और अंतर्निहित विशेषताओं पर प्रोसोडिक विशेषताओं पर बहुत बारीक नियंत्रण।
- टोकन-स्तर के नियंत्रण इकाइयां जैसे [laugh], [uv_break] और [lbreak], साथ ही वाक्य-स्तर के नियंत्रण के लिए प्रॉम्प्ट जैसे [oral_2][laugh_0][break_6]।
- गॉसियन वितरण से बोलने वाले नमूना, जिसके नमूना बोलने वाले एम्बेडिंग को बाद में टोन बहाल करने के लिए सहेजा गया है।
- निर्धारित डिकोडिंग पैरामीटर जैसे तापमान, top_P और top_K।
- स्ट्रीमिंग ऑडियो उत्पादन।
शुरू करने के विकल्प शामिल हैं: रिपॉजिटरी क्लोन करें और pip या conda के माध्यम से मांग के अनुसार स्थापित करें, PyPI या GitHub से पैकेज स्थापित करें, और एक वेबयूआई उदाहरण या एक कमांड-लाइन इंफेरेंस स्क्रिप्ट चलाएं। एक बुनियादी पायथन उपयोग उदाहरण मॉडल लोड करता है, एक सूची के टेक्स्ट पर इंफेरेंस चलाता है, और 24 केएचजेड पर आउटपुट वाव फाइलें सहेजता है। उन्नत उदाहरण बोलने वाले नमूना, वाक्य-स्तर और शब्द-स्तर नियंत्रण, और एक स्व-परिचय उदाहरण को कवर करते हैं।
रीडमी नोट करता है कि हार्डवेयर की उम्मीदें: 30 सेकंड के ऑडियो क्लिप के लिए कम से कम 4 जीबी जीपीयू मेमोरी, और 4090 जीपीयू पर एक आरटीएफ लगभग 0.3 है। यह भी नोट करता है कि अनुक्रमिक मॉडल बहु-बोलने वाले आउटपुट या खराब ऑडियो गुणवत्ता जैसी अस्थिरता दिखा सकते हैं, और बार-बार नमूना प्रयास करने की सलाह देते हैं।
लाइसेंसिंग: कोड को AGPLv3+ के तहत प्रकाशित किया गया है, जबकि मॉडल को शैक्षणिक और अनुसंधान उद्देश्यों के लिए CC BY-NC 4.0 के तहत प्रकाशित किया गया है, वाणिज्यिक या अवैध उद्देश्यों के लिए नहीं। रीडमी बताता है कि 40,000 घंटे के मॉडल के प्रशिक्षण के दौरान एक छोटी मात्रा में उच्च आवृत्ति शोर जोड़ा गया था और ऑडियो गुणवत्ता को MP3 फॉर्मेट का उपयोग करके संकुचित किया गया था ताकि संभावित दुरुपयोग को सीमित किया जा सके, और एक आंतरिक रूप से प्रशिक्षित निरीक्षण मॉडल के ओपन-सोर्स रिलीज की योजना है।
परियोजना ने पूर्व कार्य जैसे bark, XTTSv2, valle, fish-speech और vocos के सम्मान किया है, और विस्तारित अंत-उपयोगकर्ता उत्पादों के लिए समुदाय-द्वारा बनाए रखे गए एक सूचकांक रिपॉजिटरी, एवोमेट-चैटटीटीएस, के लिए संकेत दिया है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.