इस प्रोजेक्ट के बारे में

चैटटीटीएस एक जनरेटिव टेक्स्ट-टू-स्पीच मॉडल है जो एलएलएम सहायक जैसे बातचीत-आधारित कार्यों के लिए विशेष रूप से डिज़ाइन किया गया है। रिपॉजिटरी में एल्गोरिथ्म इंफ्रास्ट्रक्चर, प्रीट्रेन्ड मॉडल वेट्स और सरल उदाहरण शामिल हैं जो इंफेरेंस चलाने के लिए हैं। समर्थित भाषाएं अंग्रेजी और चीनी हैं, अतिरिक्त भाषाएं जल्द ही उपलब्ध होने वाली हैं। मॉडल को चीनी और अंग्रेजी ऑडियो डेटा पर प्रशिक्षित किया गया है, और हगिंगफेस पर ओपन-सोर्स रिलीज को 40,000 घंटे के प्रीट्रेन्ड मॉडल के रूप में वर्णित किया गया है जिसमें SFT नहीं है। रीडमी में वर्णित मुख्य क्षमताएं: - बातचीत-आधारित कार्यों के लिए अनुकूलित टीटीएस, बहु-बोलने वाले समर्थन के साथ। - हंसी, रुकावट और अंतर्निहित विशेषताओं पर प्रोसोडिक विशेषताओं पर बहुत बारीक नियंत्रण। - टोकन-स्तर के नियंत्रण इकाइयां जैसे [laugh], [uv_break] और [lbreak], साथ ही वाक्य-स्तर के नियंत्रण के लिए प्रॉम्प्ट जैसे [oral_2][laugh_0][break_6]। - गॉसियन वितरण से बोलने वाले नमूना, जिसके नमूना बोलने वाले एम्बेडिंग को बाद में टोन बहाल करने के लिए सहेजा गया है। - निर्धारित डिकोडिंग पैरामीटर जैसे तापमान, top_P और top_K। - स्ट्रीमिंग ऑडियो उत्पादन। शुरू करने के विकल्प शामिल हैं: रिपॉजिटरी क्लोन करें और pip या conda के माध्यम से मांग के अनुसार स्थापित करें, PyPI या GitHub से पैकेज स्थापित करें, और एक वेबयूआई उदाहरण या एक कमांड-लाइन इंफेरेंस स्क्रिप्ट चलाएं। एक बुनियादी पायथन उपयोग उदाहरण मॉडल लोड करता है, एक सूची के टेक्स्ट पर इंफेरेंस चलाता है, और 24 केएचजेड पर आउटपुट वाव फाइलें सहेजता है। उन्नत उदाहरण बोलने वाले नमूना, वाक्य-स्तर और शब्द-स्तर नियंत्रण, और एक स्व-परिचय उदाहरण को कवर करते हैं। रीडमी नोट करता है कि हार्डवेयर की उम्मीदें: 30 सेकंड के ऑडियो क्लिप के लिए कम से कम 4 जीबी जीपीयू मेमोरी, और 4090 जीपीयू पर एक आरटीएफ लगभग 0.3 है। यह भी नोट करता है कि अनुक्रमिक मॉडल बहु-बोलने वाले आउटपुट या खराब ऑडियो गुणवत्ता जैसी अस्थिरता दिखा सकते हैं, और बार-बार नमूना प्रयास करने की सलाह देते हैं। लाइसेंसिंग: कोड को AGPLv3+ के तहत प्रकाशित किया गया है, जबकि मॉडल को शैक्षणिक और अनुसंधान उद्देश्यों के लिए CC BY-NC 4.0 के तहत प्रकाशित किया गया है, वाणिज्यिक या अवैध उद्देश्यों के लिए नहीं। रीडमी बताता है कि 40,000 घंटे के मॉडल के प्रशिक्षण के दौरान एक छोटी मात्रा में उच्च आवृत्ति शोर जोड़ा गया था और ऑडियो गुणवत्ता को MP3 फॉर्मेट का उपयोग करके संकुचित किया गया था ताकि संभावित दुरुपयोग को सीमित किया जा सके, और एक आंतरिक रूप से प्रशिक्षित निरीक्षण मॉडल के ओपन-सोर्स रिलीज की योजना है। परियोजना ने पूर्व कार्य जैसे bark, XTTSv2, valle, fish-speech और vocos के सम्मान किया है, और विस्तारित अंत-उपयोगकर्ता उत्पादों के लिए समुदाय-द्वारा बनाए रखे गए एक सूचकांक रिपॉजिटरी, एवोमेट-चैटटीटीएस, के लिए संकेत दिया है।