इस प्रोजेक्ट के बारे में
Dia, Nari Labs द्वारा निर्मित एक 1.6B पैरामीटर टेक्स्ट-टू-स्पीच मॉडल है। यह ट्रांसक्रिप्ट से सीधे अत्यधिक यथार्थवादी संवाद उत्पन्न करता है, [S1] और [S2] टैग के माध्यम से कई वक्ताओं का समर्थन करता है। यह मॉडल हँसी, खाँसी, आह भरना और गला साफ करने जैसी गैर-मौखिक अभिव्यक्तियाँ उत्पन्न कर सकता है। उपयोगकर्ता भावना, स्वर नियंत्रण और वॉयस क्लोनिंग के लिए ऑडियो प्रॉम्प्ट पर आउटपुट को कंडीशन कर सकते हैं। यह परियोजना Hugging Face पर प्रीट्रेंड मॉडल चेकपॉइंट, इन्फरेंस कोड, एक Gradio UI, CLI और Transformers एकीकरण प्रदान करती है। वर्तमान में, यह मॉडल केवल अंग्रेजी जनरेशन का समर्थन करता है। RTX 4090 पर बेंचमार्क परिणाम प्रिसिजन और कंपाइलेशन के आधार पर x0.9 से x2.2 तक के रीयलटाइम फैक्टर दिखाते हैं, जिसमें VRAM उपयोग 4.4GB से 7.9GB के बीच होता है। यह परियोजना Apache 2.0 के तहत लाइसेंस प्राप्त है और अनुसंधान तथा शैक्षिक उपयोग के लिए अभिप्रेत है, जिसमें पहचान के दुरुपयोग, भ्रामक सामग्री और अवैध गतिविधियों के विरुद्ध प्रतिबंध शामिल हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.