इस प्रोजेक्ट के बारे में
Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन (ITN) लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए डिज़ाइन की गई है। यह बोले गए ASR (ऑटोमैटिक स्पीच रिकग्निशन) आउटपुट को संरचित मानों जैसे फ़ोन नंबर, ईमेल पते, पहचानकर्ता, तिथियाँ, समय, धन, माप और अल्फ़ान्यूमेरिक कोड के लिए विहित लिखित रूपों में परिवर्तित करती है।
Premove ITN जिस मुख्य चुनौती का समाधान करता है वह बोली जाने वाली भाषा की अस्पष्टता है। उदाहरण के लिए, 'one oh five' का अर्थ पहचानकर्ता 105, समय 1:05, या कुछ और पूरी तरह से भिन्न हो सकता है। पारंपरिक नियम-आधारित प्रणालियाँ हमेशा यह निर्धारित नहीं कर सकतीं कि वक्ता का क्या अर्थ था। Premove ITN सही लिखित रूप का चयन करने के लिए संदर्भ-जागरूक स्कोरिंग का उपयोग करके इसे हल करता है।
आर्किटेक्चर तीन-चरणीय पाइपलाइन का पालन करता है: जनरेट, स्कोर और डीकोड। पहले, रस्ट-आधारित रियलाइज़ेशन परत बोले गए पाठ के स्पैन के लिए सभी मान्य लिखित रूपों की गणना करती है। दूसरे, एक DeBERTa-v3-large प्रासंगिक स्कोरर (435.6M पैरामीटर) ट्रांसक्रिप्ट को एक बार एनकोड करता है और संदर्भित स्रोत स्पैन, उम्मीदवार प्रकार लेबल और प्रस्तावित प्रतिस्थापन के आधार पर प्रत्येक उम्मीदवार को स्कोर करता है। तीसरे, एक सटीक डायनामिक प्रोग्रामिंग डिकोडर ट्रांसक्रिप्ट के माध्यम से उच्चतम-स्कोरिंग संगत पथ ढूंढता है, ओवरलैपिंग उम्मीदवारों को संभालता है।
समर्थित रूपों में संख्याएँ, अंक अनुक्रम, समय, तिथियाँ, धन, दशमलव, माप, क्रमसूचक, फ़ोन नंबर, ईमेल और URL, संस्करण और पहचानकर्ता, विराम चिह्न और संक्षिप्ताक्षर शामिल हैं। यह उपकरण केवल अंग्रेज़ी है और गैर-अंग्रेज़ी भाषण, सड़क पते, मुक्त-रूप पुनर्लेखन, या मनमाने अनुप्रयोग-विशिष्ट प्रारूपों के लिए प्रथम श्रेणी का सामान्यीकरण प्रदान नहीं करता है।
1,500 पंक्तियों के एक स्थिर बेंचमार्क पर, जिसमें 400-पंक्ति का समर्पित वॉइस-एजेंट उपसमुच्चय शामिल है, Premove ITN वॉइस-एजेंट उपसमुच्चय पर 99.50% शब्दार्थ सटीकता प्राप्त करता है, जबकि text-processing-rs के लिए 68.25% और NVIDIA Thutmose के लिए 67.00% है। बेंचमार्क एक सिंथेटिक तनाव सूट है जिसे प्रशिक्षण और चेकपॉइंट चयन से बाहर रखा गया है।
उपकरण PyPI पर एक Python पैकेज (premove-itn) के रूप में वितरित किया जाता है, जिसमें मॉडल वेट Hugging Face (premove-ai/premove-itn) पर होस्ट किए जाते हैं। वर्तमान रिलीज़ v0.2.0 है। मॉडल लोडिंग महंगी है (मल्टी-सेकंड इनिशियलाइज़ेशन, ~1.6 GB पहला डाउनलोड), लेकिन वार्म नॉर्मलाइज़ेशन कॉल तेज़ हैं (Apple M4 MacBook Air पर औसत वार्म लेटेंसी 56.49 ms)।
सीमाओं में केवल अंग्रेज़ी समर्थन, नियतात्मक रस्ट रियलाइज़र द्वारा बाधित सामान्यीकरण, 512 DeBERTa टोकन से अधिक लंबे इनपुट की अस्वीकृति, और CUDA, Windows, macOS Intel, Linux ARM64, और अन्य एक्सेलेरेटर के लिए अमान्य समर्थन शामिल हैं।
स्रोत कोड और मॉडल वेट MIT लाइसेंस प्राप्त हैं। प्रासंगिक स्कोरर अपने एनकोडर बैकबोन के रूप में microsoft/deberta-v3-large का उपयोग करता है, और रस्ट रियलाइज़ेशन परत text-processing-rs (Apache-2.0 लाइसेंस प्राप्त) का उपयोग करती है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.