इस प्रोजेक्ट के बारे में
NVIDIA NeMo Speech एक ओपन-सोर्स फ्रेमवर्क है जो शोधकर्ताओं और PyTorch डेवलपर्स के लिए है जो स्पीच मॉडल पर काम करते हैं। इसके README के अनुसार, यह स्वचालित वाक् पहचान (ASR), टेक्स्ट-टू-स्पीच (TTS) और स्पीच LLMs को लक्षित करता है, और उपयोगकर्ताओं को मौजूदा कोड और पूर्व-प्रशिक्षित चेकपॉइंट्स का पुन: उपयोग करके नए मॉडल बनाने, अनुकूलित करने और तैनात करने में मदद करने के लिए है।
दायरा और स्थिति
- रिपॉजिटरी बताती है कि यह ऑडियो, स्पीच और मल्टीमॉडल LLMs पर ध्यान केंद्रित करने के लिए स्थानांतरित हो गया है; अतिरिक्त मोडैलिटी को कवर करने वाला अंतिम प्री-स्प्लिट NeMo रिलीज़ v2.7.3 है।
- वर्तमान लाइन NeMo Speech 3.0 है, जिसे रिलीज़ v3.0.0 के रूप में प्रकाशित किया गया है और NGC कंटेनर में भेजा गया है।
- मॉडल चेकपॉइंट्स और डेमो README से संदर्भित HuggingFace संग्रह में एकत्र किए गए हैं।
दस्तावेज़ीकरण और रिलीज़
- डेवलपर दस्तावेज़ नवीनतम रिलीज़ (3.0.0) और नाइटली मुख्य शाखा के लिए होस्ट किए गए हैं।
- README में दिनांकित अपडेट सूचीबद्ध हैं जो मॉडल रिलीज़ का वर्णन करते हैं, जैसे बहुभाषी TTS चेकपॉइंट्स, स्ट्रीमिंग ASR मॉडल, एकीकृत ऑफ़लाइन/स्ट्रीमिंग ASR, और यूरोपीय भाषाओं के लिए वाक् पहचान/अनुवाद मॉडल। ये रिलीज़ नोट्स हैं; यहाँ कोई स्वतंत्र बेंचमार्क सत्यापन प्रदान नहीं किया गया है।
आवश्यकताएँ
- Python 3.12 या उससे ऊपर, PyTorch 2.7 या उससे ऊपर (CPU या CUDA), और प्रशिक्षण के लिए CUDA के साथ एक NVIDIA GPU (अनुमान के लिए अनुशंसित)।
- परियोजना कहती है कि यह मौजूदा Python/PyTorch/CUDA स्टैक के ऊपर स्थापित होता है, उसे प्रतिस्थापित किए बिना; uv.lock और आधिकारिक कंटेनर में पिन किए गए संस्करण (Python 3.13, CUDA 12.9 के साथ PyTorch 2.11 या CUDA 13.2 के साथ PyTorch 2.12) को कठोर आवश्यकताओं के बजाय सक्रिय रूप से परीक्षण किए गए संयोजनों के रूप में वर्णित किया गया है।
- एक नोट चेतावनी देता है कि PyTorch 2.6 के बाद से torch.load डिफ़ॉल्ट रूप से weights_only=True का उपयोग करता है, और कुछ चेकपॉइंट्स को TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1 की आवश्यकता हो सकती है, जिसका उपयोग केवल विश्वसनीय फ़ाइलों के साथ किया जाना चाहिए क्योंकि अविश्वसनीय फ़ाइलों को लोड करने से मनमाना कोड निष्पादन का जोखिम हो सकता है।
स्थापना विकल्प
- अनुशंसित: uv के साथ स्रोत से स्थापित करें, all और cu13 (या cu12) जैसे एक्स्ट्रा को सिंक करें, जो परीक्षण किए गए स्टैक को .venv में पुन: उत्पन्न करता है; वैकल्पिक समूह परीक्षण या दस्तावेज़ जोड़ते हैं।
- Docker: पहले से निर्मित NGC कंटेनर खींचें या दिए गए Dockerfile से निर्माण करें, H100+ या A100 के लिए GPU_TARGET विकल्पों के साथ।
- pip फ़ॉलबैक: पहले PyTorch स्थापित करें, फिर asr और tts एक्स्ट्रा के साथ nemo-toolkit स्थापित करें; README नोट करता है कि uv sync --locked का उपयोग ब्रिंग-योर-ओन स्टैक के लिए नहीं किया जाना चाहिए क्योंकि यह लॉकफ़ाइल लागू करता है और मौजूदा Python/PyTorch/CUDA को प्रतिस्थापित करता है।
- वैकल्पिक त्वरित बैकएंड (Transformer Engine, FlashAttention, Mamba, grouped-GEMM/MoE, DeepEP) को संकलित एक्स्ट्रा से स्रोत-निर्मित कर्नेल के रूप में वर्णित किया गया है, Automodel बैकएंड संकलित निर्भरताओं के बिना चलने में सक्षम है।
लाइसेंसिंग और योगदान
- Apache License 2.0 के तहत लाइसेंस प्राप्त।
- CONTRIBUTING.md प्रक्रिया के माध्यम से सामुदायिक योगदान का स्वागत है।
यह अवलोकन केवल रिपॉजिटरी README में बताई गई बातों को दर्शाता है; यह रिलीज़ नोट्स में की गई सटीकता, प्रदर्शन या रैंकिंग के दावों को सत्यापित नहीं करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.