इस प्रोजेक्ट के बारे में
ESPnet PyTorch पर निर्मित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है। यह कई प्रकार के कार्यों को शामिल करता है, जिनमें स्वचालित वाक् पहचान (ASR), टेक्स्ट-टू-स्पीच (TTS), स्पीच अनुवाद (ST), स्पीच एन्हांसमेंट और पृथक्करण (SE/SS), स्पीकर डायराइज़ेशन, बोली जाने वाली भाषा समझ (SLU), गायन आवाज़ संश्लेषण (SVS), स्पीच भाषा मॉडल (SpeechLM), न्यूरल ऑडियो कोडेक्स, और अधिक शामिल हैं। टूलकिट काल्डी-शैली की प्रतिलिपि योग्य रेसिपी प्रदान करता है जो डेटा तैयारी से लेकर मूल्यांकन तक सब कुछ संभालती हैं, और हगिंग फेस पर सैकड़ों प्रीट्रेन्ड मॉडल प्रदान करता है।
मुख्य विशेषताओं में शामिल हैं:
- **ASR**: हाइब्रिड CTC/अटेंशन, ट्रांसड्यूसर, स्ट्रीमिंग, Conformer/E-Branchformer, Whisper, SSL फ्रंट-एंड्स, और ट्रांसफर लर्निंग।
- **TTS**: Tacotron2, FastSpeech2, VITS, JETS, मल्टी-स्पीकर/मल्टीलिंगुअल समर्थन, और न्यूरल वोकोडर के साथ एकीकरण।
- **ST/MT**: एंड-टू-एंड और कैस्केड स्पीच अनुवाद, मशीन अनुवाद, और स्पीच-टू-स्पीच अनुवाद।
- **SE/SS**: एकीकृत एनकोडर-सेपरेटर-डिकोडर, TasNet/DPRNN, बीमफ़ॉर्मर, और ASR-एकीकृत एन्हांसमेंट।
- **SLU**: इंटेंट और ट्रांसक्रिप्ट मल्टीटास्किंग, प्रीट्रेन्ड ASR/NLP एनकोडर।
- **स्पीकर और भाषा**: स्पीकर एम्बेडिंग, सत्यापन, भाषा ID, डायराइज़ेशन।
- **SSL**: HuBERT प्रीट्रेनिंग और S3PRL अपस्ट्रीम्स।
- **SpeechLM**: स्पीच और टेक्स्ट कार्यों में एकीकृत अनुक्रम मॉडलिंग।
- **कोडेक**: असतत स्पीच टोकन के लिए न्यूरल ऑडियो कोडेक्स।
ESPnet प्रति कॉर्पस एकल `run.sh`, एकीकृत रेसिपी संरचना और कॉन्फ़िग प्रारूप के साथ प्रतिलिपि योग्यता पर जोर देता है, और DDP, मल्टी-नोड ट्रेनिंग, Slurm/MPI, DeepSpeed, और शार्डेड ट्रेनिंग के माध्यम से स्केलेबिलिटी प्रदान करता है। यह रीयल-टाइम डेमो, Colab नोटबुक, और Hugging Face Spaces और Weights & Biases के साथ एकीकरण भी प्रदान करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.