इस प्रोजेक्ट के बारे में

ESPnet PyTorch पर निर्मित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है। यह कई प्रकार के कार्यों को शामिल करता है, जिनमें स्वचालित वाक् पहचान (ASR), टेक्स्ट-टू-स्पीच (TTS), स्पीच अनुवाद (ST), स्पीच एन्हांसमेंट और पृथक्करण (SE/SS), स्पीकर डायराइज़ेशन, बोली जाने वाली भाषा समझ (SLU), गायन आवाज़ संश्लेषण (SVS), स्पीच भाषा मॉडल (SpeechLM), न्यूरल ऑडियो कोडेक्स, और अधिक शामिल हैं। टूलकिट काल्डी-शैली की प्रतिलिपि योग्य रेसिपी प्रदान करता है जो डेटा तैयारी से लेकर मूल्यांकन तक सब कुछ संभालती हैं, और हगिंग फेस पर सैकड़ों प्रीट्रेन्ड मॉडल प्रदान करता है। मुख्य विशेषताओं में शामिल हैं: - **ASR**: हाइब्रिड CTC/अटेंशन, ट्रांसड्यूसर, स्ट्रीमिंग, Conformer/E-Branchformer, Whisper, SSL फ्रंट-एंड्स, और ट्रांसफर लर्निंग। - **TTS**: Tacotron2, FastSpeech2, VITS, JETS, मल्टी-स्पीकर/मल्टीलिंगुअल समर्थन, और न्यूरल वोकोडर के साथ एकीकरण। - **ST/MT**: एंड-टू-एंड और कैस्केड स्पीच अनुवाद, मशीन अनुवाद, और स्पीच-टू-स्पीच अनुवाद। - **SE/SS**: एकीकृत एनकोडर-सेपरेटर-डिकोडर, TasNet/DPRNN, बीमफ़ॉर्मर, और ASR-एकीकृत एन्हांसमेंट। - **SLU**: इंटेंट और ट्रांसक्रिप्ट मल्टीटास्किंग, प्रीट्रेन्ड ASR/NLP एनकोडर। - **स्पीकर और भाषा**: स्पीकर एम्बेडिंग, सत्यापन, भाषा ID, डायराइज़ेशन। - **SSL**: HuBERT प्रीट्रेनिंग और S3PRL अपस्ट्रीम्स। - **SpeechLM**: स्पीच और टेक्स्ट कार्यों में एकीकृत अनुक्रम मॉडलिंग। - **कोडेक**: असतत स्पीच टोकन के लिए न्यूरल ऑडियो कोडेक्स। ESPnet प्रति कॉर्पस एकल `run.sh`, एकीकृत रेसिपी संरचना और कॉन्फ़िग प्रारूप के साथ प्रतिलिपि योग्यता पर जोर देता है, और DDP, मल्टी-नोड ट्रेनिंग, Slurm/MPI, DeepSpeed, और शार्डेड ट्रेनिंग के माध्यम से स्केलेबिलिटी प्रदान करता है। यह रीयल-टाइम डेमो, Colab नोटबुक, और Hugging Face Spaces और Weights & Biases के साथ एकीकरण भी प्रदान करता है।