ESPnet PyTorch पर आधारित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है, जो ASR, TTS, स्पीच अनुवाद, एन्हांसमेंट, डायराइज़ेशन आदि कार्यों को कवर करता है, साथ ही प्रतिलिपि योग्य रेसिपी और प्रीट्रेन्ड मॉडल प्रदान करता है।
OPEN SOURCE, OPEN TO EVERYONE
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
✳संपादकीय चयन · अच्छा ओपन सोर्स खोजें4101खोजे गए
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONTopic: speech-translation清除
espnetespnet
नयाspeech-to-speechhuggingface
नयाSpeech To Speech एक मॉड्यूलर वॉइस-एजेंट पाइपलाइन है जो VAD → STT → LLM → TTS की चार चरणों में काम करती है और WebSocket/WebRTC पर ओपनएआई Realtime ईवेंट सेट लागू करती है।
speechNVIDIA-NeMo
नयाNVIDIA NeMo Speech एक Apache-2.0 PyTorch फ्रेमवर्क है जो स्पीच AI मॉडल बनाने, अनुकूलित करने और तैनात करने हेतु है, जिसमें ASR, TTS और स्पीच LLMs शामिल हैं, साथ ही पूर्व-प्रशिक्षित चेकपॉइंट्स और Docker/uv इंस्टॉल पथ उपलब्ध हैं।