Batchalign3 एक TalkBank ऑडियो और ML पाइपलाइन है जो CHAT ट्रांसक्रिप्ट्स को बनाने और समृद्ध करने के लिए ASR, फोर्स्ड अलाइनमेंट, न्यूरल मॉर्फोटैगिंग, अनुवाद और उत्तरार्ध खंडीकरण को कवर करती है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONSpeechRecognition एक Python लाइब्रेरी है जो कई इंजनों और APIs का समर्थन करती है, ऑनलाइन और ऑफलाइन दोनों, जिनमें CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, और OpenAI शामिल हैं।
Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।
Hugging Face Transformers टेक्स्ट, विजन, ऑडियो और मल्टीमॉडल कार्यों के लिए एक मशीन लर्निंग मॉडल-डेफिनिशन फ्रेमवर्क है। यह 1 मिलियन से अधिक प्री-ट्रेंड चेकपॉइंट्स के साथ इन्फरेंस और ट्रेनिंग के लिए एक एकीकृत API प्रदान करता है।
SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।
ESPnet PyTorch पर आधारित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है, जो ASR, TTS, स्पीच अनुवाद, एन्हांसमेंट, डायराइज़ेशन आदि कार्यों को कवर करता है, साथ ही प्रतिलिपि योग्य रेसिपी और प्रीट्रेन्ड मॉडल प्रदान करता है।
WhisperLiveKit एक स्व-होस्टेड, अल्ट्रा-लो-लेटेंसी स्पीच-टू-टेक्स्ट पाइपलाइन है जो वास्तविक समय में टेक्स्ट-से-भाषा रूपांतरण, वक्ता पहचान और 200 भाषाओं में अनुवाद प्रदान करती है।