Batchalign3 एक TalkBank ऑडियो और ML पाइपलाइन है जो CHAT ट्रांसक्रिप्ट्स को बनाने और समृद्ध करने के लिए ASR, फोर्स्ड अलाइनमेंट, न्यूरल मॉर्फोटैगिंग, अनुवाद और उत्तरार्ध खंडीकरण को कवर करती है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONSpeechRecognition एक Python लाइब्रेरी है जो कई इंजनों और APIs का समर्थन करती है, ऑनलाइन और ऑफलाइन दोनों, जिनमें CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, और OpenAI शामिल हैं।
Mimora है एक मुफ्त, पूरी तरह से स्थानीय उच्चारण ट्रेनर अंग्रेजी और स्पैनिश के लिए। यह डिवाइस पर TTS, भाषण पहचान, और एक स्थानीय LLM का उपयोग करके वाक्यांश बनाता है और शब्द-स्तर की प्रतिक्रिया के साथ उपयोगकर्ता के प्रयासों को स्कोर करता है, जिसके लिए कोई क्लाउड या API कुंजी की आवश्यकता नहीं है।
OpenAI के Whisper ऑटोमैटिक स्पीच रिकग्निशन (ASR) मॉडल के लिए एक उच्च-प्रदर्शन C/C++ कार्यान्वयन, जिसे हल्के और क्रॉस-प्लेटफॉर्म परिनियोजन के लिए डिज़ाइन किया गया है।
Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।
CTranslate2 का उपयोग करके OpenAI के Whisper मॉडल का एक तेज़ पुन: कार्यान्वयन, जो बेहतर ट्रांसक्रिप्शन गति और कम मेमोरी उपयोग प्रदान करता है।
Hugging Face Transformers टेक्स्ट, विजन, ऑडियो और मल्टीमॉडल कार्यों के लिए एक मशीन लर्निंग मॉडल-डेफिनिशन फ्रेमवर्क है। यह 1 मिलियन से अधिक प्री-ट्रेंड चेकपॉइंट्स के साथ इन्फरेंस और ट्रेनिंग के लिए एक एकीकृत API प्रदान करता है।
SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।
ESPnet PyTorch पर आधारित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है, जो ASR, TTS, स्पीच अनुवाद, एन्हांसमेंट, डायराइज़ेशन आदि कार्यों को कवर करता है, साथ ही प्रतिलिपि योग्य रेसिपी और प्रीट्रेन्ड मॉडल प्रदान करता है।
WhisperLiveKit एक स्व-होस्टेड, अल्ट्रा-लो-लेटेंसी स्पीच-टू-टेक्स्ट पाइपलाइन है जो वास्तविक समय में टेक्स्ट-से-भाषा रूपांतरण, वक्ता पहचान और 200 भाषाओं में अनुवाद प्रदान करती है।