Douvo एक हल्का macOS वॉयस इनपुट ऐप है जो Apple Silicon के लिए है और Doubao ASR का उपयोग करता है, साथ ही टेक्स्ट सफाई, अनुवाद और चयनित-टेक्स्ट संपादन के लिए वैकल्पिक स्थानीय या रिमोट AI पोस्ट-प्रोसेसिंग प्रदान करता है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONBatchalign3 एक TalkBank ऑडियो और ML पाइपलाइन है जो CHAT ट्रांसक्रिप्ट्स को बनाने और समृद्ध करने के लिए ASR, फोर्स्ड अलाइनमेंट, न्यूरल मॉर्फोटैगिंग, अनुवाद और उत्तरार्ध खंडीकरण को कवर करती है।
YouTube Transcript API एक Python लाइब्रेरी है जो YouTube वीडियो से ट्रांसक्रिप्ट और सबटाइटल फ़ेच करती है। यह हेडलेस ब्राउज़र की आवश्यकता के बिना एकाधिक भाषाओं, अनुवाद और आउटपुट फ़ॉर्मेटिंग का समर्थन करती है।
Mimora है एक मुफ्त, पूरी तरह से स्थानीय उच्चारण ट्रेनर अंग्रेजी और स्पैनिश के लिए। यह डिवाइस पर TTS, भाषण पहचान, और एक स्थानीय LLM का उपयोग करके वाक्यांश बनाता है और शब्द-स्तर की प्रतिक्रिया के साथ उपयोगकर्ता के प्रयासों को स्कोर करता है, जिसके लिए कोई क्लाउड या API कुंजी की आवश्यकता नहीं है।
Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।
SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।
NVIDIA NeMo Speech एक Apache-2.0 PyTorch फ्रेमवर्क है जो स्पीच AI मॉडल बनाने, अनुकूलित करने और तैनात करने हेतु है, जिसमें ASR, TTS और स्पीच LLMs शामिल हैं, साथ ही पूर्व-प्रशिक्षित चेकपॉइंट्स और Docker/uv इंस्टॉल पथ उपलब्ध हैं।