OPEN SOURCE, OPEN TO EVERYONE

ओपन सोर्स। नई संभावनाएँ।

उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।

संपादकीय चयन · अच्छा ओपन सोर्स खोजें4101खोजे गए

जिज्ञासा के साथ ओपन सोर्स खोजें।

THE FIRST COLLECTION
Topic: asr清除
douvorhinoc
नया

Douvo एक हल्का macOS वॉयस इनपुट ऐप है जो Apple Silicon के लिए है और Doubao ASR का उपयोग करता है, साथ ही टेक्स्ट सफाई, अनुवाद और चयनित-टेक्स्ट संपादन के लिए वैकल्पिक स्थानीय या रिमोट AI पोस्ट-प्रोसेसिंग प्रदान करता है।

उत्पादकताकृत्रिम बुद्धिमत्ताUtilities
talkbank-toolsFranklinChen
नया

Batchalign3 एक TalkBank ऑडियो और ML पाइपलाइन है जो CHAT ट्रांसक्रिप्ट्स को बनाने और समृद्ध करने के लिए ASR, फोर्स्ड अलाइनमेंट, न्यूरल मॉर्फोटैगिंग, अनुवाद और उत्तरार्ध खंडीकरण को कवर करती है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
नया

YouTube Transcript API एक Python लाइब्रेरी है जो YouTube वीडियो से ट्रांसक्रिप्ट और सबटाइटल फ़ेच करती है। यह हेडलेस ब्राउज़र की आवश्यकता के बिना एकाधिक भाषाओं, अनुवाद और आउटपुट फ़ॉर्मेटिंग का समर्थन करती है।

डेवलपर टूलBackend & APIs
mimoravikonix
नया

Mimora है एक मुफ्त, पूरी तरह से स्थानीय उच्चारण ट्रेनर अंग्रेजी और स्पैनिश के लिए। यह डिवाइस पर TTS, भाषण पहचान, और एक स्थानीय LLM का उपयोग करके वाक्यांश बनाता है और शब्द-स्तर की प्रतिक्रिया के साथ उपयोगकर्ता के प्रयासों को स्कोर करता है, जिसके लिए कोई क्लाउड या API कुंजी की आवश्यकता नहीं है।

कृत्रिम बुद्धिमत्ताउत्पादकताAI assistants
premove-itnpremove-ai
नया

Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
sensevoiceQwenAudio
नया

SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
speechNVIDIA-NeMo
नया

NVIDIA NeMo Speech एक Apache-2.0 PyTorch फ्रेमवर्क है जो स्पीच AI मॉडल बनाने, अनुकूलित करने और तैनात करने हेतु है, जिसमें ASR, TTS और स्पीच LLMs शामिल हैं, साथ ही पूर्व-प्रशिक्षित चेकपॉइंट्स और Docker/uv इंस्टॉल पथ उपलब्ध हैं।

कृत्रिम बुद्धिमत्तासंगीतModel runtime