OPEN SOURCE, OPEN TO EVERYONE

ओपन सोर्स। नई संभावनाएँ।

उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।

संपादकीय चयन · अच्छा ओपन सोर्स खोजें4109खोजे गए

जिज्ञासा के साथ ओपन सोर्स खोजें।

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
नया

Batchalign3 एक TalkBank ऑडियो और ML पाइपलाइन है जो CHAT ट्रांसक्रिप्ट्स को बनाने और समृद्ध करने के लिए ASR, फोर्स्ड अलाइनमेंट, न्यूरल मॉर्फोटैगिंग, अनुवाद और उत्तरार्ध खंडीकरण को कवर करती है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
नया

SpeechRecognition एक Python लाइब्रेरी है जो कई इंजनों और APIs का समर्थन करती है, ऑनलाइन और ऑफलाइन दोनों, जिनमें CMU Sphinx, Google, Azure, IBM, Vosk, Whisper, और OpenAI शामिल हैं।

कृत्रिम बुद्धिमत्ताडेवलपर टूलMultimodal AI
mimoravikonix
नया

Mimora है एक मुफ्त, पूरी तरह से स्थानीय उच्चारण ट्रेनर अंग्रेजी और स्पैनिश के लिए। यह डिवाइस पर TTS, भाषण पहचान, और एक स्थानीय LLM का उपयोग करके वाक्यांश बनाता है और शब्द-स्तर की प्रतिक्रिया के साथ उपयोगकर्ता के प्रयासों को स्कोर करता है, जिसके लिए कोई क्लाउड या API कुंजी की आवश्यकता नहीं है।

कृत्रिम बुद्धिमत्ताउत्पादकताAI assistants
whisper.cppggml-org
नया

OpenAI के Whisper ऑटोमैटिक स्पीच रिकग्निशन (ASR) मॉडल के लिए एक उच्च-प्रदर्शन C/C++ कार्यान्वयन, जिसे हल्के और क्रॉस-प्लेटफॉर्म परिनियोजन के लिए डिज़ाइन किया गया है।

कृत्रिम बुद्धिमत्ताModel runtime
premove-itnpremove-ai
नया

Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
नया

CTranslate2 का उपयोग करके OpenAI के Whisper मॉडल का एक तेज़ पुन: कार्यान्वयन, जो बेहतर ट्रांसक्रिप्शन गति और कम मेमोरी उपयोग प्रदान करता है।

कृत्रिम बुद्धिमत्ताModel runtime
transformershuggingface
नया

Hugging Face Transformers टेक्स्ट, विजन, ऑडियो और मल्टीमॉडल कार्यों के लिए एक मशीन लर्निंग मॉडल-डेफिनिशन फ्रेमवर्क है। यह 1 मिलियन से अधिक प्री-ट्रेंड चेकपॉइंट्स के साथ इन्फरेंस और ट्रेनिंग के लिए एक एकीकृत API प्रदान करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलTraining & evaluation
sensevoiceQwenAudio
नया

SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
espnetespnet
नया

ESPnet PyTorch पर आधारित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है, जो ASR, TTS, स्पीच अनुवाद, एन्हांसमेंट, डायराइज़ेशन आदि कार्यों को कवर करता है, साथ ही प्रतिलिपि योग्य रेसिपी और प्रीट्रेन्ड मॉडल प्रदान करता है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime
whisperlivekitQuentinFuxa
नया

WhisperLiveKit एक स्व-होस्टेड, अल्ट्रा-लो-लेटेंसी स्पीच-टू-टेक्स्ट पाइपलाइन है जो वास्तविक समय में टेक्स्ट-से-भाषा रूपांतरण, वक्ता पहचान और 200 भाषाओं में अनुवाद प्रदान करती है।

कृत्रिम बुद्धिमत्ताडेवलपर टूलModel runtime