ESPnet PyTorch पर आधारित एक एंड-टू-एंड स्पीच प्रोसेसिंग टूलकिट है, जो ASR, TTS, स्पीच अनुवाद, एन्हांसमेंट, डायराइज़ेशन आदि कार्यों को कवर करता है, साथ ही प्रतिलिपि योग्य रेसिपी और प्रीट्रेन्ड मॉडल प्रदान करता है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONWhisperLiveKit एक स्व-होस्टेड, अल्ट्रा-लो-लेटेंसी स्पीच-टू-टेक्स्ट पाइपलाइन है जो वास्तविक समय में टेक्स्ट-से-भाषा रूपांतरण, वक्ता पहचान और 200 भाषाओं में अनुवाद प्रदान करती है।
Stable Baselines3 (SB3) एक विश्वसनीय PyTorch कार्यान्वयन संग्रह है जो शोध और उद्योग प्रतिपादन के लिए रिइनफोर्समेंट लर्निंग एल्गोरिदम का डिज़ाइन किया गया है।
Made With ML एक ओपन-सोर्स कोर्स और कोडबेस है जो उत्पादन-स्तरीय मशीन लर्निंग एप्लिकेशन्स को डिजाइन, विकसित, डिप्लॉय और इटरेट करने का तरीका सिखाता है, जिसमें MLOps, टेस्टिंग, सर्विंग, CI/CD और कॉन्टिन्यूअल लर्निंग शामिल हैं।
कंप्यूटर विज़न के लिए एक व्यापक टूलकिट जो डेटा लोडिंग, विज़ुअलाइज़ेशन और डेटासेट प्रबंधन के लिए मॉडल-अज्ञेय (model-agnostic) बिल्डिंग ब्लॉक्स प्रदान करता है।
Cog मशीन लर्निंग मॉडल को प्रोडक्शन-रेडी Docker कंटेनरों में पैकेज करता है, CUDA संगतता को स्वचालित रूप से संभालता है और Python प्रकार परिभाषाओं से HTTP अनुमान API उत्पन्न करता है।
Pyro एक PyTorch पर आधारित गहन प्रोबेबिलिस्टिक प्रोग्रामिंग लाइब्रेरी है, जो सार्वभौमिक मॉडल और स्वचालित अनुमान का समर्थन करती है। यह Uber AI द्वारा विकसित और Linux Foundation परियोजना है। इसे pip या स्रोत से स्थापित किया जा सकता है।
timm PyTorch छवि मॉडल, परतों, ऑप्टिमाइज़र, शेड्यूलर, डेटा लोडर और प्रशिक्षण/मूल्यांकन स्क्रिप्ट्स का एक बड़ा संग्रह है, जो ResNet, EfficientNet, ViT, ConvNeXt और Swin जैसे कई पूर्व-प्रशिक्षित बैकबोन प्रदान करता है।
EasyOCR एक तैयार-उपयोग ऑप्टिकल कैरेक्टर पहचान लाइब्रेरी है जो 80+ भाषाओं और प्रमुख लेखन लिपियों का समर्थन करती है। यह सरल Python API और CLI प्रदान करती है, जिसमें PyTorch-आधारित डिटेक्शन और रिकग्निशन मॉडल शामिल हैं, साथ ही कस्टम प्रशिक्षण के विकल्प भी हैं।
Premove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।
InsightFace एक अत्याधुनिक ओपन-सोर्स 2D और 3D चेहरा विश्लेषण परियोजना है, जो चेहरा पहचान, पता लगाने, संरेखण, स्वैपिंग और जीवंतता जांच के लिए पूर्व-प्रशिक्षित मॉडल, Python पैकेज और स्व-होस्टेड सर्वर प्रदान करती है।
einops एक लचीली टेंसर ऑपरेशन लाइब्रेरी है जो आइंस्टीन-शैली नोटेशन का उपयोग करके PyTorch, JAX, TensorFlow, NumPy और अन्य में पठनीय, विश्वसनीय कोड बनाती है।
Hugging Face Transformers टेक्स्ट, विजन, ऑडियो और मल्टीमॉडल कार्यों के लिए एक मशीन लर्निंग मॉडल-डेफिनिशन फ्रेमवर्क है। यह 1 मिलियन से अधिक प्री-ट्रेंड चेकपॉइंट्स के साथ इन्फरेंस और ट्रेनिंग के लिए एक एकीकृत API प्रदान करता है।
SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।