FunTTS एक एकीकृत इंटरफ़ेस वाली टेक्स्ट-टू-स्पीच लाइब्रेरी है, जो कई ओपन-सोर्स TTS इंजन के बीच निर्बाध स्विचिंग का समर्थन करती है और सबटाइटल जनरेशन, मल्टी-कैरेक्टर डायलॉग और एसिंक्रोनस प्रोसेसिंग जैसी सुविधाएँ प्रदान करती है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONvtmate एक टर्मिनल-आधारित वॉइस AI टूलकिट है जिसमें अल्ट्रा-लो लैटेंसी, 41 भाषाओं का समर्थन और एकीकृत TTS/STT शामिल है। यह लाइव वॉइस बातचीत, बहस, वॉइस क्लोनिंग, सत्र निर्यात और वैश्विक शॉर्टकट के साथ बैकग्राउंड डेमन मोड को सक्षम करता है।
OpenCreator एक ओपन-सोर्स AI वर्कस्पेस है जो विभिन्न मल्टीमोडल कंटेंट क्रिएशन टूल्स को एक स्थानीय एजेंट वातावरण में जोड़ता है, जिसमें वीडियो अनुवाद, डाउनलोड, इमेज जनरेशन, स्मार्ट डबिंग और वीडियो निर्माण शामिल हैं।
Unsloth एक डेस्कटॉप एप्लिकेशन और फ्रेमवर्क है जो Windows, macOS और Linux पर स्थानीय रूप से लार्ज लैंग्वेज मॉडल्स (LLMs) और डिफ्यूजन मॉडल्स को चलाने और प्रशिक्षित करने के लिए उपयोग किया जाता है।
Verba एक ऑफ़लाइन-फर्स्ट डेस्कटॉप ऐप है जो AI कोच के साथ बोलकर भाषा सिखाता है। यह Ollama या अपने API कुंजी के साथ स्थानीय रूप से चलता है और इन्हें शामिल करता है: इंलाइन सुधार, क्रमबद्ध पठन, spaced-repetition शब्दकोश, वॉइस सिंथेसिस और डिक्टेशन।
Google Chrome और Mozilla Firefox के लिए एक ब्राउज़र एक्सटेंशन जो YouTube वीडियो के लिए रीयल-टाइम, द्विभाषी सबटाइटल अनुवाद प्रदान करता है।
LocalAI एक ओपन‑स्रोत, स्व‑होस्टेड AI इंजन है जो किसी भी हार्डवेयर पर, CPU‑only सहित, LLMs, विज़न, वॉयस, इमेज और वीडियो मॉडल्स चलाता है। यह OpenAI, Anthropic और ElevenLabs‑संगत API प्रदान करता है, ऑन‑डिमांड मॉड्यूलर बैकएंड, मल्टी‑यूज़र प्रमाणीकरण, और RAG और MCP वाले बिल्ट‑इन एजेंट्स प्रदान करता है।
VoxCPM2 एक टोकन-रहित टेक्स्ट-टू-स्पीच सिस्टम है जिसमें 30 भाषाओं का समर्थन, टेक्स्ट से वॉइस डिज़ाइन, नियंत्रित वॉइस क्लोनिंग और 48kHz ऑडियो आउटपुट वाली 2B डिफ्यूज़न ऑटोरेग्रेसिव मॉडल शामिल है।
Pixelle-Video एक AI स्वचालित शॉर्ट वीडियो इंजन है, जो एक विषय दर्ज करने पर स्वतः समाचार, चित्र, ऑडियो, पृष्ठभूमि संगीत और वीडियो का संश्लेषण कर सकता है, जो कई AI मॉडल और कार्यप्रवाह के लचीले संयोजन को समर्थन करता है।
एक टर्मिनल-आधारित व्यावहारिक Python कोर्स: आप Neovim-स्टाइल मोडल एडिटर में कोड लिखते हैं जबकि एक स्थानीय TTS वॉइस आपको ऑफलाइन कोचिंग देती है। इसमें ड्रिल्स और एक सिम्युलेटेड cloud/DevOps ट्रैक शामिल है।
चैटटीटीएस एक ओपन-सोर्स टेक्स्ट-टू-स्पीच मॉडल है जो बातचीत के दृश्यों के लिए बनाया गया है, अंग्रेजी और चीनी भाषा का समर्थन करता है और हंसी, रुकावट और प्रोसोडी पर बहुत बारीक नियंत्रण प्रदान करता है।
GPT-SoVITS एक ओपन-सोर्स फ़ोर-शॉट वॉइस क्लोनिंग और TTS सिस्टम है जो चीनी, जापानी, कोरियन, कانتonese और अंग्रेज़ी सहित कई भाषाओं में शून्य-शॉट (5 सेकंड) और फ़ोर-शॉट (1 मिनट) वॉइस क्लोनिंग का समर्थन करता है।
ओपन-सोर्स वीडियो अनुवाद, डियो ट्रांसक्रिप्शन, AI डबिंग और सबटाइटल अनुवाद टूल, जिसमें लोकल और ऑनलाइन API समर्थन है।
NVIDIA NeMo Speech एक Apache-2.0 PyTorch फ्रेमवर्क है जो स्पीच AI मॉडल बनाने, अनुकूलित करने और तैनात करने हेतु है, जिसमें ASR, TTS और स्पीच LLMs शामिल हैं, साथ ही पूर्व-प्रशिक्षित चेकपॉइंट्स और Docker/uv इंस्टॉल पथ उपलब्ध हैं।