Voicebox एक ओपन-सोर्स, स्थानीय रूप से चलने वाला AI वॉयस स्टूडियो है। यह वॉयस क्लोनिंग, टेक्स्ट-टू-स्पीच, ग्लोबल डिक्टेशन और MCP-सक्षम टूल्स के माध्यम से AI एजेंट्स को आवाज देने की सुविधा प्रदान करता है, जो इसे क्लाउड सेवाओं का एक मुफ्त विकल्प बनाता है।
ओपन सोर्स। नई संभावनाएँ।
उत्कृष्ट ओपन-सोर्स प्रोजेक्ट खोजें, गुमनाम रूप से प्रोजेक्ट सबमिट करें और अपने प्रोजेक्ट का दावा कर उसे संपादित करें।
जिज्ञासा के साथ ओपन सोर्स खोजें।
THE FIRST COLLECTIONPremove ITN एक ओपन-सोर्स, संदर्भ-जागरूक इनवर्स टेक्स्ट नॉर्मलाइज़ेशन लाइब्रेरी है जो अंग्रेज़ी वॉइस-एजेंट ट्रांसक्रिप्ट के लिए है। यह बोले गए ASR आउटपुट को DeBERTa प्रासंगिक स्कोरिंग के साथ जनरेट-स्कोर-डीकोड पाइपलाइन द्वारा विहित लिखित रूपों में परिवर्तित करता है।
RunAnywhere एक क्रॉस-प्लेटफॉर्म SDK सूट है जो फोन, ब्राउज़र, डेस्कटॉप और सर्वर पर पूरी तरह से ऑन-डिवाइस AI मॉडल चलाने के लिए है। यह LLM, विजन, स्पीच, वॉयस एजेंट, RAG, एम्बेडिंग और इमेज जनरेशन को एक ही सेमैंटिक API के साथ सपोर्ट करता है।
SenseVoiceSmall एक ओपन-सोर्स स्पीच फाउंडेशन मॉडल है जो ASR, भाषा पहचान, भावना पहचान और डियो इवेंट डिटेक्शन के लिए है, जो मंदारिन, कैंटोनीज़, अंग्रेज़ी, जापानी और कोरियाई को कवर करता है और तेज़ नॉन-ऑटोरेग्रेसिव इन्फरेंस प्रदान करता है।
ओपन-सोर्स AI-नेटिव कॉल सेंटर: वॉयस AI पहले OpenAI Realtime या Qwen पर उत्तर देता है, FreeSWITCH कतारों पर ब्राउज़र सॉफ्टफोन के साथ मानव एजेंटों को स्थानांतरित करता है। एक Go बाइनरी जिसमें REST API, SSE, एम्बेडेड React UI और PostgreSQL है।