इस प्रोजेक्ट के बारे में

VibeVoice माइक्रोसॉफ्ट का एक ओपन-सोर्स वॉइस AI प्रोजेक्ट है जिसमें Automatic Speech Recognition (ASR) और Text-to-Speech (TTS) मॉडल दोनों शामिल हैं। इसका एक मुख्य तकनीकी विशेषता अल्ट्रा-लो फ्रेम रेट पर 7.5 Hz पर काम करने वाले continuous speech tokenizers का उपयोग है, जो ऑडियो फिडेलिटी को बनाए रखते हुए लंबे सीक्वेंस के लिए कंप्यूटेशनल दक्षता को बेहतर बनाता है, साथ ही एक next-token diffusion फ्रेमवर्क के साथ। रेपॉजिटरी में दस्तावेज़ीकृत प्रमुख मॉडल और क्षमताएं: 1. VibeVoice-ASR: एक एकीकृत स्पीच-टू-टेक्स्ट मॉडल जो एकल पास में 60 मिनट तक के निरंतर ऑडियो को प्रोसेस करता है। यह speaker identity (कौन), timestamps (कब), और content (क्या) वाले संरचित ट्रांसक्रिप्शन उत्पन्न करता है। यह डोमेन-विशिष्ट शब्दों के लिए उपयोगकर्ता-कस्टमाइज्ड hotwords का समर्थन करता है और 50 से अधिक भाषाओं के साथ नेटिव रूप से बहुभाषी है। एक स्ट्रीमिंग वेरिएंट ऑडियो आते ही ट्रांसक्राइब करता है। यह Hugging Face Transformers में एकीकृत है और vLLM इनफरेंस का समर्थन करता है। 2. VibeVoice-ASR-BitNet: एक edge CPU इनफरेंस इंजन जो heterogeneous quantization (I8_S + I2_S) का उपयोग करता है, मॉडल को 4.62 GB से 1.58 GB तक संपीड़ित करता है ताकि GPU के बिना CPU थ्रेड्स पर रियल-टाइम इनफरेंस संभव हो सके। 3. VibeVoice-TTS: एक लंबे-अवधि मल्टी-स्पीकर टेक्स्ट-टू-स्पीच मॉडल जो एकल पास में 90 मिनट तक के स्पीच को 4 अलग-अलग स्पीकर्स के साथ संश्लेषित करने में सक्षम है। यह expressive speech और अंग्रेजी और चीनी सहित कई भाषाओं का समर्थन करता है। नोट: जिम्मेदार AI चिंताओं के बाद दुरुपयोग के कुछ मामलों के बाद रेपॉजिटरी से TTS कोड हटा दिया गया था। 4. VibeVoice-Realtime-0.5B: एक हल्का (0.5B पैरामीटर) रियल-टाइम स्ट्रीमिंग TTS मॉडल जो streaming टेक्स्ट इनपुट और मजबूत लंबे-अवधि स्पीच जनरेशन का समर्थन करता है, जिसमें प्रयोगात्मक बहुभाषी वॉइस हैं। रेपॉजिटरी में दस्तावेज़ीकरण, ASR के लिए finetuning कोड, डेमो, और Hugging Face पर मॉडल वेट्स के लिंक शामिल हैं। प्रोजेक्ट का कहना है कि यह केवल रिसर्च और डेवलपमेंट उद्देश्यों के लिए है और आगे के परीक्षण के बिना वाणिज्यिक या वास्तविक दुनिया के अनुप्रयोगों के लिए अनुशंसित नहीं है।