عن المشروع

VibeVoice هو مشروع ذكاء صوتي مفتوح المصدر من مايكروسوفت يتضمن كلًا من نماذج التعرف التلقائي على الكلام (ASR) وتوليف النص إلى كلام (TTS). تتمثل إحدى الميزات التقنية الأساسية في استخدام موحدات نطق كلام مستمر تعمل بمعدل إطارات منخفض للغاية يبلغ 7.5 هرتز للحفاظ على جودة الصوت مع تحسين الكفاءة الحسابية للقطع الطويلة، مقترنًا بإطار عمل الانتشار التالي-رمز. النماذج والقدرات الرئيسية الموثقة في المستودع: 1. VibeVoice-ASR: نموذج موحد لتحويل الكلام إلى نص يعالج ما يصل إلى 60 دقيقة من الصوت المستمر في عملية واحدة. ينتج نسخًا نصيًا مهيكلاً يحتوي على هوية المتحدث (من)، والطوابع الزمنية (متى)، والمحتوى (ماذا). يدعم كلمات ساخنة مخصصة من قبل المستخدم للمصطلحات المتخصصة في المجال وهو متعدد اللغات بشكل أصلي مع دعم أكثر من 50 لغة. يوجد متغير للبث يُترجم الصوت كما يصل. مُدمج في Hugging Face Transformers ويدعم استدلال vLLM. 2. VibeVoice-ASR-BitNet: محرك استدلال على معالج الكمبيوتر (CPU) للحواف يستخدم الكمون الموّحد (I8_S + I2_S)، مضغوطًا النموذج من 4.62 جيجابايت إلى 1.58 جيجابايت للاستدلال في الوقت الفعلي على خيوط CPU بدون بطاقة رسومات (GPU). 3. VibeVoice-TTS: نموذج توليف نص إلى كلام طويل المدى ومتعدد المتحدثين قادر على تحويل ما يصل إلى 90 دقيقة من الكلام في عملية واحدة مع ما يصل إلى 4 متحدثين متميزين. يدعم كلامًا تعبيريًا ولغات متعددة بما في ذلك الإنجليزية والصينية. ملاحظة: تم إزالة كود TTS من المستودع بسبب مخاوف الذكاء الاصطناعي المسؤول بعد حالات سوء استخدام. 4. VibeVoice-Realtime-0.5B: نموذج ت TS للوقت الفعلي خفيف الوزن (0.5 مليار معامل) يدعم إدخال النص بالبث وتوليف كلام طويل المدى قوي، مع أصوات متعددة اللغات تجريبية. يحتوي المستودع على توثيق، وكود ضبط دقيق لـ ASR، وعروض توضيحية، وروابط لأوزان النماذج على Hugging Face. يذكر المشروع أنه مخصص لأغراض البحث والتطوير فقط وليس موصى به للتطبيقات التجارية أو الواقعية دون مزيد من الاختبار.