منصوبے کے بارے میں
VibeVoice هو مشروع ذكاء اصطناعي صوتي مفتوح المصدر من مايكروسوفت، يتكون من نماذج التعرف التلقائي على الكلام (ASR) وتحويل النص إلى كلام (TTS). يتميز بميزة تقنية رئيسية تتمثل في استخدام مقاطع كلام مستمرة تعمل بمعدل إطارات منخفض للغاية يبلغ 7.5 هرتز، مما يحافظ على جودة الصوت بينما يحسن الكفاءة الحسابية للسلاسل الطويلة، بالاقتران بإطار عمل الانتشار التالي-رمز.
النماذج والقدرات الأساسية المسجلة في المستودع:
1. VibeVoice-ASR: نموذج موحد لتحويل الكلام إلى نص يعالج ما يصل إلى 60 دقيقة من الصوت المستمر في مرور واحد. ينتج نصوصًا منظمة تحتوي على هوية المتحدث (من)، والطوابع الزمنية (متى)، والمحتوى (ماذا). يدعم الكلمات المفتاحية المخصصة للمستخدم للمصطلحات المتخصصة في المجال، وهو متعدد اللغات بشكل أصلي ويدعم أكثر من 50 لغة. يوجد نسخة تيارية تقوم بنسخ الصوت أثناء وصوله. تم دمجه في Hugging Face Transformers ويدعم استدلال vLLM.
2. VibeVoice-ASR-BitNet: محرك استدلال معالج وحدة مركزية طرفي يستخدم التكميم المتنوع (I8_S + I2_S)، مضغوطًا النموذج من 4.62 جيجابايت إلى 1.58 جيجابايت للاستدلال في الوقت الفعلي على خيوط المعالج المركزي دون الحاجة إلى وحدة معالجة رسومية.
3. VibeVoice-TTS: نموذج تحويل النص إلى كلام طويل المدى ومتعدد المتحدثين قادر على توليف ما يصل إلى 90 دقيقة من الكلام في مرور واحد مع ما يصل إلى 4 متحدثين متميزين. يدعم الكلام التعبيري واللغات المتعددة بما في ذلك الإنجليزية والصينية. ملاحظة: تمت إزالة كود TTS من المستودع بسبب مخاوف الذكاء الاصطناعي المسؤول بعد حالات سوء الاستخدام.
4. VibeVoice-Realtime-0.5B: نموذج توليف كلام تدفقي خفيف الوزن (0.5 مليار معلمة) يدعم إدخال النص التياراتي والتوليف طويل المدى القوي، مع أصوات متعددة اللغات التجريبية.
يتضمن المستودع توثيقًا، وكود ضبط دقيق لـ ASR، وعروض تجريبية، وروابط لأوزان النماذج على Hugging Face. يعلن المشروع أنه مخصص لأغراض البحث والتطوير فقط وليس موصى به للتطبيقات التجارية أو الواقعية دون اختبارات إضافية.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.