عن المشروع

VoxCPM2 هو نظام تحويل النص إلى كلام مفتوح المصدر من OpenBMB يتجنب الترميز المنفصل، حيث يولد تمثيلات كلام مستمرة من خلال بنية تنتشار ذاتي راجعي من طرف إلى طرف. أحدث إصدار بـ 2 مليار معامل مُدرّب على بيانات كلام متعددة اللغات ويدعم 30 لغة، بما في ذلك لهجات صينية مثل السينتشوانية والكانتونية والأوو. تشمل القدرات الرئيسية المذكورة في ملف README التركيب متعدد اللغات بدون وسوم لغة، وتصميم الصوت من أوصاف باللغة الطبيعية (النوع، العمر، النبرة، العاطفة، السرعة)، واستنساخ صوتي قابل للتحكم من مقطع مرجعي قصير مع إرشادات أسلوبية اختيارية، ووضع "الاستنساخ المتقدم" الذي يستخدم كلًا من الصوت المرجعي ونصه لإعادة إنتاج دقة الصوت. يقبل AudioVAE V2 التصميم غير المتماثل للتشفير/الفك بملف صوتي مرجعي بتردد 16 كيلو هرتز ويُنتج صوتًا بتردد 48 كيلو هرتز مع تعزيز دقة مدمج. يوفر المشروع واجهة برمجة تطبيقات Python، وواجهة سطر أوامر، وتجربة ويب، بالإضافة إلى التوليد المتدفق. تشمل خيارات النشر Nano-vLLM للخدمة عالية الإنتاجية، وvLLM-Omni لنقطة نهاية متوافقة مع OpenAI /v1/audio/speech، وllama.cpp-omni للاستنتاج على الجهاز باستخدام C++ وأوزان GGUF على وحدة المعالجة المركزية أو Metal أو CUDA أو Vulkan. يدعم ضبط الصوت الدقيق عبر SFT وLoRA. تم إصدار الأوزان والكود تحت رخصة Apache-2.0 للاستخدام التجاري. يذكر ملف README أيضًا نتائج اختبارات على Seed-TTS-eval ويحذر من المخاطر والقيود. يعتمد هذا العرض على ملف README للمستودع فقط ولا يتحقق بشكل مستقل من ادعاءات الأداء.