عن المشروع

MockingBird هو مشروع مفتوح المصدر لاستنساخ الصوت وتحويل النص إلى كلام مبني على PyTorch. وهو مشتق من مشروع Real-Time-Voice-Cloning الذي كان يدعم اللغة الإنجليزية فقط، ويضيف دعمًا للغة الصينية الماندرين تم اختباره على عدة مجموعات بيانات مثل aidatatang_200zh وmagicdata وaishell3 وdata_aishell. القدرات الرئيسية الموصوفة في ملف README: - استنساخ الصوت وتوليد الكلام في الوقت الفعلي، بهدف معلن هو استنساخ صوت من عينة قصيرة. - دعم اللغة الصينية الماندرين، مع اختبارات على مجموعات بيانات عامة متعددة. - يعمل على نظامي ويندوز ولينكس، ويتضمن إرشادات للتعامل مع مشكلات على أجهزة Mac بنظام M1. - وضع خادم ويب (web.py) للاستدعاء عن بُعد، وصندوق أدوات بواجهة رسومية (demo_toolbox.py)، ومولد أوامر سطرية (gen_voice.py). - خطوط تدريب للمشفّر والمركّب ومولّد الموجات الصوتية، بالإضافة إلى خيارات لإعادة استخدام مشفّر ومولّد موجات مدربين مسبقًا ونماذج مركّب مشاركة من المجتمع. - توثيق للمشكلات الشائعة مثل حدود ذاكرة VRAM، وضبط حجم الدفعات، وتخطيط مجموعات البيانات، وتوقعات تقدم التدريب. يذكر ملف README أن المستودع لم يعد محدثًا بنشاط من قبل المؤلف، الذي يشير إلى خدمة مستضافة على السحابة بشكل منفصل. تم إصداره بموجب رخصة MIT. يشير المشروع إلى عدة أوراق بحثية وتنفيذات، بما في ذلك SV2TTS وGlobalStyleToken وHiFi-GAN وFre-GAN وWaveRNN وTacotron وGE2E.