عن المشروع
MOSS-TTS-Nano هو نموذج مفتوح المصدر لتوليد الكلام متعدد اللغات من MOSI.AI وفريق OpenMOSS. بحوالي 0.1 مليار معلمة، يستهدف توليد الكلام في الوقت الفعلي ويمكن تشغيله على وحدة المعالجة المركزية دون الحاجة إلى وحدة معالجة رسومية، مما يبسط النشر للعروض المحلية وخدمة الويب والتكامل خفيف الوزن.
الخصائص الرئيسية الموضحة في ملف README:
- حجم نموذج صغير يبلغ حوالي 0.1 مليار معلمة.
- إخراج صوتي أصلي بتردد 48 كيلو هرتز وقناتين (ستيريو).
- دعم متعدد اللغات يغطي 20 لغة، بما في ذلك الصينية والإنجليزية والألمانية والإسبانية والفرنسية واليابانية والإيطالية والمجرية والكورية والروسية والفارسية والعربية والبولندية والبرتغالية والتشيكية والدنماركية والسويدية واليونانية والتركية.
- بنية انحدارية ذاتية نقية مبنية على خط أنابيب محلل الصوتيات ونموذج اللغة الكبير.
- استدلال تدفقي بزمن استجابة منخفض في الوقت الفعلي وصوت أول سريع.
- مناسب لوحدة المعالجة المركزية: يمكن تشغيل التوليد التدفقي على وحدة معالجة مركزية رباعية النوى.
- قدرة على النصوص الطويلة مع استنساخ صوت تلقائي مجزأ.
- مسارات نشر مفتوحة المصدر عبر نصوص بايثون مباشرة وواجهة سطر أوامر مجمعة.
البدء السريع: يوصي ملف README ببيئة بايثون نظيفة، واستنساخ المستودع، وتثبيت المتطلبات، وتثبيت المشروع في الوضع القابل للتحرير بحيث يصبح أمر moss-tts-nano متاحًا. يستخدم تحميل النموذج الافتراضي OpenMOSS-Team/MOSS-TTS-Nano وOpenMOSS-Team/MOSS-Audio-Tokenizer-Nano. يعد استنساخ الصوت سير العمل الرئيسي الموصى به، ويتم توضيحه باستخدام infer.py مع مسار صوت موجه ونص إدخال. يمكن تشغيل عرض ويب محلي عبر FastAPI باستخدام app.py وفتحه على 127.0.0.1:18083.
استدلال ONNX على وحدة المعالجة المركزية: يوصى بإصدار ONNX لوحدة المعالجة المركزية للنشر المحلي خفيف الوزن. يزيل اعتماد PyTorch أثناء الاستدلال، ويعمل على ONNX Runtime CPU، ويدعم الصوت المرجعي المباشر والأصوات المدمجة وفك التشفير التدفقي في الوقت الفعلي، ويوصف بأنه أكثر كفاءة في المعالجة بنحو مرتين تقريبًا من الإصدار الأصلي في اختبارات المشروع. على MacBook Air M4، لوحظ استدلال سلس باستخدام نواة وحدة معالجة مركزية واحدة. تتضمن نقاط دخول ONNX infer_onnx.py وapp_onnx.py وواجهة سطر الأوامر المجمعة مع خيار --backend onnx. تنفيذ CUDA اختياري عبر onnxruntime-gpu و--execution-provider cuda. يتم تنزيل ملفات النموذج المفقودة عند أول تشغيل من مستودعات ONNX على Hugging Face.
أدوات إضافية: مثال Android ONNX Runtime تحت examples/android_onnx_runtime يقوم بتحميل الرسوم البيانية ONNX المصدرة على الجهاز ويكتب ملف WAV. يقوم مُصدِّر تحت onnx/ بتحويل نقطة تفتيش محلية بتنسيق Hugging Face إلى دليل نموذج ONNX خاص بـ TTS فقط. توفر واجهة سطر الأوامر المجمعة أوامر moss-tts-nano generate وmoss-tts-nano serve، مع خيارات للكلام الموجّه وملفات النصوص واختيار الخلفية ومزود التنفيذ. يتم توفير كود الضبط الدقيق والبرامج التعليمية في دليل finetuning.
كما يوثق المستودع MOSS-Audio-Tokenizer-Nano، وهو محلل صوتيات خفيف الوزن يبلغ حوالي 20 مليون معلمة مبني على بنية Cat (محلل الصوتيات السببي مع المحول). يدعم إدخال وإخراج ستيريو بتردد 48 كيلو هرتز، ويضغط الصوت إلى تدفق رموز بتردد 12.5 هرتز، ويستخدم RVQ مع 16 كتاب رموز عبر معدلات بت متغيرة من 0.125 كيلوبت في الثانية إلى 2 كيلوبت في الثانية. تقارن جداول ورسوم التقييم جودة إعادة البناء مع المحللات مفتوحة المصدر التي لا تتجاوز 120 مليون معلمة على بيانات الكلام والصوت والموسيقى.
كما يتم وصف عائلة MOSS-TTS الأوسع، بما في ذلك MOSS-TTS وMOSS-TTS-Local-Transformer وMOSS-TTSD-v1.0 وMOSS-VoiceGenerator وMOSS-SoundEffect وMOSS-TTS-Realtime، مع روابط لأوزان النماذج على Hugging Face وModelScope.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.