عن المشروع
إطار عمل NVIDIA NeMo Speech مفتوح المصدر موجه للباحثين ومطوري PyTorch الذين يعملون على نماذج الكلام. ووفقاً لملف README الخاص به، يستهدف التعرف التلقائي على الكلام (ASR) وتحويل النص إلى كلام (TTS) ونماذج لغوية كبيرة للكلام، ويهدف إلى مساعدة المستخدمين على إنشاء نماذج جديدة وتخصيصها ونشرها من خلال إعادة استخدام الكود الموجود ونقاط التفتيش المدربة مسبقاً.
النطاق والموضع
- يذكر المستودع أنه تحول ليركز على نماذج لغوية كبيرة للصوت والكلام ومتعددة الوسائط، وآخر إصدار من NeMo قبل الانقسام يغطي وسائط إضافية هو الإصدار v2.7.3.
- السطر الحالي هو NeMo Speech 3.0، الذي نُشر كإصدار v3.0.0 ويتم توزيعه في حاوية NGC.
- تم جمع نقاط تفتيش النماذج والعروض التوضيحية في مجموعة على منصة HuggingFace تم الإشارة إليها في ملف README.
التوثيق والإصدارات
- يتم استضافة وثائق المطورين لأحدث إصدار (3.0.0) وللفرع الرئيسي الليلي.
- يسرد ملف README تحديثات مؤرخة تصف إصدارات النماذج مثل نقاط تفتيش تحويل النص إلى كلام متعدد اللغات، ونماذج التعرف التلقائي على الكلام المتدفق، ونماذج التعرف التلقائي على الكلام غير المتصل والمتدفق الموحدة، ونماذج التعرف على الكلام وترجمته للغات الأوروبية. هذه هي ملاحظات الإصدار، ولا توجد هنا أي تحقق مستقل من معايير الأداء.
المتطلبات
- Python 3.12 أو إصدار أحدث، وPyTorch 2.7 أو إصدار أحدث (لوحدة المعالجة المركزية أو CUDA)، ووحدة معالجة رسوميات NVIDIA مع CUDA للتدريب (موصى بها للاستدلال).
- يذكر المشروع أنه يتم تثبيته فوق مكدس Python/PyTorch/CUDA الموجود دون استبداله، ويتم وصف الإصدارات المثبتة في ملف uv.lock والحاوية الرسمية (Python 3.13، وPyTorch 2.11 مع CUDA 12.9 أو PyTorch 2.12 مع CUDA 13.2) كمجموعات تم اختبارها بشكل نشط بدلاً من متطلبات صارمة.
- تحذير يشير إلى أنه منذ إصدار PyTorch 2.6، تعمل دالة torch.load بشكل افتراضي مع المعامل weights_only=True، وقد تحتاج بعض نقاط التفتيش إلى تعيين المتغير TORCH_FORCE_NO_WEIGHTS_ONLY_LOAD=1، الذي يجب استخدامه فقط مع الملفات الموثوقة لأن تحميل ملفات غير موثوقة قد يعرض لخطر تنفيذ تعليمات برمجية عشوائية.
خيارات التثبيت
- الموصى به: التثبيت من المصدر باستخدام uv، مع مزامنة الإضافات مثل all و cu13 (أو cu12)، مما يعيد إنتاج المكدس المختبر في بيئة .venv افتراضية؛ وتضيف المجموعات الاختيارية اختبارات أو وثائق.
- Docker: اسحب حاوية NGC المبنية مسبقاً أو قم ببنائها من ملف Dockerfile المقدم، مع خيارات GPU_TARGET لوحدات معالجة الرسوميات من فئة H100 أو أحدث أو A100.
- خيار بديل عبر pip: قم بتثبيت PyTorch أولاً، ثم حزمة nemo-toolkit مع إضافات asr و tts؛ ويشير ملف README إلى أنه لا يجب استخدام الأمر uv sync --locked مع المكدس المخصص من قبل المستخدم لأنه يطبق ملف القفل ويستبدل مكدس Python/PyTorch/CUDA الموجود.
- توصف الأنظمة الخلفية المسرعة الاختيارية (محرك Transformer، وFlashAttention، وMamba، وgrouped-GEMM/MoE، وDeepEP) على أنها نوى مبنية من المصدر من إضافات مترجمة، ويمكن لنظام Automodel الخلفي العمل دون تبعيات مترجمة.
الترخيص والمساهمة
- مرخص برخصة أباتشي 2.0.
- تُرحب بالمساهمات المجتمعية من خلال العملية الموضحة في ملف CONTRIBUTING.md.
هذه النظرة العامة تعكس فقط ما ورد في ملف README الخاص بالمستودع، ولا تتحقق من صحة المطالبات المتعلقة بالأداء أو التصنيف الواردة في ملاحظات الإصدار.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.