عن المشروع

ModelScope هي مكتبة مفتوحة المصدر مبنية حول فكرة "النموذج كخدمة" (MaaS). تهدف إلى جمع نماذج تعلم الآلة من مجتمع الذكاء الاصطناعي وتبسيط استخدامها في التطبيقات الحقيقية. توفر المكتبة الأساسية في هذا المستودع الواجهات والتطبيقات لاستدلال النماذج وتدريبها وتقييمها. القدرات الرئيسية الموصوفة في README: - واجهات برمجية موحدة وطبقية لاستكشاف واستخدام النماذج عبر مجالات الرؤية الحاسوبية ومعالجة اللغة الطبيعية والكلام والوسائط المتعددة والحوسبة العلمية. - واجهة `pipeline` للاستدلال: لمهمة معينة ونوع إدخال (صورة، نص، صوت، فيديو)، تقوم بضعة أسطر من الكود بتحميل النموذج الأساسي وإرجاع النتائج. تشمل الأمثلة تقسيم الكلمات الصينية وإزالة خلفية الصور الشخصية. - واجهة `Trainer` للضبط الدقيق والتقييم، مع `trainer.train()` و`trainer.evaluate()`. يوضح README ضبط نموذج GPT-3 الأساسي (1.3B) على مجموعة بيانات الشعر الصيني. - `MsDataset` لتحميل مجموعات البيانات، مع إعادة تعيين الأعمدة وتقسيمات التدريب/الاختبار. - التكامل مع خدمات ModelScope الخلفية، خاصة Model-Hub وDataset-Hub، للبحث عن الكيانات والتحكم في الإصدارات وإدارة التخزين المؤقت. - دعم استراتيجيات التدريب الموزع بما في ذلك التوازي البياني وتوازي النماذج والتوازي الهجين، الموجهة للنماذج الكبيرة. - تصميم معياري بحيث يمكن تخصيص مكونات سير عمل الاستدلال والتدريب. النماذج والوصول عبر الإنترنت: يذكر README أن مئات النماذج (أكثر من 700 ويزداد العدد) متاحة للعموم على modelscope.cn، وتغطي معالجة اللغة الطبيعية والرؤية الحاسوبية والصوت والوسائط المتعددة والذكاء الاصطناعي للعلوم. تشمل الأمثلة التمثيلية المدرجة نماذج لغوية كبيرة مثل Yi-1.5-34B-Chat وQwen1.5-110B-Chat وDeepSeek-V2-Chat وZiya2-13B-Chat وMeta-Llama-3-8B-Instruct وPhi-3-mini-128k-instruct؛ ونماذج متعددة الوسائط مثل Qwen-VL-Chat وYi-VL-6B وInternVL-Chat-V1-5 وdeepseek-vl-7b-chat وOpenSoraPlan وOpenSora وI2VGen-XL؛ ونماذج الرؤية الحاسوبية مثل DamoFD لكشف الوجوه وBSHM لإزالة خلفية الصور الشخصية وDCT-Net لتحويل الصور الشخصية إلى رسوم كرتونية وDuGuang للتعرف الضوئي على الحروف وLaMa لإكمال الصور؛ ونماذج الصوت مثل Paraformer للتعرف على الكلام وFSMN VAD وMonotonic-Aligner للتنبؤ بالطوابع الزمنية وCT-Transformer لعلامات الترقيم وSambert-Hifigan لتحويل النص إلى كلام وCAM++ للتحقق من المتحدث؛ ونماذج الذكاء الاصطناعي للعلوم uni-fold-monomer وuni-fold-multimer. يُذكر أيضًا التجربة عبر الإنترنت ودفتر ModelScope السحابي ببيئات CPU/GPU. التثبيت: تدعم المكتبة PyTorch وTensorFlow وONNX، وتم اختبارها على Python 3.7+ وPyTorch 1.8+ وTensorFlow 1.15 أو 2.0+. يتم توفير صور Docker رسمية لوحدة المعالجة المركزية ووحدة معالجة الرسومات. يمكن أن يستخدم الإعداد المحلي pip وconda؛ تشمل الإضافات الاختيارية `modelscope[multi-modal]` و`modelscope[nlp]` و`modelscope[cv]` و`modelscope[audio]` و`modelscope[science]`. تذكر الملاحظات أن بعض نماذج مهام الصوت تدعم فقط Python 3.7 مع TensorFlow 1.15.4 على Linux، وأن SoundFile قد يتطلب libsndfile على Linux، وأن بعض نماذج الرؤية الحاسوبية تحتاج إلى mmcv-full. الترخيص: Apache License 2.0. يوفر README أيضًا مدخل اقتباس وروابط لمزيد من الوثائق حول التثبيت والمهام وخطوط أنابيب الاستدلال والضبط الدقيق والمعالجة المسبقة للبيانات والتقييم والمساهمة بالنماذج.