عن المشروع
Magika هي أداة من Google للكشف عن نوع الملفات تعتمد على الذكاء الاصطناعي، وتستخدم نموذج تعلم عميق مضغوط (بضعة ميغابايت فقط) لتحديد أنواع محتوى الملفات. وفقًا لملف README، تم تدريب النموذج وتقييمه على حوالي 100 مليون عينة تغطي أكثر من 200 نوع محتوى، بما في ذلك التنسيقات الثنائية والنصية، ويُبلغ عن دقة واسترجاع متوسطين يبلغان حوالي 99% في مجموعة الاختبار. يستغرق الاستدلال حوالي 5 مللي ثانية لكل ملف على معالج واحد بعد تحميل النموذج، ويكون الوقت شبه ثابت بغض النظر عن حجم الملف لأنه يتم استخدام جزء محدود فقط من المحتوى.
يُوزَّع المشروع كأداة سطر أوامر مكتوبة بلغة Rust، وواجهة برمجة تطبيقات بلغة Python، وروابط لكل من Rust وJavaScript/TypeScript (مع حزمة npm تشغّل عرضًا توضيحيًا في المتصفح)، وGo (موصوفة بأنها قيد التطوير). تشمل خيارات التثبيت pipx وHomebrew وسكربت تثبيت ليونكس وPowerShell وcargo وpip وnpm.
تدعم أداة سطر الأوامر الفحص المتكرر، والقراءة من الإدخال القياسي، وإخراج JSON وJSONL، وتنسيقات إخراج مخصصة، وإخراج نوع MIME والتسمية، وطباعة الدرجات. كما تقدم أوضاع تنبؤ مثل الثقة العالية والثقة المتوسطة وأفضل تخمين، بالإضافة إلى نظام عتبات لكل نوع محتوى يمكن أن يُرجع تسميات عامة مثل "مستند نصي عام" أو "بيانات ثنائية غير معروفة" عندما لا يكون النموذج واثقًا.
يذكر ملف README أن Magika يُستخدم على نطاق واسع داخل Google لتوجيه ملفات Gmail وDrive وSafe Browsing إلى الماسحات الضوئية المناسبة للأمان وسياسات المحتوى، وأنه تم دمجه مع VirusTotal وabuse.ch. يعمل عرض توضيحي ويب محليًا في المتصفح. المشروع مرخّص بموجب Apache 2.0 ويتضمن إخلاء مسؤولية بأنه ليس مشروعًا رسميًا من Google.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.