عن المشروع
Spotlight هي مكتبة بايثون تساعدك على فهم مجموعات البيانات غير المهيكلة بسرعة. انطلاقاً من DataFrame موجود في pandas أو من مجموعة بيانات Hugging Face، يمكنك تشغيل تصور تفاعلي في المتصفح ببضعة أسطر من التعليمات البرمجية، واستخدام إثراءات البيانات مثل التضمينات والتنبؤات وعدم اليقين لتحديد العناقيد الحرجة.
تشمل أنواع البيانات المدعومة الصور والصوت والنصوص والفيديو والسلاسل الزمنية والبيانات الهندسية. ويحمّل مثال بسيط ملف CSV إلى DataFrame ثم يستدعي spotlight.show مع تعيين dtype حتى يعرف العارض كيفية عرض أعمدة مثل الصور أو التضمينات.
تغطي حالات الاستخدام النموذجية المعروضة في README تصنيف الصور (اكتشاف المشكلات في مجموعات بيانات مثل CIFAR-100، والضبط الدقيق انطلاقاً من بحث صور Bing)، وتصنيف الصوت (تصحيح الأخطاء ومقارنة نماذج كشف الجنس على مجموعة بيانات emodb، ومشكلات المتحدث في بيانات Whisper/CommonVoice)، وتصنيف النصوص، وتحليل البيانات الاستكشافي المختلط مثل نتائج سباقات Formula 1 وبيانات محاكاة التصادم. وترتبط كل حالة استخدام بمقتطفات برمجية وعروض تفاعلية ومقالات مدونات.
يتم التثبيت عبر pip (renumics-spotlight)، مع إضافات اختيارية للمحللات والتضمينات المعتمدة على torch. ويتطلب Python 3.10 أو أحدث. ويشير README إلى أن استخدام مجموعات بيانات Hugging Face الإصدار 4 مع بيانات الصوت يتطلب أيضاً إضافة torch وFFmpeg.
يدعم Spotlight تخطيطات محددة مسبقاً، مثل تخطيط debug_classification الذي يأخذ أعمدة التسمية والتنبؤ والتضمين والسمات، ويمكن أيضاً بناء التخطيطات برمجياً أو عبر واجهة المستخدم. ويوثق المشروع تتبع الاستخدام: فهو يجمع تقارير الأعطال وإحصاءات الأداء المجمعة تحت معرّف جهاز مجهول الهوية، ويمكن إلغاء الاشتراك عبر متغير البيئة SPOTLIGHT_OPT_OUT. ولا يجمع أسماء المجلدات أو أسماء مجموعات البيانات أو بيانات الصفوف.
يشير README إلى الوثائق ومرجع API ودليل الذكاء الاصطناعي المتمحور حول البيانات ومكتبة مرتبطة لكشف الشرائح (Sliceguard) ومساحات أمثلة Hugging Face وقناة Discord وإرشادات المساهمة.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.