عن المشروع

Video Analyzer هي أداة سطر أوامر لتوليد أوصاف لمحتوى الفيديو من المعلومات البصرية والصوتية. تتكون خط أنابيبها من ثلاث مراحل رئيسية: استخراج الإطارات الرئيسية ومعالجة الصوت، تحليل الإطارات بالرؤية، وإعادة بناء الفيديو النهائي. يستخدم المحلل OpenCV لاختيار الإطارات الرئيسية وOpenAI Whisper لنسخ الصوت المتاح، بما في ذلك فحوصات جودة الصوت الرديئة. يتم إرسال كل إطار مستخرج إلى نموذج لغوي قادر على الرؤية، مع استخدام سياق من الإطارات السابقة للحفاظ على التتابع الزمني. ثم يتم دمج تحليلات الإطارات والنص المنسوخ في وصف شامل. بشكل افتراضي، يستخدم الاستدلال المحلي Ollama مع نموذج Llama 3.2 Vision؛ يمكن للمستخدمين بدلاً من ذلك تكوين أي نقطة نهاية متوافقة مع OpenAI، مثل OpenAI أو OpenRouter، من خلال خيارات سطر الأوامر أو ملف تكوين JSON. تشمل الميزات المبلغ عنها التشغيل المحلي بالكامل دون خدمات سحابية أو مفاتيح API، واجهات برمجة تطبيقات سحابية اختيارية، نماذج Whisper ورؤية قابلة للتكوين، مطالبات مخصصة، مخرجات JSON مفصلة تحتوي على بيانات وصفية ونص وتحليلات إطارات ووصف نهائي، ونظام تكوين متدرج حيث تتجاوز وسيطات سطر الأوامر تكوين المستخدم والإعدادات الافتراضية. تشمل المتطلبات Python 3.11 أو أحدث وFFmpeg. يوصي ملف README بذاكرة وصول عشوائي كبيرة وأجهزة GPU/Apple Silicon لتنفيذ نموذج LLM محلي، بينما يتجنب الاستخدام القائم على API تلك المتطلبات المحلية للنموذج. يتم التثبيت عن طريق استنساخ المستودع وتثبيته باستخدام pip. يمكن لحزمة اختيارية video-analyzer-tune تحسين قوالب المطالبات من المخرجات المحررة التمثيلية باستخدام DSPy MIPROv2، وكتابة المطالبات المضبوطة إلى ملفات منفصلة. تم إصدار المشروع بموجب ترخيص Apache ويتضمن وثائق الاستخدام والتصميم والمساهمة.