منصوبے کے بارے میں

ویڈیو اینالائزر ایک کمانڈ لائن ٹول ہے جو بصری اور آڈیو معلومات دونوں سے ویڈیو مواد کی وضاحتیں تیار کرتا ہے۔ اس کا پائپ لائن تین اہم مراحل پر مشتمل ہے: کلیدی فریم نکالنا اور آڈیو پروسیسنگ، فریم بہ فریم بصری تجزیہ، اور حتمی ویڈیو تعمیر نو۔ اینالائزر OpenCV کا استعمال کرتے ہوئے کلیدی فریم منتخب کرتا ہے اور OpenAI Whisper کے ذریعے دستیاب آڈیو کو نقل کرتا ہے، جس میں خراب معیار کی آڈیو کی جانچ بھی شامل ہے۔ نکالے گئے ہر فریم کو بصری صلاحیتوں والے لینگویج ماڈل کو بھیجا جاتا ہے، جس میں پچھلے فریموں کے سیاق و سباق کو استعمال کرتے ہوئے وقتی ترتیب کو برقرار رکھا جاتا ہے۔ پھر فریم تجزیوں اور نقل کو ایک جامع وضاحت میں ملایا جاتا ہے۔ ڈیفالٹ طور پر، مقامی انفرنس Ollama کے ساتھ Llama 3.2 Vision ماڈل کا استعمال کرتی ہے؛ صارفین متبادل طور پر CLI آپشنز یا JSON کنفیگریشن فائل کے ذریعے کوئی بھی OpenAI کے مطابق اینڈ پوائنٹ، جیسے OpenAI یا OpenRouter، ترتیب دے سکتے ہیں۔ رپورٹ کردہ خصوصیات میں کلاؤڈ سروسز یا API کیز کے بغیر مکمل طور پر مقامی آپریشن، اختیاری کلاؤڈ APIs، قابل ترتیب Whisper اور ویژن ماڈلز، حسب ضرورت پرامپٹس، میٹا ڈیٹا، نقل، فریم تجزیوں، اور حتمی وضاحت پر مشتمل تفصیلی JSON آؤٹ پٹ، اور ایک جھرن کنفیگریشن سسٹم شامل ہے جہاں کمانڈ لائن آرگیومنٹس صارف کی کنفیگریشن اور ڈیفالٹس کو اوور رائیڈ کرتے ہیں۔ ضروریات میں Python 3.11 یا نیا ورژن اور FFmpeg شامل ہیں۔ README مقامی LLM عملدرآمد کے لیے کافی RAM اور GPU/Apple Silicon ہارڈویئر کی سفارش کرتا ہے، جبکہ API پر مبنی استعمال ان مقامی ماڈل کی ضروریات سے بچاتا ہے۔ انسٹالیشن ریپوزٹری کو کلون کرکے اور اسے pip کے ساتھ انسٹال کرکے کی جاتی ہے۔ ایک اختیاری video-analyzer-tune پیکیج DSPy MIPROv2 کا استعمال کرتے ہوئے نمائندہ ترمیم شدہ آؤٹ پٹس سے پرامپٹ ٹیمپلیٹس کو بہتر بنا سکتا ہے، اور ٹیونڈ پرامپٹس کو علیحدہ فائلوں میں لکھتا ہے۔ یہ پروجیکٹ Apache License کے تحت جاری کیا گیا ہے اور اس میں استعمال، ڈیزائن، اور شراکت کی دستاویزات شامل ہیں۔