عن المشروع

video-use هو مشروع مفتوح المصدر يتيح تحرير الفيديو عبر وكلاء البرمجة مثل Claude Code أو Codex أو Hermes. يضع المستخدمون اللقطات الخام في مجلد، ويتحدثون مع الوكيل، ويتلقون ملف final.mp4 جاهزاً. يعمل عبر أنواع المحتوى بما في ذلك المتحدثين على الشاشة، والمونتاج، والدراسات التعليمية، والسفر، والمقابلات، دون الحاجة إلى قوالب جاهزة أو قوائم. من بين القدرات الرئيسية: - قطع الكلمات الزائدة (مثل umm, uh، والبدايات الخاطئة) والفترات الصامتة بين اللقطات - الدرجنة اللونية التلقائية بدرجات دافئة سينمائية، أو حيوية متعادلة، أو سلاسل ffmpeg مخصصة - تلاشي صوتي مدته 30 مللي ثانية عند كل قطع لمنع طفرات الصوت - حرق الترجمات النصية بأساليب قابلة للتخصيص (كتل من كلمتين بأحرف كبيرة افتراضياً) - توليد طبقات رسوم متحركة عبر HyperFrames أو Remotion أو Manim أو PIL، يتم إنشاؤها في وكلاء فرعيين متوازيين - تقييم ذاتي للمخرجات المعروضة عند كل حدود القطع قبل عرض النتائج - حفظ ذاكرة الجلسة في project.md للاستمرارية عبر الجلسات يعمل النظام من خلال قراءة اللLM للفيديو عبر طبقتين بدلاً من مشاهدته. الطبقة الأولى هي نص صوتي من ElevenLabs Scribe يوفر توقيتات على مستوى الكلمات، وتقسيم المتحدثين، وأحداث صوتية، مُعبأة في ملف نصي بحجم ~12KB. الطبقة الثانية هي تركيب بصري عند الطلب (فيلم ستريب + موجة صوتية + تسميات الكلمات كصورة PNG) يُنشأ فقط عند نقاط القرار. يتجنب هذا النهج معالجة ملايين الرموز من الإطارات الخام. تسير العملية كالتالي: نسخ -> تعبئة -> استدلال LLM -> EDL -> عرض -> تقييم ذاتي، مع حلقة تقييم ذاتي تتحقق من المخرجات المعروضة عند حدود القطع ويمكنها إصلاح المشكلات حتى 3 مرات قبل تقديم المعاينة. يمكن الإعداد عبر لصق تلميح للتثبيت التلقائي أو يدوياً من خلال الاستنساخ، وتثبيت التبعيات (uv/pip, ffmpeg, yt-dlp)، وإضافة مفتاح API من ElevenLabs. تؤكد مبادئ التصميم على النصوص والصور عند الطلب، والصوت كأساس مع بقاء البصريات تابعة له، والموافقة على الاستراتيجية قبل التنفيذ، وعدم افتراض أي محتوى، و12 قاعدة إنتاج صارمة مع حرية فنية في باقي الجوانب.