عن المشروع

FunClip هو تطبيق آلي لنسخ الفيديو وتوليد الترجمة وقص المقاطع. يعمل محليًا عبر واجهة ويب Gradio ويمكن تشغيله أيضًا من سطر الأوامر. سير العمل هو رفع فيديو، تشغيل التعرف على الكلام، فحص النص وملصقات المتحدثين، اختيار مقطع نصي واحد أو أكثر، وتصدير مقطع الفيديو المقابل مع ترجمات اختيارية. القدرات الأساسية - التعرف على كلام الفيديو باستخدام نماذج Paraformer المستندة إلى FunASR، بما في ذلك التنبؤ بالطوابع الزمنية للقص النصي. - دعم الكلمات المفتاحية عبر SeACo-Paraformer لتحسين التعرف على أسماء أو كيانات أو مصطلحات محددة. - التعرف على المتحدثين باستخدام CAM++، مما يسمح باختيار المقاطع بواسطة معرف متحدث معين تلقائيًا. - قص متعدد المقاطع من النص المعترف به. - توليد ترجمات SRT للفيديو الكامل وترجمات للمقاطع المستهدفة المحددة. - عرض ترجمات مدمج باستخدام Pillow وخط مرفق؛ ImageMagick مطلوب فقط لسير عمل MoviePy TextClip القديم. مسارات النماذج المتاحة - إعداد Paraformer الافتراضي لقص الفيديو الصيني. - التعرف الإنجليزي باستخدام خيار اللغة الإنجليزية. - Fun-ASR-Nano كخيار نقطة تحقق أعلى دقة. - SenseVoice للتعرف متعدد اللغات مع علامات العواطف والأحداث الصوتية. - MOSS-Transcribe-Diarize اختياري عبر خدمة vLLM محلية للنسخ الطويل، طوابع زمنية على مستوى المقطع، وملصقات متحدثين مجهولة. يقوم MOSS بالتجزئة والفصل بين المتحدثين من البداية إلى النهاية؛ تشير الوثائق إلى أن القص النصي الدقيق العشوائي لا يزال يتطلب طوابع زمنية من Paraformer. الاختيار المدعوم بالذكاء الاصطناعي والواعي بالمحتوى يمكن لـ FunClip استخدام نموذج لغوي لتحليل النص واقتراح مقاطع، ثم تمريرها إلى سير عمل القص بالذكاء الاصطناعي الحالي. يمكن تكوين OrcaRouter كبوابة اختيارية متوافقة مع OpenAI باستخدام مفتاح API ومتغيرات بيئية. للاختيار بناءً على المرئيات والصوت بدلاً من النص فقط، يمكن تفعيل TwelveLabs Pegasus اختياريًا؛ يتطلب حزمة twelvelabs ومفتاح API. خيارات الاستخدام يتم تشغيل خدمة Gradio المحلية باستخدام Python ويتم الوصول إليها عادةً على localhost:7860. تدعم خيارات المنفذ والوصول العام. يمكن للمستخدمين أيضًا تجربة المشروع عبر ModelScope أو Hugging Face Spaces. لاستخدام سطر الأوامر، يوفر FunClip عملية من مرحلتين: أولاً التعرف على الفيديو وكتابة مخرجات النص/الترجمات، ثم تشغيل مرحلة القص مع النص الهدف والإزاحات وملف الإخراج. التثبيت والترخيص يستخدم الإعداد الموثق بيئة افتراضية Python 3.12، وتثبيت PyTorch/torchaudio متوافق مع المنصة، ومتطلبات المشروع. يتطلب FunClip حاليًا funasr>=1.4.9 لمسارات توافق النماذج والترجمات. يتم تنزيل أوزان النماذج بشكل منفصل عند أول استخدام وتخضع لتراخيص النماذج الخاصة بها. يتم إصدار كود مصدر FunClip بموجب رخصة MIT.