عن المشروع
VideoCaptioner هو أداة معالجة ترجمة الفيديو تعتمد على النماذج اللغوية الكبيرة، تغطي كامل العملية من التعرف على الكلام إلى تحسين الترجمة والترجمة الفورية وتوليف الفيديو. يمكن تثبيته عبر pip install videocaptioner، ويوفر طريقتين للاستخدام: سطر الأوامر CLI والنسخة المكتبية GUI.
الوظائف الأساسية تشمل:
- التحويل الصوتي إلى نص: يدعم محركات متعددة مثل faster-whisper وwhisper-api وbijian (مجاني) وjianying (مجاني) وwhisper-cpp، مع استخدام الطوابع الزمنية على مستوى الكلمات وتقنية VAD لاكتشاف نشاط الكلام لتحسين دقة التعرف.
- تحسين الترجمة والترجمة الفورية: يستخدم LLM لفهم المعنى الدلالي وتقسيم الجمل بشكل طبيعي، مما يجعل قراءة الترجمة أكثر سلاسة؛ تدعم الترجمة الفورية خدمات LLM وbing (مجاني) وgoogle (مجاني)، مع آلية الترجمة بفهم السياق والتحسين التأملي.
- توليف الفيديو: يدعم حرق الترجمة في الفيديو كترجمة ناعمة أو ترجمة صلبة.
- توليد الدبلجة: يمكنه توليد مسار صوتي للدبلجة أو فيديو مدبلج استنادًا إلى الترجمة.
- تحميل الفيديو عبر الإنترنت: يدعم منصات مثل YouTube وBilibili.
- المعالجة الشاملة: يمكن إكمال كامل العملية من التحويل الصوتي إلى النص، التحسين، الترجمة، والتوليف بأمر واحد.
الوظائف المجانية (التعرف على الكلام عبر bijian/jianying، والترجمة عبر Bing/Google) لا تتطلب أي إعدادات. أما وظائف LLM (تحسين الترجمة والترجمة عبر النماذج الكبيرة) فتتطلب إعداد API Key، ويدعم جميع الواجهات المتوافقة مع OpenAI، بما في ذلك VideoCaptioner中转站 وSiliconCloud وDeepSeek. أولوية الإعدادات هي: معلمات سطر الأوامر > متغيرات البيئة > ملف الإعداد > القيم الافتراضية.
بالإضافة إلى ذلك، يوفر المشروع Claude Code Skill، الذي يسحب مساعد البرمجة AI لاستدعاء VideoCaptioner لمعالجة الفيديو مباشرة. فيما يتعلق بالتطوير، يستخدم uv لإدارة التبعيات، ويدعم pyright للتحقق من الأنواع وpytest للاختبارات. المشروع مرخص بموجب GPL-3.0.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.