منصوبے کے بارے میں
VideoCaptioner ایک بڑے زبانی ماڈل پر مبنی ویڈیو سب ٹائٹل پروسیسنگ ٹول ہے جو آواز کی شناخت، سب ٹائٹل بہتری، ترجمہ، ویڈیو کمپوزیشن کے مکمل عمل کو کور کرتا ہے۔ انسٹالیشن کا طریقہ `pip install videocaptioner` ہے، ساتھ ہی CLI کمانڈ لائن اور GUI ڈیسک ٹاپ ورژن دونوں استعمال کے دستیاب ہیں۔
اہم خصوصیات:
- آواز ٹرانسکرپشن: faster-whisper، whisper-api,bijian(مفت)، jianying(مفت)، whisper-cpp سمیت متعدد انجنز کی حمایت کرتا ہے، لفظی سطح کے ٹائم اسٹیمپس اور VAD وائس ایکٹیویٹی ڈیٹیکشن سے شناخت کی درستگی بہتر بناتا ہے۔
- سب ٹائٹل بہتری اور ترجمہ: LLM کا استعمال کر کے سیماںی فہم کے ذریعے جملہ بندی کرتا ہے تاکہ سب ٹائٹل کا قرائت کا تجربہ قدرتی اور ہموار ہو؛ ترجمہ LLM، bing(مفت)، google(مفت) جیسی خدمات کی حمایت کرتا ہے، سیاق و سباق سے آگاہ ترجمہ اور عکاسی بہتری میکانزم موجود ہے۔
- ویڈیو کمپوزیشن: سب ٹائٹلز کو نرم یا سخت سب ٹائٹل کے طور پر ویڈیو میں شامل کرنے کی سہولت۔
- آواز پیداوار: سب ٹائٹلز کی بنیاد پر آواز کی ٹریک یا ویڈیو تیار کر سکتا ہے۔
- آن لائن ویڈیو ڈاؤن لوڈ: YouTube، B站 جیسے پلیٹ فارمز کی حمایت۔
- مکمل پائپ لائن پروسیسنگ: ایک کمانڈ سے ٹرانسکرپشن→بہتری→ترجمہ→کمپوزیشن تک۔
مفت خصوصیات(بی جیان آواز شناخت، بینگ/گوگل ترجمہ) کو کسی بھی ترتیب کے بغیر استعمال کیا جا سکتا ہے۔ LLM خصوصیات(سب ٹائٹل بہتری، بڑے ماڈل ترجمہ) کے لیے API Key کی ترتیب درکار ہے، تمام OpenAI ہم آہنگ انٹرفیسز کی حمایت کرتا ہے جن میں VideoCaptioner ٹرانزٹ اسٹیشن، SiliconCloud، DeepSeek وغیرہ شامل ہیں۔ ترتیب کی ترجیح: کمانڈ لائن پیرامیٹرز > ماحولیاتی متغیرات > کنفیگریشن فائل > ڈیفالٹ ویلیوز۔
اس کے علاوہ، پروجیکٹ میں Claude Code Skill شامل ہے جس سے AI پروگرامنگ اسسٹنٹ براہ راست VideoCaptioner کا استعمال کرتے ہوئے ویڈیو پروسیس کر سکتا ہے۔ ترقی کے لحاظ سے `uv` سے dependenciess的管理,pyright قسم کی جانچ اور pytest ٹیسٹنگ کی حمایت۔ پروجیکٹ GPL-3.0 لائسنس کے تحت ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.