इस प्रोजेक्ट के बारे में

VideoCaptioner एक बड़े भाषा मॉडल (LLM) पर आधारित वीडियो सबटाइटल प्रोसेसिंग टूल है, जो वॉइस रिकग्निशन, सबटाइटल ऑप्टिमाइज़ेशन, अनुवाद और वीडियो कंपोज़िशन की पूरी प्रक्रिया को कवर करता है। इंस्टालेशन pip install videocaptioner से होता है, साथ ही CLI कमांड लाइन और GUI डेस्कटॉप दोनों उपयोग विधियां उपलब्ध हैं। मुख्य सुविधाएं: - वॉइस ट्रांसक्रिप्शन: faster-whisper, whisper-api, bijian(मुफ्त), jianying(मुफ्त), whisper-cpp सहित कई इंजन का समर्थन करता है, शब्द-स्तरीय टाइमस्टैम्प और VAD (वाइस एक्टिविटी डिटेक्शन) से पहचान सटीकता बढ़ाता है। - सबटाइटल ऑप्टिमाइज़ेशन और अनुवाद: LLM का उपयोग करके अर्थ-आधारित वाक्यांश विभाजन करता है, जिससे पढ़ने का अनुभव प्रवाहमय हो; अनुवाद LLM, bing(मुफ्त), google(मुफ्त) सेवाओं का समर्थन करता है, संदर्भ-चेतना अनुवाद और रिवर्बल ऑप्टिमाइज़ेशन तंत्र है। - वीडियो कंपोज़िशन: सबटाइटल को सॉफ्ट या हार्ड सबटाइटल के रूप में वीडियो में एकीकृत कर सकता है। - वॉइसओवर जेनरेशन: सबटाइटल के आधार पर वॉइसओवर ट्रैक या वीडियो उत्पन्न कर सकता है। - ऑनलाइन वीडियो डाउनलोड: YouTube, Bilibili सहित कई प्लेटफॉर्म का समर्थन। - पूरा फ्लो प्रोसेसिंग: एक कमांड से ट्रांसक्रिप्शन → ऑप्टिमाइज़ेशन → अनुवाद → कंपोज़िशन। मुफ्त सुविधाएं (Bijian वॉइस रिकग्निशन, Bing/Google अनुवाद) बिना किसी कॉन्फ़िगरेशन के तुरंत उपयोग योग्य हैं। LLM सुविधाओं (सबटाइटल ऑप्टिमाइज़ेशन, बड़ा मॉडल अनुवाद) के लिए API Key की आवश्यकता होती है, सभी OpenAI-कम्पैटिबल इंटरफेस का समर्थन करता है, जिसमें VideoCaptioner ट्रांसिटर, SiliconCloud, DeepSeek आदि शामिल हैं। कॉन्फ़िगरेशन प्राथमिकता क्रम: कमांड पैरामीटर > एनवायरनमेंट वेरिएबल > कॉन्फ़िग फ़ाइल > डिफ़ॉल्ट मान। इसके अलावा, परियोजना Claude Code Skill प्रदान करती है, जिससे AI प्रोग्रामिंग असिस्टेंट सीधे VideoCaptioner का उपयोग कर वीडियो प्रोसेस कर सकते हैं। डेवलपमेंट के लिए uv का उपयोग डिपेंडेंसी मैनेजमेंट के लिए, pyright टाइप चेकिंग और pytest टेस्टिंग का समर्थन। परियोजना GPL-3.0 लाइसेंस के तहत उपलब्ध है।