इस प्रोजेक्ट के बारे में
FunClip एक स्वचालित वीडियो ट्रांसक्रिप्शन, सबटाइटल-निर्माण और क्लिपिंग एप्लिकेशन है। यह Gradio वेब इंटरफेस के माध्यम से स्थानीय रूप से चलता है और कमांड लाइन से भी संचालित किया जा सकता है। कार्यप्रवाह है: वीडियो अपलोड करना, भाषण पहचान चलाना, ट्रांसक्रिप्ट और स्पीकर लेबल का निरीक्षण करना, एक या अधिक टेक्स्ट सेगमेंट चुनना, और वैकल्पिक सबटाइटल के साथ संबंधित वीडियो क्लिप निर्यात करना।
मुख्य क्षमताएँ
- FunASR-आधारित Paraformer मॉडल का उपयोग करके वीडियो भाषण पहचान, जिसमें टेक्स्ट-आधारित क्लिपिंग के लिए टाइमस्टैम्प भविष्यवाणी शामिल है।
- निर्दिष्ट नामों, संस्थाओं, या अन्य शब्दों की पहचान सुधारने के लिए SeACo-Paraformer के माध्यम से हॉटवर्ड समर्थन।
- CAM++ के साथ स्पीकर पहचान, जिससे स्वचालित रूप से निर्धारित स्पीकर ID द्वारा क्लिप चयन संभव होता है।
- पहचाने गए ट्रांसक्रिप्ट से बहु-सेगमेंट क्लिपिंग।
- पूर्ण-वीडियो SRT सबटाइटल और चयनित लक्ष्य सेगमेंट के लिए सबटाइटल का निर्माण।
- Pillow और बंडल किए गए फ़ॉन्ट के साथ अंतर्निहित सबटाइटल रेंडरिंग; ImageMagick केवल पुराने MoviePy TextClip वर्कफ्लो के लिए आवश्यक है।
उपलब्ध मॉडल पथ
- चीनी वीडियो क्लिपिंग के लिए डिफ़ॉल्ट Paraformer सेटअप।
- अंग्रेजी भाषा विकल्प का उपयोग करके अंग्रेजी Paraformer पहचान।
- उच्च-सटीकता चेकपॉइंट विकल्प के रूप में Fun-ASR-Nano।
- भावना और ऑडियो-इवेंट टैग के साथ बहुभाषी ASR के लिए SenseVoice।
- लंबी-फॉर्म ट्रांसक्रिप्शन, सेगमेंट-स्तरीय टाइमस्टैम्प, और अनाम स्पीकर लेबल के लिए स्थानीय vLLM सेवा के माध्यम से वैकल्पिक MOSS-Transcribe-Diarize। MOSS अंत-से-अंत सेगमेंटेशन और डायराइज़ेशन करता है; दस्तावेज़ नोट करता है कि सटीक मनमाना टेक्स्ट क्लिपिंग के लिए अभी भी Paraformer टोकन टाइमस्टैम्प की आवश्यकता होती है।
AI-सहायता और सामग्री-जागरूक चयन
FunClip एक LLM का उपयोग करके ट्रांसक्रिप्ट का विश्लेषण कर सकता है और क्लिप सेगमेंट प्रस्तावित कर सकता है, जिन्हें फिर मौजूदा AI क्लिप वर्कफ्लो में भेजा जाता है। OrcaRouter को API कुंजी और पर्यावरण चर का उपयोग करके वैकल्पिक OpenAI-संगत गेटवे के रूप में कॉन्फ़िगर किया जा सकता है। केवल ट्रांसक्रिप्ट टेक्स्ट के बजाय दृश्य और ऑडियो पर आधारित चयन के लिए, TwelveLabs Pegasus को वैकल्पिक रूप से सक्षम किया जा सकता है; इसके लिए twelvelabs पैकेज और API कुंजी की आवश्यकता होती है।
उपयोग विकल्प
स्थानीय Gradio सेवा Python के साथ लॉन्च की जाती है और आमतौर पर localhost:7860 पर पहुँचा जाता है। यह पोर्ट और सार्वजनिक-पहुँच लॉन्च विकल्पों का समर्थन करता है। उपयोगकर्ता ModelScope या Hugging Face Spaces के माध्यम से भी परियोजना का प्रयास कर सकते हैं। कमांड-लाइन उपयोग के लिए, FunClip एक दो-चरणीय प्रक्रिया प्रदान करता है: पहले वीडियो को पहचानें और ट्रांसक्रिप्ट/SRT आउटपुट लिखें, फिर गंतव्य टेक्स्ट, ऑफसेट और आउटपुट फ़ाइल के साथ क्लिपिंग चरण चलाएँ।
स्थापना और लाइसेंसिंग
प्रलेखित सेटअप Python 3.12 वर्चुअल वातावरण, प्लेटफ़ॉर्म-संगत PyTorch/torchaudio स्थापना, और परियोजना आवश्यकताओं का उपयोग करता है। FunClip को वर्तमान में अपने मॉडल और सबटाइटल संगतता पथों के लिए funasr>=1.4.9 की आवश्यकता होती है। मॉडल वज़न पहले उपयोग पर अलग से डाउनलोड किए जाते हैं और उनके संबंधित मॉडल लाइसेंस द्वारा शासित होते हैं। FunClip स्रोत कोड MIT लाइसेंस के तहत जारी किया गया है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.