इस प्रोजेक्ट के बारे में
OpenClip एक Python, FFmpeg और uv पर आधारित स्वचालित वीडियो प्रसंस्करण उपकरण है, जो मुख्य रूप से मौखिक प्रस्तुति, लाइव स्ट्रीम रीप्ले, साक्षात्कार, पॉडकास्ट आदि लंबे वीडियो से उत्कृष्ट अंशों की पहचान और निर्यात करने के लिए उपयोग किया जाता है। उपयोगकर्ता द्वारा वीडियो URL या स्थानीय फ़ाइल इनपुट करने के बाद, प्रक्रिया में वीडियो डाउनलोड या सत्यापन, प्लेटफ़ॉर्म उपशीर्षक या स्थानीय वॉयस ट्रांसक्रिप्शन प्राप्त करना, लंबे वीडियो को विभाजित करना, AI विश्लेषण और उम्मीदवार अंशों का संकलन, क्लिप जनरेशन, उपशीर्षक फ़ाइल जनरेशन, कवर छवि जनरेशन, और वैकल्पिक शीर्षक जोड़ना और उपशीर्षक बर्न करना शामिल है।
मुख्य क्षमताओं में शामिल हैं:
- Bilibili, YouTube वीडियो लिंक और स्थानीय वीडियो फ़ाइलों का समर्थन; Streamlit ब्राउज़र अपलोड का भी समर्थन करता है।
- ट्रांसक्रिप्शन के लिए प्लेटफ़ॉर्म उपशीर्षक को प्राथमिकता; स्थानीय ASR भाषा के अनुसार रूट कर सकता है, अंग्रेजी के लिए Whisper, चीनी के लिए वैकल्पिक रूप से Paraformer, और अनुपलब्ध होने पर Whisper पर वापस आना।
- AI सामग्री, अंतःक्रियाशीलता और मनोरंजन मूल्य जैसे आयामों के आधार पर हाइलाइट्स का चयन करता है, और --user-intent के माध्यम से प्राकृतिक भाषा में ध्यान केंद्रित करने के विषय निर्दिष्ट किए जा सकते हैं; होस्ट पृष्ठभूमि जानकारी और कस्टम प्रॉम्प्ट टेम्पलेट भी जोड़े जा सकते हैं।
- अंशों की संख्या, अवधि प्रीसेट, शीर्षक शैली, फ़ॉन्ट आकार, कवर टेक्स्ट स्थिति और रंग जैसे पैरामीटर का समर्थन करता है।
- स्वचालित रूप से स्वतंत्र वीडियो क्लिप, SRT उपशीर्षक, सारांश Markdown और कवर छवियाँ आउटपुट करता है।
- वैकल्पिक गहन अनुकूलन मोड, जो उम्मीदवार अंशों के संकलन के बाद AI पुनरीक्षण, सीमा सुधार और पुनः पुनरीक्षण जोड़ता है ताकि अंशों को स्वतंत्र खंडों के रूप में बेहतर बनाया जा सके।
- वैकल्पिक उपशीर्षक हार्डबर्न, जिसके लिए libass के साथ FFmpeg की आवश्यकता होती है; चयनित LLM के माध्यम से अनुवाद और द्विभाषी उपशीर्षक बर्न भी किया जा सकता है।
- पूर्वावलोकन संस्करण में वक्ता पहचान, संदर्भ ऑडियो के आधार पर वक्ता के नाम को लेबल कर सकता है, जो बहु-व्यक्ति संवाद परिदृश्यों के लिए उपयुक्त है; इसके लिए अतिरिक्त speakers निर्भरता स्थापित करने और HuggingFace टोकन कॉन्फ़िगर करने की आवश्यकता है।
- पोस्ट-प्रोसेसिंग Clip Editor एकल अंश की सीमाओं, उपशीर्षक, कवर शीर्षक को समायोजित करने और गति बढ़ाकर पुनः रेंडर करने का समर्थन करता है।
उपकरण तीन इंटरफ़ेस प्रदान करता है: Streamlit वेब इंटरफ़ेस बैकग्राउंड कार्य, मल्टी-टास्क समवर्ती, कार्य स्थिरता, प्रगति ट्रैकिंग, कुकी मोड कॉन्फ़िगरेशन और LAN एक्सेस का समर्थन करता है; CLI स्क्रिप्टेड प्रसंस्करण के लिए उपयुक्त है; Agent Skills को Claude Code, TRAE, Cursor आदि जैसे कौशल-समर्थित एजेंटों द्वारा कॉल किया जा सकता है, जो प्राकृतिक भाषा में वीडियो प्रसंस्करण कार्य शुरू करते हैं।
AI इंटरफ़ेस Qwen, OpenRouter, Zhipu GLM, MiniMax, और कस्टम OpenAI-संगत इंटरफ़ेस का समर्थन करता है, जो LM Studio, vLLM, One API, New API आदि सेवाओं से जुड़ सकता है। रिमोट डाउनलोड तीन मोड का समर्थन करता है: कुकी के बिना, ब्राउज़र कुकी, और Netscape प्रारूप cookies.txt; YouTube के लिए कुछ परिदृश्यों में Deno या Node स्थापित करने की सलाह दी जाती है। प्रसंस्करण परिणाम डिफ़ॉल्ट रूप से processed_videos के अंतर्गत सहेजे जाते हैं, और downloads, splits, clips, clips_post_processed आदि निर्देशिकाओं में व्यवस्थित होते हैं। परियोजना MIT लाइसेंस के तहत है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.