इस प्रोजेक्ट के बारे में
ComfyUI-H3-FaceRefine MiniMax H3 वीडियो की पोस्ट-प्रोसेसिंग के लिए ComfyUI कस्टम नोड्स का एक सेट है। यह उस स्थिति को संबोधित करता है जहाँ H3 चेहरों को खराब रेंडर करता है क्योंकि सिर स्रोत फ़्रेम के केवल एक छोटे हिस्से में होता है। पाइपलाइन चेहरे का पता लगाती है और उसे ट्रैक करती है, क्रॉप को बड़े कैनवस में सामान्यीकृत करती है, उस क्रॉप को H3 से गुज़ारती है, और रिकॉर्ड किए गए क्रॉप ट्रांसफ़ॉर्म का उपयोग करके जनरेट किए गए चेहरे को मूल वीडियो में वापस सिलती है। इसका दृष्टिकोण Impact Pack के FaceDetailer पर आधारित है, लेकिन फ़्रेम-दर-फ़्रेम वीडियो कार्य के लिए विस्तारित है।
मुख्य घटकों में शामिल हैं:
- H3 Load Video + Face Select: वीडियो और ऑडियो लोड करता है, चेहरों का पता लगाता है, वैकल्पिक रूप से हार्ड कट का पता लगाता है, और ग्राफ़ चलने से पहले विषय का चयन करता है। यह मैनुअल Pick faces इंटरफ़ेस, रैंकिंग नियमों या पहचान संदर्भ छवि का उपयोग कर सकता है।
- H3 Face Track + Crop: प्रत्येक शॉट में चयनित विषय को ट्रैक करता है, क्रॉप और ट्रांसफ़ॉर्म डेटा तैयार करता है, कैनवस आयाम और फ़्रेम संख्या आउटपुट करता है,以及 स्मूथिंग, इंटरपोलेशन, अनुपस्थित चेहरों और शॉट सीमाओं को संभालता है।
- H3 Per-Frame Denoise: मॉडल-पाथ पैच के रूप में प्रति-फ़्रेम डिनॉइज़िंग नियंत्रण लागू करता है, MODEL इनपुट लेता और लौटाता है।
- H3 Face Stitch Back: परिष्कृत H3 आउटपुट को स्रोत फ़्रेम में वापस कंपोज़िट करता है और मूल ऑडियो पथ को सुरक्षित रखता है।
विषय चयन स्वचालित रैंकिंग मोड का समर्थन करता है, जैसे सबसे बड़ा, सबसे छोटा, सबसे बाएँ, सबसे दाएँ, सबसे ऊपर, सबसे नीचे, सबसे केंद्रीय, X/Y निर्देशांकों के सबसे निकट, और डिटेक्टर स्कोर। पहचान-आधारित चयन फ़ोटोग्राफ़िक चेहरों के लिए InsightFace का उपयोग कर सकता है, जबकि चित्रित या एनीमे सामग्री के लिए CLIP Vision या CCIP सुझाए जाते हैं। उपयोगकर्ता द्वारा आपूर्ति किया गया फेस डिटेक्टर आवश्यक है, जैसे face_yolov8m.pt; गैर-फ़ोटोग्राफ़िक सामग्री के लिए एनीमे फेस डिटेक्टर की सिफारिश की जाती है।
पैक वैकल्पिक हार्ड-कट पहचान के लिए PySceneDetect का उपयोग करता है। उपलब्ध होने पर, कट वीडियो को शॉट्स में विभाजित करते हैं ताकि प्रत्येक शॉट के लिए अलग से विषय चुना जा सके और कट के पार ट्रैकिंग को स्मूथ न किया जाए। यदि PySceneDetect अनुपलब्ध हो, तो वीडियो को एक ही शॉट माना जाता है। ट्रैकिंग रिपोर्ट लॉस्ट-फ़्रेम रेंज की पहचान करती हैं, और लॉस्ट फ़्रेम को पूर्वावलोकन में हाइलाइट किया जा सकता है। जब विषय गायब हो जाता है, तो ट्रैकर किसी अन्य व्यक्ति पर कूदने से बचता है और मूल पिक्सल बनाए रखने के लिए कंपोज़िट को फ़ेड आउट करते हुए क्रॉप को इंटरपोलेट कर सकता है।
दो एनोटेटेड वर्कफ़्लो टेम्पलेट शामिल हैं: Auto Select, जहाँ एक रैंकिंग नियम चेहरा चुनता है, और Manual Select, जहाँ उपयोगकर्ता प्रत्येक शॉट के लिए एक चेहरा चुनता है। टेम्पलेट ComfyUI के टेम्पलेट ब्राउज़र के माध्यम से उपलब्ध हैं और example_workflows निर्देशिका से भी लोड किए जा सकते हैं। वे H3 जनरेशन को स्रोत क्लिप के साथ संरेखित रखने के लिए ट्रैकिंग नोड की फ़्रेम संख्या और कैनवस आयामों का उपयोग करते हैं।
इंस्टॉलेशन रिपॉज़िटरी को ComfyUI/custom_nodes में क्लोन करके और ComfyUI को पुनरारंभ करके किया जाता है। नोड्स MiniMax H3/Face Refine मेनू के अंतर्गत दिखाई देते हैं। ultralytics, scipy, insightface और scenedetect सहित Python पैकेज प्रोजेक्ट requirements से इंस्टॉल किए जा सकते हैं। कोर MiniMax H3 नोड्स वाला हालिया ComfyUI बिल्ड आवश्यक है, साथ ही H3 मॉडल, टेक्स्ट एनकोडर और VAE भी, जब तक कि वे पहले से इंस्टॉल न हों।
उदाहरण वर्कफ़्लो अतिरिक्त रूप से सेव करने के लिए VideoHelperSuite, ऑडियो/लिपसिंक हैंडलिंग के लिए ComfyUI-H3-NativeAudioLock, और मॉडल-फ़ोल्डर पंजीकरण के लिए Impact Pack का उपयोग करते हैं। SAM और GGUF घटक मौजूद हैं लेकिन डिफ़ॉल्ट रूप से म्यूट हैं; SAM मॉडल, GGUF लोडर समर्थन, CLIP Vision, InsightFace मॉडल और turbo LoRAs वर्कफ़्लो कॉन्फ़िगरेशन के आधार पर वैकल्पिक हैं।
पूर्ण पथ पेस्ट करके लोड किए गए वीडियो के लिए, पैक ComfyUI की input निर्देशिका के बाहर स्थानीय पूर्वावलोकन सर्व करता है। H3_FACEREFINE_STRICT_PATHS को गैर-रिक्त मान पर सेट करने से वे रूट ComfyUI के अपने फ़ोल्डर के अंदर की फ़ाइलों तक सीमित हो जाते हैं, जो तब उपयोगी होता है जब ComfyUI लोकलहोस्ट से बाहर एक्सपोज़ किया गया हो।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.