इस प्रोजेक्ट के बारे में
LivePortrait, "LivePortrait: Efficient Portrait Animation with Stitching and Retargeting Control" (arXiv 2407.03168) पेपर का आधिकारिक PyTorch कार्यान्वयन है, जिसे Kuaishou Technology, USTC और Fudan University के शोधकर्ताओं द्वारा विकसित किया गया है। यह प्रोजेक्ट ड्राइविंग वीडियो या मोशन टेम्पलेट से गति स्थानांतरित करके स्थिर पोर्ट्रेट या पोर्ट्रेट वीडियो को एनिमेट करता है।
README में वर्णित प्रमुख क्षमताएँ:
- मनुष्यों के लिए पोर्ट्रेट एनीमेशन, साथ ही बिल्लियों और कुत्तों के लिए Animals मोड (Animals मोड के लिए X-Pose आवश्यक है और यह केवल NVIDIA GPU वाले Linux/Windows पर परीक्षण किया गया है)।
- इमेज संचालित मोड और वीडियो संचालित मोड (पोर्ट्रेट वीडियो संपादन, v2v)।
- Gradio इंटरफ़ेस में स्टिचिंग और रीटार्गेटिंग नियंत्रण, क्षेत्रीय नियंत्रण और सटीक पोर्ट्रेट संपादन।
- मोशन टेम्पलेट फ़ाइलें (.pkl) जो अनुमान को तेज कर सकती हैं और ड्राइविंग वीडियो के वितरण से बचकर गोपनीयता की रक्षा करने में मदद करती हैं।
- समायोज्य स्केल और ऑफसेट विकल्पों के साथ ड्राइविंग वीडियो ऑटो-क्रॉपिंग।
- ऑडियो और वीडियो संयोजन समर्थन।
- मनुष्यों के लिए एक Gradio वेब इंटरफ़ेस और जानवरों के लिए एक अलग, जिसमें सर्वर पोर्ट, शेयरिंग और torch.compile त्वरण जैसे विकल्प शामिल हैं (Windows/macOS पर समर्थित नहीं)।
- प्रति-मॉड्यूल अनुमान प्रदर्शन मापने के लिए एक गति मूल्यांकन स्क्रिप्ट।
स्थापना और उपयोग:
- git, conda और FFmpeg आवश्यक हैं; Python 3.10 के साथ एक conda वातावरण बनाया जाता है, फिर requirements.txt (या Apple Silicon के लिए requirements_macOS.txt) से निर्भरताएँ स्थापित की जाती हैं।
- प्रीट्रेंड वेट HuggingFace (hf-mirror विकल्प के साथ) या Google Drive/Baidu Yun से डाउनलोड किए जाते हैं, और ./pretrained_weights में रखे जाते हैं।
- अनुमान मनुष्यों के लिए inference.py और जानवरों के लिए inference_animals.py के माध्यम से चलाया जाता है; स्रोत और ड्राइविंग इनपुट -s और -d के साथ निर्दिष्ट किए जाते हैं।
- Apple Silicon वाला macOS Humans मोड के लिए समर्थित है, जिसे RTX 4090 की तुलना में संभावित रूप से बहुत धीमा बताया गया है।
README में कई समुदाय-विकसित प्रोजेक्ट और एकीकरण भी सूचीबद्ध हैं, जिनमें ComfyUI नोड्स, Stable Diffusion WebUI एक्सटेंशन, FaceFusion, TensorRT-आधारित तेज़ संस्करण, और विभिन्न HuggingFace Spaces और प्लेग्राउंड शामिल हैं। यह FOMM, Open Facevid2vid, SPADE, InsightFace और X-Pose जैसे पिछले कार्यों को स्वीकार करता है, और डीपफेक जोखिमों और जिम्मेदार उपयोग के बारे में एक नैतिकता नोट शामिल करता है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.