প্রকল্প সম্পর্কে
LiveTalking হলো একটি ওপেন-সোর্স রিয়েল-টাইম ইন্টারেক্টিভ স্ট্রিমিং ডিজিটাল হিউম্যান ইঞ্জিন, যা টেক্সট বা ভয়েসের মাধ্যমে ভার্চুয়াল অ্যাভাটারকে চালিত করে অডিও-ভিডিও সিঙ্কড কথোপকথন সক্ষম করে। প্রজেক্টটি একাধিক ডিজিটাল হিউম্যান মডেল সমর্থন করে, যার মধ্যে রয়েছে ernerf, musetalk, wav2lip এবং Ultralight-Digital-Human। এতে সাউন্ড ক্লোন, কথা ভাঙা, ফুল-বডি ভিডিও拼接, একশন চেয়ারোগ্রাফি এবং কাস্টম ডিজিটাল হিউম্যান অ্যাভাটারের সুবিধা রয়েছে। সিস্টেমটি LLM-এর সাথে যুক্ত হয়ে উত্তর তৈরি করতে পারে, তারপর TTS-এর মাধ্যমে ভয়েস সিন্থেসাইজ করে ডিজিটাল হিউম্যানকে রিয়েল-টাইম লিপ-সিংকের মাধ্যমে চালিত করে, এবং শেষ পর্যন্ত WebRTC, RTMP বা ভার্চুয়াল ক্যামেরার মাধ্যমে আউটপুট প্রদান করে।
প্রজেক্টটি ব্রাউজার পেজ, HTTP API এবং ডেস্কটপ ক্লায়েন্টের মাধ্যমে সংযোগের সুযোগ দেয়। এতে Avatar জেনারেশন পেজ এবং ম্যানেজমেন্ট ব্যাকএন্ড অন্তর্ভুক্ত, যা ভিডিও আপলোড করে ডিজিটাল হিউম্যান তৈরি, সেশন স্ট্যাটাস মনিটর এবং গ্লোবাল কনফিগারেশন পরিবর্তনের সুবিধা প্রদান করে। এর মডিউলার আর্কিটেকচার API লেয়ার, লজিক লেয়ার, রেন্ডার লেয়ার, স্ট্রিমিং লেয়ার এবং প্লাগইন সিস্টেমকে কভার করে।
প্রজেক্টটি EdgeTTS, GPT-SoVITS, CosyVoice, Tencent Cloud-এর মতো TTS সলিউশন সমর্থন করে, এবং Qwen-এর মতো বড় ভাষা মডেল অথবা OpenAI-কম্প্যাটিবল গেটওয়ে-এর সাথে ইন্টিগ্রেশন সম্ভব।
প্রযোজ্য ক্ষেত্রগুলোর মধ্যে রয়েছে ভার্চুয়াল স্ট্রিমার এবং ই-কমার্স লাইভ শপিং, AI ডিজিটাল হিউম্যান কাস্টমার কেয়ার, অনলাইন শিক্ষা, স্মার্ট ভয়েস অ্যাসিস্ট্যান্ট, বড় স্ক্রিনের বর্ণনা এবং বাল্ক শর্ট ভিডিও তৈরি। প্রজেক্টটি ইনস্টলেশন গাইড, Docker ইমেজ, API ডকুমেন্টেশন এবং পারফরম্যান্স রেফারেন্স সরবরাহ করে, যা রিয়েল-টাইম ডিজিটাল হিউম্যান কথোপকথন এবং লাইভ স্ট্রিমিংয়ের প্রয়োজনীয় বিকাশকারীদের জন্য উপযোগী।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.