প্রকল্প সম্পর্কে
YuE2 হলো multimodal-art-projection গ্রুপের (HKUST, M·A·P, Tokenwave.AI, NYU, Stanford, MBZUAI, NOIZ, ACE Studio) একটি মিউজিক জেনারেশন প্রকল্প। এর ঘোষিত লক্ষ্য হলো সিম্বলিক এবং অডিও মিউজিক জেনারেশনকে একীভূত করা: গানের কথা এবং স্টাইল প্রম্পট দেওয়া হলে, এটি প্রথমে একটি মেলোডি-এবং-কর্ড পরিকল্পনা লেখে, তারপর সেই পরিকল্পনাটিকে ভোকাল এবং অ্যাকম্প্যানিমেন্টসহ একটি সম্পূর্ণ গান হিসেবে বাস্তবায়ন করে।
README-তে বর্ণিত মূল ক্ষমতাগুলি:
- সিম্বলিক প্ল্যানিং একটি হোয়াইট-বক্স ইন্টারফেস হিসেবে। তৈরি করা কম্পোজিশনটি একটি এডিটযোগ্য স্কোর (ABC নোটেশন) যা একজন ব্যক্তি বা এজেন্ট রেন্ডার করার আগে পড়তে, বাজাতে, পরীক্ষা করতে এবং সংশোধন করতে পারে। মেলোডি এবং কর্ড স্পষ্ট নিয়ন্ত্রণে পরিণত হয়।
- জিরো-শট কভার। একটি উৎস রেকর্ডিং সহচর SheetSage2 মডেল দিয়ে ট্রান্সক্রাইব করা যেতে পারে, এবং ফলস্বরূপ মেলোডি স্কোর একটি নতুন স্টাইলে পুনরায় রেন্ডার করা যেতে পারে। README কভারের জন্য কর্ড সিম্বল ছাড়া স্কোরসহ cot="melody" ব্যবহার করার পরামর্শ দেয়, যাতে অ্যাকম্প্যানিমেন্ট নতুন স্টাইলের সাথে খাপ খায়।
- এজেন্টিক মিউজিক এডিটিং। একটি পরিকল্পনা এক্সপোর্ট করা, সংশোধন করা (হারমোনি, মেলোডি, টেম্পো, ফর্ম, গানের কথা) এবং একটি নতুন সম্পূর্ণ রেকর্ডিং হিসাবে পুনরায় রেন্ডার করা যেতে পারে। README নোট করে যে এডিটিং একটি নতুন রেকর্ডিং তৈরি করে এবং এডিটের বাইরে মূল ওয়েভফর্ম সংরক্ষণ করে না।
- একটি এজেন্ট স্কিল প্যাকেজ (skills/yue2-music/SKILL.md) যা নথিভুক্ত করে যে কীভাবে একজন এজেন্ট গান তৈরি করতে পারে, রেকর্ডিং ট্রান্সক্রাইব এবং কভার করতে পারে, ABC স্কোর এডিট করতে পারে, মিউজিক্যাল ইনভেরিয়েন্ট পরীক্ষা করতে পারে এবং শোনার তুলনা সংগঠিত করতে পারে।
স্থাপত্য এবং পাইপলাইন: একটি একক AR–NAR Mixture-of-Transformers ব্যাকবোন অটোরিগ্রেসিভভাবে স্কোর এবং সিমেন্টিক টোকেন পূর্বাভাস দেয়, তারপর ফ্লো ম্যাচিং দিয়ে অ্যাকোস্টিক ল্যাটেন্ট তৈরি করে; একটি VAE ল্যাটেন্টকে 48 kHz স্টেরিও অডিওতে ডিকোড করে। স্তরযুক্ত Python API plan() → generate_semantic() → synthesize() → decode() এক্সপোজ করে। জেনারেশন মোডগুলির মধ্যে রয়েছে cot="full" (এডিটযোগ্য মেলোডি-এবং-কর্ড পরিকল্পনা, ডিফল্ট), cot="melody" (ফ্রি অ্যাকম্প্যানিমেন্টসহ মেলোডি পরিকল্পনা, কভারের জন্য প্রস্তাবিত), cot="off" (সরাসরি গানের কথা এবং স্টাইল থেকে), এবং abc=... নিজের স্কোর সরবরাহ করতে।
প্রয়োজনীয়তা এবং দ্রুত শুরু: Linux, Python 3.12, BF16 সমর্থন এবং 24 GB VRAM সহ একটি NVIDIA GPU। ইনস্টলেশনটি রিপোজিটরি ক্লোন থেকে pip install . এর মাধ্যমে, তারপর examples/generate.py দিয়ে। প্রথম ব্যবহারে Hugging Face থেকে মডেল ফাইল ডাউনলোড হয়। আউটপুটে অডিওর সাথে স্কোর, সিমেন্টিক টোকেন, অ্যাকোস্টিক ল্যাটেন্ট, জেনারেশন সেটিংস এবং মডেল পরিচয় রক্ষিত থাকে।
সহচর মডেল এবং রিসোর্স: YuE2-3B (জেনারেশন, প্ল্যানিং, কভারিং, এডিটিং), YuE2-Vae এবং YuE2-Vae-legacy (ডিকোডার), SheetSage2 (অডিও-টু-স্কোর ট্রান্সক্রিপশন), MERT-v2-FullSong এবং MERT-v2-30s (মিউজিক রিপ্রেজেন্টেশন), এবং WildSongBench মূল্যায়ন ডেটাসেট। জেনারেশনের জন্য MERT2 ফিচার এক্সট্রাকশন ঐচ্ছিক।
README WildSongBench (192 প্রম্পট, স্বয়ংক্রিয় মূল্যায়ন)-এ YuE2-কে বেশ কয়েকটি প্রোপ্রাইটারি এবং ওপেন সিস্টেমের সাথে তুলনা করে বেঞ্চমার্ক ফলাফল রিপোর্ট করে, এবং 948টি কাজের উপর জিরো-শট কভার ফলাফল রিপোর্ট করে। এটি MARBLE এবং GTZAN-এ MERT2 ফলাফল এবং ট্রান্সক্রিপশন বেঞ্চমার্কে SheetSage2 ফলাফলও রিপোর্ট করে। এগুলি প্রকল্পের নিজস্ব রিপোর্ট করা পরিসংখ্যান; README নিজেই নোট করে যে র্যাঙ্কিং মেট্রিক অনুযায়ী পরিবর্তিত হয় এবং শীর্ষ গড়ের মধ্যে ছোট ব্যবধান পরিসংখ্যানগত তাৎপর্য প্রতিষ্ঠা করে না।
লাইসেন্সিং: ফার্স্ট-পার্টি কোড, এজেন্ট স্কিল এবং ডকুমেন্টেশন Apache 2.0; মডেল ওয়েট আলাদাভাবে CC BY-NC 4.0 লাইসেন্সযুক্ত; থার্ড-পার্টি কম্পোনেন্ট তাদের মূল লাইসেন্স ধরে রাখে। পূর্ববর্তী YuE-v1 কোড, ডকুমেন্টেশন এবং লাইসেন্স একটি আলাদা ব্রাঞ্চে সংরক্ষিত আছে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.