প্রকল্প সম্পর্কে

# GPT-SoVITS RVC-Boss তৈরি করা একটি শক্তিশালী ফিউ-শট ভয়েস কনভার্সন এবং টেক্সট-টু-স্পিচ (TTS) WebUI। ## ওভারভিউ GPT-SoVITS ন্যূনতম প্রশিক্ষণ ডেটা দিয়ে ভয়েস ক্লোনিং সম্ভব করে। ৫ সেকেন্ডের ভোকাল নমুনা শূন্য-শট TTS এর জন্য যথেষ্ট, mentre প্রায় ১ মিনিট ডেটা দিয়ে মডেল ফাইন-টিউন করলে ভয়েস সাদৃশ্য এবং বাস্তবসম্মততা উন্নত হয়। ## প্রধান বৈশিষ্ট্য ১. **শূন্য-শট TTS** — তাৎক্ষণিক টেক্সট-টু-স্পিচ রূপান্তরের জন্য ৫ সেকেন্ডের ভোকাল নমুনা ইনপুট দিন। ২. **ফিউ-শট TTS** — উচ্চতর ফিডেলিটির জন্য ~১ মিনিট প্রশিক্ষণ ডেটা দিয়ে ফাইন-টিউন করুন। ৩. **ক্রস-লিঙ্গুয়াল সাপোর্ট** — প্রশিক্ষণ ডেটাসেট থেকে ভিন্ন ভাষায় ইনফারেন্স, ইংরেজি, জাপানি, কোরিয়ান, ক্যান্টোনিজ এবং চীনা ভাষা সাপোর্ট করে। ৪. **WebUI টুলস** — এकीকৃত পাইপলাইন যা অন্তর্ভুক্ত: - UVR5 এর মাধ্যমে ভয়েস/অ্যাকম্পানিমেন্ট সেপারেশন - স্বয়ংক্রিয় ট্রেনিং সেট সegmentation - Fun-ASR-Nano, SenseVoice, বা ক্লাসিক FunASR ব্যবহার করে বহুভাষিক ASR - ডেটাসেট তৈরির জন্য টেক্সট লেবেলিং ## ভার্সন - **v2**: কোরিয়ান এবং ক্যান্টোনিজ সাপোর্ট যোগ হয়েছে, ২k থেকে ৫k ঘণ্টায় প্রিটেইন্ড মডেল বৃদ্ধি, নিম্ন-গুণমানের রেফারেন্স অডিওর জন্য সংশ্লেষণ মান উন্নত। - **v3**: কম প্রশিক্ষণ ডেটায় উচ্চতর টিম্বার সাদৃশ্য, কম পুনরাবৃত্তি/ছোঁড় দিয়ে GPT জেনারেশন আরও স্থিতিশীল, সমৃদ্ধ আবেগপ্রবণ অভিব্যক্তি। - **v4**: v3-এর অখণ্ড আপস্যাম্পলিং থেকে ধাতব আর্টিফ্যাক্ট ঠিক করেছে; ২৪k-এর বদলে নেটিভি ৪৮k অডিও আউটপুট করে। - **v2Pro**: v2-স্তরের হার্ডওয়্যার প্রয়োজনীয়তা সহ v4-এর কর্মদক্ষতা প্রদান করে। ## ইনস্টলেশন উইন্ডোজ, লিনাক্স (CUDA/ROCm), macOS (MPS/CPU), এবং Docker সহ সমর্থিত প্ল্যাটফর্ম রয়েছে। - উইন্ডোজ ব্যবহারকারীরা [ইন্টিগ্রেটেড প্যাকেজ](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) ডাউনলোড করে `go-webui.bat` চালু করতে পারেন। - Conda-ভিত্তিক ইনস্টল: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh` - Docker Hub-এ Docker ইমেজ উপলব্ধ। - ক্লাউড ট্রেনিংয়ের জন্য Colab নোটবুক সরবরাহ করা হয়েছে। ## প্রিটেইন্ড মডেল মডেলগুলো Hugging Face থেকে ডাউনলোড করে `GPT_SoVITS/pretrained_models` ফোল্ডারে রাখতে হবে। G2PW (চীনা টেক্সট ফ্রন্টএন্ড), UVR5 (ভয়েস সেপারেশন), এবং ASR ব্যাকএন্ড (FunASR, Faster Whisper)-এর জন্য অতিরিক্ত মডেল প্রয়োজন। ## ডেটাসেট ফরম্যাট অ্যানোটেশন ফাইল ফরম্যাট: ``` vocal_path|speaker_name|language|text ``` ভাষা কোড: `zh` (চীনা), `ja` (জাপানি), `en` (ইংরেজি), `ko` (কোরিয়ান), `yue` (ক্যান্টোনিজ)। ## ব্যবহার - WebUI চালু করুন: `python webui.py` অথবা `python GPT_SoVITS/inference_webui.py` - ইন্টিগ্রেটেড প্যাকেজ ব্যবহারকারী: `go-webui.bat` / `go-webui-v2.bat` তে ডাবল-ক্লিক করুন - UVR5 প্রসেসিং, অডিও segmentation, এবং ASR ট্রান্সক্রিপশনের জন্য কমান্ড-লাইন টুলস উপলব্ধ। ## ইনফারেন্স স্পিড GPT-SoVITS v2 ProPlus-এর RTF বেঞ্চমার্ক: RTX 4060 Ti-তে 0.028, RTX 4090-এ 0.014, Apple M4 CPU-তে 0.526। Hugging Face Spaces-এ একটি অনলাইন ডেমো উপলব্ধ। ## ক্রেডিট VITS, SoundStorm, HiFi-GAN, BigVGAN এবং অন্যান্য ওপেন-সোর্স স্পিচ সিন্থেসিস গবেষণার উপর ভিত্তি করে তৈরি। WebUI টুলসে UVR5, audio-slicer, FFmpeg, Gradio, এবং FunASR অন্তর্ভুক্ত। ## লাইসেন্স MIT License।