প্রকল্প সম্পর্কে
# GPT-SoVITS
RVC-Boss তৈরি করা একটি শক্তিশালী ফিউ-শট ভয়েস কনভার্সন এবং টেক্সট-টু-স্পিচ (TTS) WebUI।
## ওভারভিউ
GPT-SoVITS ন্যূনতম প্রশিক্ষণ ডেটা দিয়ে ভয়েস ক্লোনিং সম্ভব করে। ৫ সেকেন্ডের ভোকাল নমুনা শূন্য-শট TTS এর জন্য যথেষ্ট, mentre প্রায় ১ মিনিট ডেটা দিয়ে মডেল ফাইন-টিউন করলে ভয়েস সাদৃশ্য এবং বাস্তবসম্মততা উন্নত হয়।
## প্রধান বৈশিষ্ট্য
১. **শূন্য-শট TTS** — তাৎক্ষণিক টেক্সট-টু-স্পিচ রূপান্তরের জন্য ৫ সেকেন্ডের ভোকাল নমুনা ইনপুট দিন।
২. **ফিউ-শট TTS** — উচ্চতর ফিডেলিটির জন্য ~১ মিনিট প্রশিক্ষণ ডেটা দিয়ে ফাইন-টিউন করুন।
৩. **ক্রস-লিঙ্গুয়াল সাপোর্ট** — প্রশিক্ষণ ডেটাসেট থেকে ভিন্ন ভাষায় ইনফারেন্স, ইংরেজি, জাপানি, কোরিয়ান, ক্যান্টোনিজ এবং চীনা ভাষা সাপোর্ট করে।
৪. **WebUI টুলস** — এकीকৃত পাইপলাইন যা অন্তর্ভুক্ত:
- UVR5 এর মাধ্যমে ভয়েস/অ্যাকম্পানিমেন্ট সেপারেশন
- স্বয়ংক্রিয় ট্রেনিং সেট সegmentation
- Fun-ASR-Nano, SenseVoice, বা ক্লাসিক FunASR ব্যবহার করে বহুভাষিক ASR
- ডেটাসেট তৈরির জন্য টেক্সট লেবেলিং
## ভার্সন
- **v2**: কোরিয়ান এবং ক্যান্টোনিজ সাপোর্ট যোগ হয়েছে, ২k থেকে ৫k ঘণ্টায় প্রিটেইন্ড মডেল বৃদ্ধি, নিম্ন-গুণমানের রেফারেন্স অডিওর জন্য সংশ্লেষণ মান উন্নত।
- **v3**: কম প্রশিক্ষণ ডেটায় উচ্চতর টিম্বার সাদৃশ্য, কম পুনরাবৃত্তি/ছোঁড় দিয়ে GPT জেনারেশন আরও স্থিতিশীল, সমৃদ্ধ আবেগপ্রবণ অভিব্যক্তি।
- **v4**: v3-এর অখণ্ড আপস্যাম্পলিং থেকে ধাতব আর্টিফ্যাক্ট ঠিক করেছে; ২৪k-এর বদলে নেটিভি ৪৮k অডিও আউটপুট করে।
- **v2Pro**: v2-স্তরের হার্ডওয়্যার প্রয়োজনীয়তা সহ v4-এর কর্মদক্ষতা প্রদান করে।
## ইনস্টলেশন
উইন্ডোজ, লিনাক্স (CUDA/ROCm), macOS (MPS/CPU), এবং Docker সহ সমর্থিত প্ল্যাটফর্ম রয়েছে।
- উইন্ডোজ ব্যবহারকারীরা [ইন্টিগ্রেটেড প্যাকেজ](https://huggingface.co/lj1995/GPT-SoVITS-windows-package) ডাউনলোড করে `go-webui.bat` চালু করতে পারেন।
- Conda-ভিত্তিক ইনস্টল: `conda create -n GPTSoVits python=3.10 && conda activate GPTSoVits && bash install.sh`
- Docker Hub-এ Docker ইমেজ উপলব্ধ।
- ক্লাউড ট্রেনিংয়ের জন্য Colab নোটবুক সরবরাহ করা হয়েছে।
## প্রিটেইন্ড মডেল
মডেলগুলো Hugging Face থেকে ডাউনলোড করে `GPT_SoVITS/pretrained_models` ফোল্ডারে রাখতে হবে। G2PW (চীনা টেক্সট ফ্রন্টএন্ড), UVR5 (ভয়েস সেপারেশন), এবং ASR ব্যাকএন্ড (FunASR, Faster Whisper)-এর জন্য অতিরিক্ত মডেল প্রয়োজন।
## ডেটাসেট ফরম্যাট
অ্যানোটেশন ফাইল ফরম্যাট:
```
vocal_path|speaker_name|language|text
```
ভাষা কোড: `zh` (চীনা), `ja` (জাপানি), `en` (ইংরেজি), `ko` (কোরিয়ান), `yue` (ক্যান্টোনিজ)।
## ব্যবহার
- WebUI চালু করুন: `python webui.py` অথবা `python GPT_SoVITS/inference_webui.py`
- ইন্টিগ্রেটেড প্যাকেজ ব্যবহারকারী: `go-webui.bat` / `go-webui-v2.bat` তে ডাবল-ক্লিক করুন
- UVR5 প্রসেসিং, অডিও segmentation, এবং ASR ট্রান্সক্রিপশনের জন্য কমান্ড-লাইন টুলস উপলব্ধ।
## ইনফারেন্স স্পিড
GPT-SoVITS v2 ProPlus-এর RTF বেঞ্চমার্ক: RTX 4060 Ti-তে 0.028, RTX 4090-এ 0.014, Apple M4 CPU-তে 0.526। Hugging Face Spaces-এ একটি অনলাইন ডেমো উপলব্ধ।
## ক্রেডিট
VITS, SoundStorm, HiFi-GAN, BigVGAN এবং অন্যান্য ওপেন-সোর্স স্পিচ সিন্থেসিস গবেষণার উপর ভিত্তি করে তৈরি। WebUI টুলসে UVR5, audio-slicer, FFmpeg, Gradio, এবং FunASR অন্তর্ভুক্ত।
## লাইসেন্স
MIT License।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.