প্রকল্প সম্পর্কে
MOSS-TTS-Nano হলো MOSI.AI এবং OpenMOSS টিমের একটি ওপেন-সোর্স বহুভাষিক স্পিচ জেনারেশন মডেল। প্রায় 0.1B প্যারামিটার সহ, এটি রিয়েল-টাইম স্পিচ জেনারেশন লক্ষ্য করে এবং GPU ছাড়াই CPU-তে চলতে পারে, যা স্থানীয় ডেমো, ওয়েব সার্ভিং এবং লাইটওয়েট ইন্টিগ্রেশনের জন্য ডিপ্লয়মেন্ট সহজ করে।
README-তে বর্ণিত প্রধান বৈশিষ্ট্যগুলি:
- প্রায় 0.1B প্যারামিটারের ছোট মডেল সাইজ।
- নেটিভ 48 kHz, 2-চ্যানেল (স্টেরিও) অডিও আউটপুট।
- ২০টি ভাষার জন্য বহুভাষিক সমর্থন, যার মধ্যে চীনা, ইংরেজি, জার্মান, স্প্যানিশ, ফরাসি, জাপানি, ইতালীয়, হাঙ্গেরিয়ান, কোরিয়ান, রাশিয়ান, ফার্সি, আরবি, পোলিশ, পর্তুগিজ, চেক, ডেনিশ, সুইডিশ, গ্রীক এবং তুর্কি অন্তর্ভুক্ত।
- অডিও টোকেনাইজার প্লাস LLM পাইপলাইনের উপর নির্মিত বিশুদ্ধ অটোরিগ্রেসিভ আর্কিটেকচার।
- কম রিয়েল-টাইম লেটেন্সি এবং দ্রুত প্রথম অডিও সহ স্ট্রিমিং ইনফারেন্স।
- CPU-বান্ধব: স্ট্রিমিং জেনারেশন একটি 4-কোর CPU-তে চলতে পারে।
- স্বয়ংক্রিয় চাঙ্কড ভয়েস ক্লোনিং সহ দীর্ঘ-টেক্সট ক্ষমতা।
- সরাসরি Python স্ক্রিপ্ট এবং একটি প্যাকেজড CLI-এর মাধ্যমে ওপেন-সোর্স ডিপ্লয়মেন্ট পাথ।
কুইকস্টার্ট: README একটি পরিষ্কার Python পরিবেশ, রিপোজিটরি ক্লোন করা, প্রয়োজনীয়তা ইনস্টল করা এবং প্রজেক্টটি এডিটেবল মোডে ইনস্টল করার পরামর্শ দেয় যাতে moss-tts-nano কমান্ডটি উপলব্ধ হয়। ডিফল্ট মডেল লোডিং OpenMOSS-Team/MOSS-TTS-Nano এবং OpenMOSS-Team/MOSS-Audio-Tokenizer-Nano ব্যবহার করে। ভয়েস ক্লোনিং প্রধান প্রস্তাবিত ওয়ার্কফ্লো, যা infer.py ব্যবহার করে একটি প্রম্পট অডিও পাথ এবং ইনপুট টেক্সট সহ প্রদর্শিত হয়। একটি স্থানীয় FastAPI ওয়েব ডেমো app.py দিয়ে চালু করা যেতে পারে এবং 127.0.0.1:18083-এ খোলা যেতে পারে।
ONNX CPU ইনফারেন্স: লাইটওয়েট স্থানীয় ডিপ্লয়মেন্টের জন্য একটি ONNX CPU সংস্করণ সুপারিশ করা হয়। এটি ইনফারেন্সের সময় PyTorch নির্ভরতা সরিয়ে দেয়, ONNX Runtime CPU-তে চলে, সরাসরি রেফারেন্স অডিও, বিল্ট-ইন ভয়েস এবং রিয়েলটাইম স্ট্রিমিং ডিকোড সমর্থন করে এবং প্রজেক্টের পরীক্ষায় মূল সংস্করণের তুলনায় প্রায় 2x বেশি প্রসেসিং-দক্ষ বলে বর্ণনা করা হয়েছে। MacBook Air M4-এ, একটি একক CPU কোর দিয়ে মসৃণ ইনফারেন্স লক্ষ্য করা গেছে। ONNX এন্ট্রিপয়েন্টগুলির মধ্যে রয়েছে infer_onnx.py, app_onnx.py এবং --backend onnx সহ প্যাকেজড CLI। onnxruntime-gpu এবং --execution-provider cuda এর মাধ্যমে CUDA এক্সিকিউশন ঐচ্ছিক। অনুপস্থিত মডেল ফাইলগুলি প্রথম রানে ONNX Hugging Face রিপোজিটরি থেকে ডাউনলোড করা হয়।
অতিরিক্ত টুলিং: examples/android_onnx_runtime-এর অধীনে একটি Android ONNX Runtime উদাহরণ ডিভাইসে রপ্তানি করা ONNX গ্রাফ লোড করে এবং একটি WAV ফাইল লেখে। onnx/-এর অধীনে একটি এক্সপোর্টার একটি স্থানীয় Hugging Face-ফরম্যাট চেকপয়েন্টকে একটি TTS-শুধু ONNX মডেল ডিরেক্টরিতে রূপান্তর করে। প্যাকেজড CLI moss-tts-nano generate এবং moss-tts-nano serve কমান্ড অফার করে, যার মধ্যে প্রম্পট স্পিচ, টেক্সট ফাইল, ব্যাকএন্ড নির্বাচন এবং এক্সিকিউশন প্রোভাইডারের বিকল্প রয়েছে। ফাইনটিউনিং কোড এবং টিউটোরিয়াল finetuning ডিরেক্টরিতে প্রদান করা হয়েছে।
রিপোজিটরিটি MOSS-Audio-Tokenizer-Nano-ও নথিভুক্ত করে, যা Cat (Causal Audio Tokenizer with Transformer) আর্কিটেকচারের উপর নির্মিত প্রায় 20 মিলিয়ন প্যারামিটারের একটি লাইটওয়েট টোকেনাইজার। এটি 48 kHz স্টেরিও ইনপুট এবং আউটপুট সমর্থন করে, অডিওকে একটি 12.5 Hz টোকেন স্ট্রিমে সংকুচিত করে এবং 0.125 kbps থেকে 2 kbps পর্যন্ত পরিবর্তনশীল বিটরেট জুড়ে 16টি কোডবুক সহ RVQ ব্যবহার করে। মূল্যায়ন টেবিল এবং প্লটগুলি স্পিচ, অডিও এবং মিউজিক ডেটাতে 120M প্যারামিটারের বেশি নয় এমন ওপেন-সোর্স টোকেনাইজারগুলির সাথে পুনর্গঠন গুণমান তুলনা করে।
বৃহত্তর MOSS-TTS পরিবারও বর্ণনা করা হয়েছে, যার মধ্যে MOSS-TTS, MOSS-TTS-Local-Transformer, MOSS-TTSD-v1.0, MOSS-VoiceGenerator, MOSS-SoundEffect এবং MOSS-TTS-Realtime অন্তর্ভুক্ত, সাথে Hugging Face এবং ModelScope-এ মডেল ওয়েটের লিঙ্ক রয়েছে।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.