VoxCPM2 হলো OpenBMB-এর একটি টোকেনাইজার-মুক্ত টেক্সট-টু-স্পিচ সিস্টেম যা ২ বিলিয়ন প্যারামিটারের ডিফিউশন অটোরেগ্রেসিভ মডেল ব্যবহার করে ৩০টি ভাষা, টেক্সট বর্ণনা থেকে ভয়েস ডিজাইন, নিয়ন্ত্রিত ভয়েস ক্লোনিং এবং ৪৮kHz অডিও আউটপুট সমর্থন করে।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONNVIDIA NeMo Speech হলো speech AI মডেল তৈরির Apache-2.0 PyTorch ফ্রেমওয়ার্ক। এটি ASR, TTS এবং Speech LLM সমর্থন করে, প্রি-ট্রেইন্ড checkpoint ও Docker/uv ইনস্টল পদ্ধতি অন্তর্ভুক্ত।
ESPnet হল PyTorch-ভিত্তিক এন্ড-টু-এন্ড স্পিচ প্রসেসিং টুলকিট, যা ASR, TTS, স্পিচ অনুবাদ, এনহ্যান্সমেন্ট, ডায়ারাইজেশন ইত্যাদি সহ পুনরুত্পাদনযোগ্য রেসিপি এবং প্রিট্রেইন্ড মডেল অফার করে।
FunTTS হলো একটি ইউনিফাইড ইন্টারফেস সমৃদ্ধ টেক্সট-টু-স্পিচ লাইব্রেরি, যা বিভিন্ন ওপেন সোর্স TTS ইঞ্জিনের নিরবচ্ছিন্ন সুইচিং সমর্থন করে এবং সাবটাইটেল জেনারেশন, মাল্টি-রোল সংলাপ ও অ্যাসিনক্রোনাস প্রসেসিংয়ের মতো সুবিধা প্রদান করে।
Speech To Speech একটি মডুলার ফ্রেমওয়ার্ক যা ওপেন-সোর্স মডেল ব্যবহার করে ভয়েস এজেন্ট তৈরি করে। VAD, STT, LLM, TTS—চারটি ধাপে ভয়েস ইন্টার্যাকশন পাইপলাইন সাজিয়ে এটি রিয়েলটাইম কনভারসেশন সম্ভব করে WebSocket এবং WebRTC এর মাধ্যমে।