Speech To Speech একটি মডুলার ফ্রেমওয়ার্ক যা ওপেন-সোর্স মডেল ব্যবহার করে ভয়েস এজেন্ট তৈরি করে। VAD, STT, LLM, TTS—চারটি ধাপে ভয়েস ইন্টার্যাকশন পাইপলাইন সাজিয়ে এটি রিয়েলটাইম কনভারসেশন সম্ভব করে WebSocket এবং WebRTC এর মাধ্যমে।
কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলAI assistants
NVIDIA NeMo Speech হলো speech AI মডেল তৈরির Apache-2.0 PyTorch ফ্রেমওয়ার্ক। এটি ASR, TTS এবং Speech LLM সমর্থন করে, প্রি-ট্রেইন্ড checkpoint ও Docker/uv ইনস্টল পদ্ধতি অন্তর্ভুক্ত।
কৃত্রিম বুদ্ধিমত্তাসঙ্গীতModel runtime
ESPnet হল PyTorch-ভিত্তিক এন্ড-টু-এন্ড স্পিচ প্রসেসিং টুলকিট, যা ASR, TTS, স্পিচ অনুবাদ, এনহ্যান্সমেন্ট, ডায়ারাইজেশন ইত্যাদি সহ পুনরুত্পাদনযোগ্য রেসিপি এবং প্রিট্রেইন্ড মডেল অফার করে।
কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime