Douvo হলো একটি হালকা macOS ভয়েস ইনপুট অ্যাপ, যা Apple Silicon Mac-এর জন্য ডিজাইন করা হয়েছে এবং Doubao ASR ব্যবহার করে। এতে ঐচ্ছিক স্থানীয় বা রিমোট AI post-processing রয়েছে, যা টেক্সট পরিষ্কার, অনুবাদ এবং নির্বাচিত টেক্সট সম্পাদনা করে।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONBatchalign3 হলো TalkBank-এর অডিও এবং ML পাইপলাইন যা CHAT ট্রান্সক্রিপ্ট তৈরি ও সমৃদ্ধ করে; এতে ASR, ফোর্সড অ্যালাইনমেন্ট, নিউরাল মরফোট্যাগিং, অনুবাদ এবং উচ্চারণ বিভাজন অন্তর্ভুক্ত। এটি CLI, Python প্যাকেজ, PyO3 ব্রিজ, React ড্যাশবোর্ড এবং একটি পরীক্ষামূলক Tauri ডেস্কটপ শেল সরবরাহ করে।
একটি পাইথন লাইব্রেরি যা কোনো এপিআই কী বা হেডলেস ব্রাউজার প্রয়োজন ছাড়াই YouTube ভিডিওর ট্রান্সক্রিপ্ট ও সাবটাইটেল পুনরুদ্ধার করে। বহু ভাষা, অনুবাদ এবং আউটপুট ফরম্যাটিং সমর্থন করে।
Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
Premove ITN একটি ওপেন-সোর্স, প্রসঙ্গ-সচেতন ইনভার্স টেক্সট নরমালাইজেশন টুল, যা ইংরেজি ভয়েস-এজেন্ট ট্রান্সক্রিপ্টের জন্য। এটি DeBERTa কনটেক্সচুয়াল স্কোরিং সহ জেনারেট-স্কোর-ডিকোড পাইপলাইন ব্যবহার করে কথ্য ASR আউটপুটকে ক্যানোনিকাল লিখিত ফর্মে রূপান্তর করে।
SenseVoiceSmall একটি ওপেন-সোর্স স্পিচ ফাউন্ডেশন মডেল যা ASR, ভাষা শনাক্তকরণ, আবেগ শনাক্তকরণ এবং অডিও ইভেন্ট সনাক্তকরণের জন্য ব্যবহৃত হয়। এটি ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষা সমর্থন করে এবং দ্রুত নন-অটোরিগ্রেসিভ ইনফারেন্স প্রদান করে।
NVIDIA NeMo Speech হলো speech AI মডেল তৈরির Apache-2.0 PyTorch ফ্রেমওয়ার্ক। এটি ASR, TTS এবং Speech LLM সমর্থন করে, প্রি-ট্রেইন্ড checkpoint ও Docker/uv ইনস্টল পদ্ধতি অন্তর্ভুক্ত।