Batchalign3 হলো TalkBank-এর অডিও এবং ML পাইপলাইন যা CHAT ট্রান্সক্রিপ্ট তৈরি ও সমৃদ্ধ করে; এতে ASR, ফোর্সড অ্যালাইনমেন্ট, নিউরাল মরফোট্যাগিং, অনুবাদ এবং উচ্চারণ বিভাজন অন্তর্ভুক্ত। এটি CLI, Python প্যাকেজ, PyO3 ব্রিজ, React ড্যাশবোর্ড এবং একটি পরীক্ষামূলক Tauri ডেস্কটপ শেল সরবরাহ করে।
ওপেন সোর্স। নতুন সম্ভাবনা।
মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।
কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।
THE FIRST COLLECTIONSpeechRecognition একটি Python লাইব্রেরি যা CMU Sphinx, Google, Azure, IBM, Vosk, Whisper এবং OpenAI সহ একাধিক অনলাইন ও অফলাইন ইঞ্জিন এবং API-তে স্পিচ রিকগনিশন সমর্থন করে।
Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
OpenAI-এর Whisper অটোমেটিক স্পিচ রিকগনিশন (ASR) মডেলের জন্য একটি উচ্চ-ক্ষমতাসম্পন্ন C/C++ ইমপ্লিমেন্টেশন, যা হালকা এবং ক্রস-প্ল্যাটফর্ম ডেপ্লয়মেন্টের জন্য ডিজাইন করা হয়েছে।
Premove ITN একটি ওপেন-সোর্স, প্রসঙ্গ-সচেতন ইনভার্স টেক্সট নরমালাইজেশন টুল, যা ইংরেজি ভয়েস-এজেন্ট ট্রান্সক্রিপ্টের জন্য। এটি DeBERTa কনটেক্সচুয়াল স্কোরিং সহ জেনারেট-স্কোর-ডিকোড পাইপলাইন ব্যবহার করে কথ্য ASR আউটপুটকে ক্যানোনিকাল লিখিত ফর্মে রূপান্তর করে।
CTranslate2 ব্যবহার করে OpenAI-এর Whisper মডেলের একটি দ্রুত পুনঃবাস্তবায়ন, যা ট্রান্সক্রিপশন গতি বৃদ্ধি এবং মেমরি ব্যবহার হ্রাস করে।
Hugging Face Transformers হলো টেক্সট, ভিশন, অডিও এবং মাল্টিমোডাল টাস্কের জন্য একটি মেশিন লার্নিং মডেল-ডেফিনিশন ফ্রেমওয়ার্ক। এটি ১ মিলিয়নেরও বেশি প্রি-ট্রেইনড চেকপয়েন্টের সাথে ইনফারেন্স এবং ট্রেনিংয়ের জন্য একটি ইউনিফাইড API প্রদান করে।
SenseVoiceSmall একটি ওপেন-সোর্স স্পিচ ফাউন্ডেশন মডেল যা ASR, ভাষা শনাক্তকরণ, আবেগ শনাক্তকরণ এবং অডিও ইভেন্ট সনাক্তকরণের জন্য ব্যবহৃত হয়। এটি ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষা সমর্থন করে এবং দ্রুত নন-অটোরিগ্রেসিভ ইনফারেন্স প্রদান করে।
ESPnet হল PyTorch-ভিত্তিক এন্ড-টু-এন্ড স্পিচ প্রসেসিং টুলকিট, যা ASR, TTS, স্পিচ অনুবাদ, এনহ্যান্সমেন্ট, ডায়ারাইজেশন ইত্যাদি সহ পুনরুত্পাদনযোগ্য রেসিপি এবং প্রিট্রেইন্ড মডেল অফার করে।
WhisperLiveKit একটি ওপেন-সোর্স, সেলফ-হোস্টেড স্পিচ-টু-টেক্সট পাইপলাইন যা আল্ট্রা-লো-লেটেন্সি রিয়েল-টাইম ট্রান্সক্রিপশন ডিজাইন করা হয়েছে। এতে WebSocket ও OpenAI/Deepgram কম্প্যাটিবিল API সমর্থন রয়েছে।