OPEN SOURCE, OPEN TO EVERYONE

ওপেন সোর্স। নতুন সম্ভাবনা।

মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।

সম্পাদকের পছন্দ · ভালো ওপেন সোর্স খুঁজুন4109আবিষ্কৃত

কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
নতুন

Batchalign3 হলো TalkBank-এর অডিও এবং ML পাইপলাইন যা CHAT ট্রান্সক্রিপ্ট তৈরি ও সমৃদ্ধ করে; এতে ASR, ফোর্সড অ্যালাইনমেন্ট, নিউরাল মরফোট্যাগিং, অনুবাদ এবং উচ্চারণ বিভাজন অন্তর্ভুক্ত। এটি CLI, Python প্যাকেজ, PyO3 ব্রিজ, React ড্যাশবোর্ড এবং একটি পরীক্ষামূলক Tauri ডেস্কটপ শেল সরবরাহ করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
নতুন

SpeechRecognition একটি Python লাইব্রেরি যা CMU Sphinx, Google, Azure, IBM, Vosk, Whisper এবং OpenAI সহ একাধিক অনলাইন ও অফলাইন ইঞ্জিন এবং API-তে স্পিচ রিকগনিশন সমর্থন করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলMultimodal AI
mimoravikonix
নতুন

Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.

কৃত্রিম বুদ্ধিমত্তাউৎপাদনশীলতাAI assistants
whisper.cppggml-org
নতুন

OpenAI-এর Whisper অটোমেটিক স্পিচ রিকগনিশন (ASR) মডেলের জন্য একটি উচ্চ-ক্ষমতাসম্পন্ন C/C++ ইমপ্লিমেন্টেশন, যা হালকা এবং ক্রস-প্ল্যাটফর্ম ডেপ্লয়মেন্টের জন্য ডিজাইন করা হয়েছে।

কৃত্রিম বুদ্ধিমত্তাModel runtime
premove-itnpremove-ai
নতুন

Premove ITN একটি ওপেন-সোর্স, প্রসঙ্গ-সচেতন ইনভার্স টেক্সট নরমালাইজেশন টুল, যা ইংরেজি ভয়েস-এজেন্ট ট্রান্সক্রিপ্টের জন্য। এটি DeBERTa কনটেক্সচুয়াল স্কোরিং সহ জেনারেট-স্কোর-ডিকোড পাইপলাইন ব্যবহার করে কথ্য ASR আউটপুটকে ক্যানোনিকাল লিখিত ফর্মে রূপান্তর করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
নতুন

CTranslate2 ব্যবহার করে OpenAI-এর Whisper মডেলের একটি দ্রুত পুনঃবাস্তবায়ন, যা ট্রান্সক্রিপশন গতি বৃদ্ধি এবং মেমরি ব্যবহার হ্রাস করে।

কৃত্রিম বুদ্ধিমত্তাModel runtime
transformershuggingface
নতুন

Hugging Face Transformers হলো টেক্সট, ভিশন, অডিও এবং মাল্টিমোডাল টাস্কের জন্য একটি মেশিন লার্নিং মডেল-ডেফিনিশন ফ্রেমওয়ার্ক। এটি ১ মিলিয়নেরও বেশি প্রি-ট্রেইনড চেকপয়েন্টের সাথে ইনফারেন্স এবং ট্রেনিংয়ের জন্য একটি ইউনিফাইড API প্রদান করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলTraining & evaluation
sensevoiceQwenAudio
নতুন

SenseVoiceSmall একটি ওপেন-সোর্স স্পিচ ফাউন্ডেশন মডেল যা ASR, ভাষা শনাক্তকরণ, আবেগ শনাক্তকরণ এবং অডিও ইভেন্ট সনাক্তকরণের জন্য ব্যবহৃত হয়। এটি ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষা সমর্থন করে এবং দ্রুত নন-অটোরিগ্রেসিভ ইনফারেন্স প্রদান করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
espnetespnet
নতুন

ESPnet হল PyTorch-ভিত্তিক এন্ড-টু-এন্ড স্পিচ প্রসেসিং টুলকিট, যা ASR, TTS, স্পিচ অনুবাদ, এনহ্যান্সমেন্ট, ডায়ারাইজেশন ইত্যাদি সহ পুনরুত্পাদনযোগ্য রেসিপি এবং প্রিট্রেইন্ড মডেল অফার করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
whisperlivekitQuentinFuxa
নতুন

WhisperLiveKit একটি ওপেন-সোর্স, সেলফ-হোস্টেড স্পিচ-টু-টেক্সট পাইপলাইন যা আল্ট্রা-লো-লেটেন্সি রিয়েল-টাইম ট্রান্সক্রিপশন ডিজাইন করা হয়েছে। এতে WebSocket ও OpenAI/Deepgram কম্প্যাটিবিল API সমর্থন রয়েছে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime