OPEN SOURCE, OPEN TO EVERYONE

ওপেন সোর্স। নতুন সম্ভাবনা।

মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।

সম্পাদকের পছন্দ · ভালো ওপেন সোর্স খুঁজুন4109আবিষ্কৃত

কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।

THE FIRST COLLECTION
Topic: asr清除
douvorhinoc
নতুন

Douvo হলো একটি হালকা macOS ভয়েস ইনপুট অ্যাপ, যা Apple Silicon Mac-এর জন্য ডিজাইন করা হয়েছে এবং Doubao ASR ব্যবহার করে। এতে ঐচ্ছিক স্থানীয় বা রিমোট AI post-processing রয়েছে, যা টেক্সট পরিষ্কার, অনুবাদ এবং নির্বাচিত টেক্সট সম্পাদনা করে।

উৎপাদনশীলতাকৃত্রিম বুদ্ধিমত্তাUtilities
talkbank-toolsFranklinChen
নতুন

Batchalign3 হলো TalkBank-এর অডিও এবং ML পাইপলাইন যা CHAT ট্রান্সক্রিপ্ট তৈরি ও সমৃদ্ধ করে; এতে ASR, ফোর্সড অ্যালাইনমেন্ট, নিউরাল মরফোট্যাগিং, অনুবাদ এবং উচ্চারণ বিভাজন অন্তর্ভুক্ত। এটি CLI, Python প্যাকেজ, PyO3 ব্রিজ, React ড্যাশবোর্ড এবং একটি পরীক্ষামূলক Tauri ডেস্কটপ শেল সরবরাহ করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
নতুন

একটি পাইথন লাইব্রেরি যা কোনো এপিআই কী বা হেডলেস ব্রাউজার প্রয়োজন ছাড়াই YouTube ভিডিওর ট্রান্সক্রিপ্ট ও সাবটাইটেল পুনরুদ্ধার করে। বহু ভাষা, অনুবাদ এবং আউটপুট ফরম্যাটিং সমর্থন করে।

ডেভেলপার টুলBackend & APIs
mimoravikonix
নতুন

Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.

কৃত্রিম বুদ্ধিমত্তাউৎপাদনশীলতাAI assistants
premove-itnpremove-ai
নতুন

Premove ITN একটি ওপেন-সোর্স, প্রসঙ্গ-সচেতন ইনভার্স টেক্সট নরমালাইজেশন টুল, যা ইংরেজি ভয়েস-এজেন্ট ট্রান্সক্রিপ্টের জন্য। এটি DeBERTa কনটেক্সচুয়াল স্কোরিং সহ জেনারেট-স্কোর-ডিকোড পাইপলাইন ব্যবহার করে কথ্য ASR আউটপুটকে ক্যানোনিকাল লিখিত ফর্মে রূপান্তর করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
sensevoiceQwenAudio
নতুন

SenseVoiceSmall একটি ওপেন-সোর্স স্পিচ ফাউন্ডেশন মডেল যা ASR, ভাষা শনাক্তকরণ, আবেগ শনাক্তকরণ এবং অডিও ইভেন্ট সনাক্তকরণের জন্য ব্যবহৃত হয়। এটি ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষা সমর্থন করে এবং দ্রুত নন-অটোরিগ্রেসিভ ইনফারেন্স প্রদান করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
speechNVIDIA-NeMo
নতুন

NVIDIA NeMo Speech হলো speech AI মডেল তৈরির Apache-2.0 PyTorch ফ্রেমওয়ার্ক। এটি ASR, TTS এবং Speech LLM সমর্থন করে, প্রি-ট্রেইন্ড checkpoint ও Docker/uv ইনস্টল পদ্ধতি অন্তর্ভুক্ত।

কৃত্রিম বুদ্ধিমত্তাসঙ্গীতModel runtime