OPEN SOURCE, OPEN TO EVERYONE

ওপেন সোর্স। নতুন সম্ভাবনা।

মানসম্মত ওপেন-সোর্স প্রজেক্ট আবিষ্কার করুন, বেনামে প্রজেক্ট জমা দিন এবং নিজের প্রজেক্ট দাবি করে সম্পাদনা করুন।

সম্পাদকের পছন্দ · ভালো ওপেন সোর্স খুঁজুন4101আবিষ্কৃত

কৌতূহল নিয়ে ওপেন সোর্স আবিষ্কার করুন।

THE FIRST COLLECTION
Topic: speech-to-text清除
douvorhinoc
নতুন

Douvo হলো একটি হালকা macOS ভয়েস ইনপুট অ্যাপ, যা Apple Silicon Mac-এর জন্য ডিজাইন করা হয়েছে এবং Doubao ASR ব্যবহার করে। এতে ঐচ্ছিক স্থানীয় বা রিমোট AI post-processing রয়েছে, যা টেক্সট পরিষ্কার, অনুবাদ এবং নির্বাচিত টেক্সট সম্পাদনা করে।

উৎপাদনশীলতাকৃত্রিম বুদ্ধিমত্তাUtilities
lexoscauafsantosdev
নতুন

Lexos একটি ইভেন্ট-চালিত AI ডকুমেন্ট প্রসেসিং ইঞ্জিন, যা Go গেটওয়ে, Python ওয়ার্কার, Redis কিউ এবং সেলফ-হোস্টেড মডেল ব্যবহার করে অফলাইন RAG, সারাংশ এবং স্পিচ ট্রান্সক্রিপশন সক্ষম করে।

কৃত্রিম বুদ্ধিমত্তাস্ব-হোস্টেডRAG & knowledge
নতুন

SpeechRecognition একটি Python লাইব্রেরি যা CMU Sphinx, Google, Azure, IBM, Vosk, Whisper এবং OpenAI সহ একাধিক অনলাইন ও অফলাইন ইঞ্জিন এবং API-তে স্পিচ রিকগনিশন সমর্থন করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলMultimodal AI
whisper.cppggml-org
নতুন

OpenAI-এর Whisper অটোমেটিক স্পিচ রিকগনিশন (ASR) মডেলের জন্য একটি উচ্চ-ক্ষমতাসম্পন্ন C/C++ ইমপ্লিমেন্টেশন, যা হালকা এবং ক্রস-প্ল্যাটফর্ম ডেপ্লয়মেন্টের জন্য ডিজাইন করা হয়েছে।

কৃত্রিম বুদ্ধিমত্তাModel runtime
boloa692570
নতুন

Bolo হল একটি বিনামূল্যের, স্ব-হোস্ট করা macOS পুশ-টু-টক ডিক্টেশন অ্যাপ, যা Rust-এ লেখা। এটি Telnyx AI speech-to-text ব্যবহার করে, এবং ঐচ্ছিকভাবে LLM ক্লীনআপ এবং স্থানীয় ট্রান্সক্রিপ্ট ইতিহাস সমর্থন করে।

উৎপাদনশীলতাকৃত্রিম বুদ্ধিমত্তাUtilities
skyclass-distillRicardo-Ssy
নতুন

SkyClass Distill হলো একটি পাইপলাইন টুল যা শিক্ষামূলক ভিডিওকে কাঠামোগত Teaching Skills-এ রূপান্তর করে। এটি ভিডিও সংগ্রহ, ট্রান্সক্রিপশন, প্রমাণ নিষ্কাশন এবং LLM ডিস্টিলেশন সমর্থন করে।

কৃত্রিম বুদ্ধিমত্তাউৎপাদনশীলতাAI agents
typenomarswaveai
নতুন

TypeNo একটি মুক্ত, ওপেন-সোর্স macOS ভয়েস ইনপুট অ্যাপ যা স্থানীয়ভাবে স্পीच ট্রান্সক্রিপ্ট করে এবং টেক্সট তৎক্ষণে পেস্ট করে — কোনো অ্যাকাউন্ট, কোনো সেটিংস, গোপনীয়তা-প্রথম।

সঙ্গীতAudio editing
নতুন

Velo AI Studio একটি ওপেন-সোর্স, ব্রাউজার-ভিত্তিক ভিডিও সৃষ্টি টুল, যা স্ক্রিপ্ট, অডিও এবং AI-উত্পন্ন ভিজুয়াল আসেট থেকে নারেটেড ভিডিও সংগঠন করতে ডিজাইন করা হয়েছে।

সঙ্গীতDAW & production
নতুন

CTranslate2 ব্যবহার করে OpenAI-এর Whisper মডেলের একটি দ্রুত পুনঃবাস্তবায়ন, যা ট্রান্সক্রিপশন গতি বৃদ্ধি এবং মেমরি ব্যবহার হ্রাস করে।

কৃত্রিম বুদ্ধিমত্তাModel runtime
sensevoiceQwenAudio
নতুন

SenseVoiceSmall একটি ওপেন-সোর্স স্পিচ ফাউন্ডেশন মডেল যা ASR, ভাষা শনাক্তকরণ, আবেগ শনাক্তকরণ এবং অডিও ইভেন্ট সনাক্তকরণের জন্য ব্যবহৃত হয়। এটি ম্যান্ডারিন, ক্যান্টোনিজ, ইংরেজি, জাপানি এবং কোরিয়ান ভাষা সমর্থন করে এবং দ্রুত নন-অটোরিগ্রেসিভ ইনফারেন্স প্রদান করে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
LazyEditlachlanchen
নির্বাচিত

LazyEdit হলো একটি লোকাল-ফার্স্ট, AI-সহায়ক ভিডিও ওয়ার্কফ্লো যা এন্ড-টু-এন্ড কন্টেন্ট তৈরি, প্রসেসিং এবং ঐচ্ছিক পাবলিশিংয়ের জন্য ব্যবহৃত হয়।

চলচ্চিত্র, ভিডিও ও মিডিয়াকৃত্রিম বুদ্ধিমত্তাVideo editing
pyvideotransjianchang512
নতুন

pyVideoTrans একটি ওপেন-সোর্স ভিডিও অনুবাদ টুল যা ভাষান্তর, অডিও ট্রান্সক্রিপশন, AI ডাবিং এবং সাবটাইটেল অনুবাদের পূর্ণাঙ্গ কাজের ধারা প্রদান করে। এটি স্থানীয়ভাবে এবং বিভিন্ন অনলাইন API-এর মাধ্যমে ব্যবহার করা যায়।

কৃত্রিম বুদ্ধিমত্তাচলচ্চিত্র, ভিডিও ও মিডিয়াMultimodal AI
handycjpais
নতুন

Handy একটি বিনামূল্যের, ওপেন-সোর্স, ক্রস-প্ল্যাটফর্ম ডেস্কটপ অ্যাপ যা সম্পূর্ণ অফলাইনে কাজ করে। শর্টকাট চেপে কথা বলুন, ট্রান্সক্রিপ্ট করা টেক্সট যেকোনো ফিল্ডে পেস্ট হয়ে যাবে, Whisper বা Parakeet মডেল ব্যবহার করে।

কৃত্রিম বুদ্ধিমত্তাউৎপাদনশীলতাMultimodal AI
whisperlivekitQuentinFuxa
নতুন

WhisperLiveKit একটি ওপেন-সোর্স, সেলফ-হোস্টেড স্পিচ-টু-টেক্সট পাইপলাইন যা আল্ট্রা-লো-লেটেন্সি রিয়েল-টাইম ট্রান্সক্রিপশন ডিজাইন করা হয়েছে। এতে WebSocket ও OpenAI/Deepgram কম্প্যাটিবিল API সমর্থন রয়েছে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলModel runtime
lamitypefelixfu824
নতুন

Lamitype একটি বিনামূল্যের, ওপেন-সোর্স, গোপনীয়তা-প্রথম macOS ভয়েস-টু-টেক্সট অ্যাপ। এটি Apple Silicon-এ স্থানীয়ভাবে Qwen3-ASR মডেল চালায়, ট্র্যাডিশনাল চাইনিজ-কে অগ্রাধিকার দেয়, লাইভ ক্যাপশন, পাঠ্য অনুবাদ ও প্রুফরিডিং সমর্থন করে এবং ঐচ্ছিক ক্লাউড ডিক্টেশন সুবিধা প্রদান করে।

উৎপাদনশীলতাকৃত্রিম বুদ্ধিমত্তাUtilities
LLM_Pluginisundahl
নতুন

Unreal Engine 5-এর জন্য একটি লোকাল মাল্টিমোডাল LLM প্লাগইন, যা টেক্সট, স্পিচ-টু-টেক্সট এবং টেক্সট-টু-স্পিচের জন্য অফলাইন ইনফারেন্স প্রদান করে।

গেমকৃত্রিম বুদ্ধিমত্তাGame development tools
speech-to-speechhuggingface
নতুন

Speech To Speech একটি মডুলার ফ্রেমওয়ার্ক যা ওপেন-সোর্স মডেল ব্যবহার করে ভয়েস এজেন্ট তৈরি করে। VAD, STT, LLM, TTS—চারটি ধাপে ভয়েস ইন্টার‍্যাকশন পাইপলাইন সাজিয়ে এটি রিয়েলটাইম কনভারসেশন সম্ভব করে WebSocket এবং WebRTC এর মাধ্যমে।

কৃত্রিম বুদ্ধিমত্তাডেভেলপার টুলAI assistants