OPEN SOURCE, OPEN TO EVERYONE

اوپن سورس۔ نئے امکانات۔

معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔

انسانی انتخاب · اچھا اوپن سورس دریافت کریں4101دریافت شدہ

تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔

THE FIRST COLLECTION
Topic: speech-recognition清除
talkbank-toolsFranklinChen
نیا

Batchalign3 TalkBank کا آڈیو اور ML پائپ لائن ہے جو CHAT ٹرانسکرپٹس بنانے اور افزودہ کرنے کے لیے استعمال ہوتی ہے، جس میں ASR، فورسڈ الائنمنٹ، نیورل مورفوٹیگنگ، ترجمہ اور اٹرانس سیگمنٹیشن شامل ہیں۔ یہ CLI، Python پیکیج، PyO3 برج، React ڈیش بورڈ اور ایک تجرباتی Tauri ڈیسک ٹاپ شیل فراہم کرتا ہے۔

مصنوعی ذہانتڈویلپر ٹولزModel runtime
نیا

SpeechRecognition ایک Python لائبریری ہے جو تقریر کی شناخت کے لیے کئی انجنوں اور APIs کو سپورٹ کرتی ہے، آن لائن اور آف لائن دونوں، بشمول CMU Sphinx، Google، Azure، IBM، Vosk، Whisper، اور OpenAI۔

مصنوعی ذہانتڈویلپر ٹولزMultimodal AI
mimoravikonix
نیا

Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.

مصنوعی ذہانتپیداواری صلاحیتAI assistants
whisper.cppggml-org
نیا

OpenAI کے Whisper automatic speech recognition (ASR) ماڈل کے لیے ایک اعلیٰ کارکردگی والا C/C++ implementation، جسے ہلکے پھلکے اور کراس پلیٹ فارم تعیناتی کے لیے ڈیزائن کیا گیا ہے۔

مصنوعی ذہانتModel runtime
premove-itnpremove-ai
نیا

Premove ITN ایک اوپن سورس، سیاق و سباق سے آگاہ الٹا متن نارملائزیشن ٹول ہے جو انگریزی وائس ایجنٹ ٹرانسکرپٹس کے لیے ہے۔ یہ ASR آؤٹ پٹ کو معیاری تحریری شکلوں میں تبدیل کرتا ہے، جس میں DeBERTa اسکورنگ اور تین مرحلہ پائپ لائن استعمال ہوتی ہے۔

مصنوعی ذہانتڈویلپر ٹولزModel runtime
نیا

CTranslate2 کا استعمال کرتے ہوئے OpenAI کے Whisper ماڈل کا ایک تیز رفتار ورژن، جو ٹرانسکرپشن کی رفتار میں بہتری اور میموری کے کم استعمال کی پیشکش کرتا ہے۔

مصنوعی ذہانتModel runtime
transformershuggingface
نیا

Hugging Face Transformers مشین لرننگ کے لیے ایک ماڈل ڈیفینیشن فریم ورک ہے جو ٹیکسٹ، ویژن، آڈیو اور ملٹی موڈل ٹاسکس کے لیے استعمال ہوتا ہے۔ یہ 1 ملین سے زیادہ پری ٹرینڈ چیک پوائنٹس کے ساتھ انفرنس اور ٹریننگ کے لیے ایک متحد API فراہم کرتا ہے۔

مصنوعی ذہانتڈویلپر ٹولزTraining & evaluation
sensevoiceQwenAudio
نیا

SenseVoiceSmall ایک اوپن سورس اسپیچ فاؤنڈیشن ماڈل ہے جو ASR، زبان کی شناخت، جذبات کی شناخت اور آڈیو ایونٹ کا پتہ لگانے کے لیے ہے، جس میں مینڈارن، کینٹونیز، انگریزی، جاپانی اور کورین شامل ہیں اور تیز غیر خود رجعت انفرنس فراہم کرتا ہے۔

مصنوعی ذہانتڈویلپر ٹولزModel runtime
espnetespnet
نیا

ESPnet PyTorch پر مبنی ایک اینڈ ٹو اینڈ اسپیچ پروسیسنگ ٹول کٹ ہے جو ASR، TTS، اسپیچ ٹرانسلیشن، اسپيچ انہانسمنٹ، ڈیاریائزیشن سمیت متعدد ٹاسکس کو سپورٹ کرتی ہے، اور دوبارہ قابلِ استعمال recipes اور پہلے سے تربیت یافتہ ماڈلز فراہم کرتی ہے۔

مصنوعی ذہانتڈویلپر ٹولزModel runtime
whisperlivekitQuentinFuxa
نیا

WhisperLiveKit ایک self-hosted، ultra-low-latency speech-to-text pipeline ہے۔ یہ real-time transcription، speaker diarization، اور WebSocket اور OpenAI/Deepgram-compatible APIs کے ذریعے translation فراہم کرتا ہے۔

مصنوعی ذہانتڈویلپر ٹولزModel runtime