SpeechRecognition ایک Python لائبریری ہے جو تقریر کی شناخت کے لیے کئی انجنوں اور APIs کو سپورٹ کرتی ہے، آن لائن اور آف لائن دونوں، بشمول CMU Sphinx، Google، Azure، IBM، Vosk، Whisper، اور OpenAI۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔
THE FIRST COLLECTIONOpenAI کے Whisper automatic speech recognition (ASR) ماڈل کے لیے ایک اعلیٰ کارکردگی والا C/C++ implementation، جسے ہلکے پھلکے اور کراس پلیٹ فارم تعیناتی کے لیے ڈیزائن کیا گیا ہے۔
Bolo ایک مفت، خود-ہوسٹڈ macOS پش-ٹو-ٹاک ڈکٹیشن ایپ ہے جو Rust میں لکھی گئی ہے: ایک ہاٹ کی کو دبائیں، بولیں، اور ٹرانسکرپشن کو Telnyx AI سپیچ-ٹو-ٹیکسٹ کے ذریعے آپ کے کرسر پر پیسٹ کیا جائے گا، اختیاری LLM کلین اپ اور مقامی ٹرانسکرپٹ ہسٹری کے ساتھ۔
SkyClass Distill ایک ایسا پائپ لائن ٹول ہے جو تدریسی ویڈیوز کو منظم تدریسی مہارتوں (Teaching Skills) میں تبدیل کرتا ہے، جس میں ویڈیو کلیکشن، ٹرانسکرپشن، شواہد کی نکاسی اور LLM ڈسٹلیشن شامل ہیں۔
TypeNo مفت اور اوپن سورس macOS وائس ان پٹ ایپ ہے جو بول چال کو مقامی طور پر ٹرانسکربر کر کے فوری طور پر ٹیکسٹ پیسٹ کرتی ہے — بغیر کسی اکاؤنٹ کے، بغیر ترتیبات کے، پرائیویسی کو ترجیح دیتی ہے۔
Velo AI Studio ایک اوپن‑سورسل، براؤزر‑بیسڈ ویڈیو بنانے کا اوزار ہے جو اسکرپٹس، آڈیو اور AI‑پیدا کردہ بصری ایسیٹس سے نریٹڈ ویڈیو بنانے کے لیے ڈیزائن کیا گیا ہے۔
CTranslate2 کا استعمال کرتے ہوئے OpenAI کے Whisper ماڈل کا ایک تیز رفتار ورژن، جو ٹرانسکرپشن کی رفتار میں بہتری اور میموری کے کم استعمال کی پیشکش کرتا ہے۔
SenseVoiceSmall ایک اوپن سورس اسپیچ فاؤنڈیشن ماڈل ہے جو ASR، زبان کی شناخت، جذبات کی شناخت اور آڈیو ایونٹ کا پتہ لگانے کے لیے ہے، جس میں مینڈارن، کینٹونیز، انگریزی، جاپانی اور کورین شامل ہیں اور تیز غیر خود رجعت انفرنس فراہم کرتا ہے۔
LazyEdit مواد کی تخلیق، پروسیسنگ اور اختیاری اشاعت کے لیے ایک لوکل-فرسٹ، AI-اسسٹڈ ویڈیو ورک فلو ہے۔
pyVideoTrans ایک اوپن سورس ویڈیو ترجمہ، آڈیو ٹرانسکرپشن، AI ڈبنگ اور سب ٹائٹل ترجمے کا آلہ ہے جو مقامی اور آن لائن API سپورٹ کے ساتھ آتا ہے۔
ہینڈی ایک مفت، اوپن سورس، کراس پلیٹ فارم ڈیسک ٹاپ ایپ ہے جو مکمل طور پر آف لائن کام کرتی ہے۔ ایک شارٹ کٹ دبائیں، بولیں، اور ٹرانسکرائب شدہ متن کسی بھی ٹیکسٹ فیلڈ میں چسپاں ہو جاتا ہے، Whisper یا Parakeet ماڈلز استعمال کرتے ہوئے۔
WhisperLiveKit ایک self-hosted، ultra-low-latency speech-to-text pipeline ہے۔ یہ real-time transcription، speaker diarization، اور WebSocket اور OpenAI/Deepgram-compatible APIs کے ذریعے translation فراہم کرتا ہے۔
Lamitype ایک مفت، اوپن سورس، پرائیویسی پر مبنی macOS وائس ٹو ٹیکسٹ ایپ ہے جو Apple Silicon پر Qwen3-ASR ماڈل لوکل طور پر چلاتی ہے، روایتی چینی آؤٹ پٹ، لائیو کیپشن، ترجمہ اور پروف ریڈنگ سپورٹ کرتی ہے، اور اختیاری کلاؤڈ ڈکٹیشن بھی فراہم کرتی ہے۔
Unreal Engine 5 کے لیے ایک مقامی multimodal LLM پلگ ان جو ٹیکسٹ، سپیچ ٹو ٹیکسٹ، اور ٹیکسٹ ٹو سپیچ کے لیے آف لائن انفرنس فراہم کرتا ہے۔
Spīch Tō Spīch ek kam-lik̲s̲nat, mahādālīk aʼwāz-āgent paimanā (VAD → STT → LLM → TTS) hai jo WebSocket aur WebRTC par OpenAI Realtime ēvent set kā kāryānvayan kartā hai.
Douvo ایک ہلکا پھلکا macOS وائس ان پٹ ایپ ہے جو Apple Silicon کے لیے ہے، Doubao ASR استعمال کرتا ہے، اور اختیاری AI پوسٹ پروسیسنگ کے ساتھ متن صاف کرنے، ترجمہ اور منتخب متن میں ترمیم کرنے کی سہولت دیتا ہے۔
Lexos ایک ایونٹ سے چلنے والا AI دستاویز پروسیسنگ انجن ہے جو Go گیٹ وے، Python ورکرز، Redis قطاروں اور خود میزبان ماڈلز کو آف لائن RAG، خلاصہ اور تقریر کی نقل کے لیے جوڑتا ہے۔