vtmate ایک ٹرمینل پر مبنی وائس اے آئی ٹول کٹ ہے جس میں انتہائی کم لیٹنسی، 41 زبانوں کی حمایت، اور مربوط TTS/STT شامل ہے۔ یہ لائیو وائس گفتگو، مباحثے، وائس کلوننگ، سیشن ایکسپورٹ، اور بیک گراؤنڈ ڈیمن موڈ کے ساتھ گلوبل شارٹ کٹس فراہم کرتا ہے۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔
THE FIRST COLLECTIONمخلّقانہ صارفین کے لیے ایک اوپن سورس AI وورک اسپیس جو ایک مقامی ایجنٹ ماحول میں ویڈیو ترجمہ، ڈاؤن لوڈ، امیج جنریشن، ڈبنگ اور ویڈیو جنریشن کو یکجا کرتی ہے، جس کی طاقت Codex CLI پر مبنی ہے۔
Unsloth ایک ڈیسک ٹاپ ایپلی کیشن اور فریم ورک ہے جو Windows، macOS اور Linux پر مقامی طور پر لارج لینگویج ماڈلز (LLMs) اور ڈیفیوژن ماڈلز کو چلانے اور ٹرین کرنے کے لیے استعمال ہوتا ہے۔
وربا ایک آف لائن ڈیسک ٹاپ ایپ ہے جو زبان سیکھنے کے لیے AI کوچ کے ساتھ بات چیت پر مرکوز ہے۔ یہ مقامی طور پر Ollama یا اپنے فراہم کردہ کلید کے ساتھ چلتی ہے، جس میں ان لائن تصحیح، گریڈ شدہ مطالعہ، الفاظ کی تکرار اور اسپیچ فیچرز شامل ہیں۔
Google Chrome اور Mozilla Firefox کے لیے ایک براؤزر ایکسٹینشن جو YouTube ویڈیوز کے لیے ریئل ٹائم، دو لسانی سب ٹائٹل ترجمہ فراہم کرتا ہے۔
LocalAI ایک اوپن سورس، سیلف ہوسٹڈ AI انجن ہے جو کسی بھی ہارڈویئر پر LLMs، وژن، آواز، امیج اور ویڈیو ماڈلز چلاتا ہے، بشمول CPU-only۔ یہ OpenAI، Anthropic اور ElevenLabs کے قابلِ قبول APIs، آن ڈیمانڈ ماڈیولر بیک اینڈز، ملٹی یوزر تصدیق، اور RAG اور MCP کے ساتھ بلٹ ان ایجنٹس پیش کرتا ہے۔
وکس سی پی ایم 2 ٹوکنائزر سے پاک ٹیکسٹ ٹو اسپیچ سسٹم ہے جس میں 2 بلین ڈفیوژن آٹو ریگریسو ماڈل 30 زبانوں، ٹیکسٹ تفصیلات سے وائس ڈیزائن، قابل کنٹرول وائس کلوننگ اور 48 کلو ہرٹز آؤٹ پٹ کو سپورٹ کرتا ہے۔
Pixelle-Video is an AI-powered short video engine that automatically generates scripts, images, voiceovers, background music, and compiles videos based on user input topics, supporting flexible combinations of multiple AI models and workflows.
ایک ٹرمینل پر مبنی Python کورس: آپ Neovim اسٹائل کے ایڈیٹر میں کوڈ لکھتے ہیں جبکہ ایک مقامی TTS آواز آپ کی رہنمائی کرتی ہے۔ اس میں ڈرلز اور ایک simulated cloud/DevOps ٹریک شامل ہے۔
چیٹ ٹی ٹی ایس ایک کھلے ذریعے ٹیکسٹ ٹو سپیچ میڈل ہے جو ڈائیلاگ سیناریوز کے لیے بنایا گیا ہے، اس میں انگریزی اور چینی کی حمایت ہے اور چند گویا کنٹرول کے ساتھ متحرک ہے۔
جی پی ٹی-Sوویتس ایک اوپن سورس فو-شوٹس آواز کی تبدیلی اور TTS سسٹم ہے جو چینی، جاپانی، کورین، کینٹونیز اور انگریزی زبانوں میں زیرو شوٹ (5 سیکنڈ) اور فو-شوٹس (1 منٹ) آواز کی نقل کا ساتھ دیتا ہے۔ اس میں آڈیو علیحدگی، ASR، اور ڈیٹاسیٹ تیاری کے لیے WebUI ٹولز شامل ہیں۔
pyVideoTrans ایک اوپن سورس ویڈیو ترجمہ، آڈیو ٹرانسکرپشن، AI ڈبنگ اور سب ٹائٹل ترجمے کا آلہ ہے جو مقامی اور آن لائن API سپورٹ کے ساتھ آتا ہے۔
NVIDIA NeMo Speech ایک Apache-2.0 PyTorch فریم ورک ہے جو تقریری AI ماڈلز کی تعمیر، تخصیص اور تعیناتی کے لیے ہے، جس میں خودکار تقریر کی شناخت، متن سے تقریر اور تقریری LLMs شامل ہیں، پہلے سے تربیت یافتہ چیک پوائنٹس اور Docker/uv انسٹال کے راستوں کے ساتھ۔
FunTTS ایک متحد انٹرفیس والی ٹیکسٹ ٹو اسپیچ لائبریری ہے جو متعدد اوپن سورس TTS انجنوں کے درمیان ہموار تبدیلی کی حمایت کرتی ہے، اور سب ٹائٹل جنریشن، کثیر کردار مکالمے اور غیر ہم آہنگ پروسیسنگ جیسی خصوصیات فراہم کرتی ہے۔