جی پی ٹی-Sوویتس ایک اوپن سورس فو-شوٹس آواز کی تبدیلی اور TTS سسٹم ہے جو چینی، جاپانی، کورین، کینٹونیز اور انگریزی زبانوں میں زیرو شوٹ (5 سیکنڈ) اور فو-شوٹس (1 منٹ) آواز کی نقل کا ساتھ دیتا ہے۔ اس میں آڈیو علیحدگی، ASR، اور ڈیٹاسیٹ تیاری کے لیے WebUI ٹولز شامل ہیں۔
اوپن سورس۔ نئے امکانات۔
معیاری اوپن سورس پروجیکٹس دریافت کریں، گمنام طور پر پروجیکٹس جمع کریں، اور اپنے پروجیکٹ کا دعویٰ کرکے اسے ایڈٹ کریں۔
تجسس کے ساتھ اوپن سورس کی دنیا دریافت کریں۔
THE FIRST COLLECTIONpyVideoTrans ایک اوپن سورس ویڈیو ترجمہ، آڈیو ٹرانسکرپشن، AI ڈبنگ اور سب ٹائٹل ترجمے کا آلہ ہے جو مقامی اور آن لائن API سپورٹ کے ساتھ آتا ہے۔
ESPnet PyTorch پر مبنی ایک اینڈ ٹو اینڈ اسپیچ پروسیسنگ ٹول کٹ ہے جو ASR، TTS، اسپیچ ٹرانسلیشن، اسپيچ انہانسمنٹ، ڈیاریائزیشن سمیت متعدد ٹاسکس کو سپورٹ کرتی ہے، اور دوبارہ قابلِ استعمال recipes اور پہلے سے تربیت یافتہ ماڈلز فراہم کرتی ہے۔
Unreal Engine 5 کے لیے ایک مقامی multimodal LLM پلگ ان جو ٹیکسٹ، سپیچ ٹو ٹیکسٹ، اور ٹیکسٹ ٹو سپیچ کے لیے آف لائن انفرنس فراہم کرتا ہے۔
FunTTS ایک متحد انٹرفیس والی ٹیکسٹ ٹو اسپیچ لائبریری ہے جو متعدد اوپن سورس TTS انجنوں کے درمیان ہموار تبدیلی کی حمایت کرتی ہے، اور سب ٹائٹل جنریشن، کثیر کردار مکالمے اور غیر ہم آہنگ پروسیسنگ جیسی خصوصیات فراہم کرتی ہے۔
MoneyPrinterTurbo ایک آل ان ون AI شارٹ ویڈیو جنریشن ٹول ہے۔ صرف موضوع یا کلیدی الفاظ درج کریں اور یہ خودکار طور پر اسکرپٹ، وائس اوور، مواد، سب ٹائٹلز، میوزک اور ایڈیٹنگ مکمل کر کے 9:16، 16:9، 1:1 HD ویڈیوز تیار کرتا ہے۔ WebUI، API، CLI اور AI Agent کے ذریعے استعمال کی سہولت موجود ہے۔
Mimora is a free, fully local pronunciation trainer for English and Spanish. It uses on-device TTS, speech recognition, and a local LLM to generate phrases and score user attempts with word-level feedback, requiring no cloud or API keys.
Unsloth ایک ڈیسک ٹاپ ایپلی کیشن اور فریم ورک ہے جو Windows، macOS اور Linux پر مقامی طور پر لارج لینگویج ماڈلز (LLMs) اور ڈیفیوژن ماڈلز کو چلانے اور ٹرین کرنے کے لیے استعمال ہوتا ہے۔
Zara ایک تجرباتی لوکل-فرسٹ AI اسسٹنٹ اور Linux ڈیسک ٹاپ کو پائلٹ ہے جو ارادوں کی ہینڈلنگ اور استدلال کے لیے سمبلک لاجک (Prolog) کو LLMs کے ساتھ جوڑتا ہے۔
وکس سی پی ایم 2 ٹوکنائزر سے پاک ٹیکسٹ ٹو اسپیچ سسٹم ہے جس میں 2 بلین ڈفیوژن آٹو ریگریسو ماڈل 30 زبانوں، ٹیکسٹ تفصیلات سے وائس ڈیزائن، قابل کنٹرول وائس کلوننگ اور 48 کلو ہرٹز آؤٹ پٹ کو سپورٹ کرتا ہے۔
ایک MCP سرور جو پیانو اور گٹار کے ذریعے AI کی موسیقیاتی صلاحیت سکھانے کے لیے ڈیزائن کیا گیا ہے۔ اس میں 120 نوٹ किए हुए گانے، چھ آڈیو انجنز، براؤزر‑بیسڈ کمپوزیشن کاکپٹ، اور ٹول‑یوز ٹریسز کا عوامی ڈیٹا سیٹ شامل ہے۔
Velo AI Studio ایک اوپن‑سورسل، براؤزر‑بیسڈ ویڈیو بنانے کا اوزار ہے جو اسکرپٹس، آڈیو اور AI‑پیدا کردہ بصری ایسیٹس سے نریٹڈ ویڈیو بنانے کے لیے ڈیزائن کیا گیا ہے۔
TaleWeaver ایک خود میزبان، براؤزر پر مبنی AI ٹیکسٹ ایڈونچر انجن ہے جس میں AI گیم ماسٹر، ایڈونچر ایڈیٹر، RPG میکینکس، صوتی بیان/اسپیچ ان پٹ، اور Docker/SQLite تعیناتی شامل ہے۔
OpenMontage ایک اوپن سورس، ایجنٹک ویڈیو پروڈکشن سسٹم ہے جو AI کوڈنگ اسسٹنٹس کو مکمل ویڈیو اسٹوڈیوز میں تبدیل کر دیتا ہے، اور ریسرچ سے لے کر فائنل رینڈر تک اینڈ ٹو اینڈ پائپ لائنز کی سپورٹ فراہم کرتا ہے۔
چیٹ ٹی ٹی ایس ایک کھلے ذریعے ٹیکسٹ ٹو سپیچ میڈل ہے جو ڈائیلاگ سیناریوز کے لیے بنایا گیا ہے، اس میں انگریزی اور چینی کی حمایت ہے اور چند گویا کنٹرول کے ساتھ متحرک ہے۔