منصوبے کے بارے میں
# podgenai
podgenai ایک Python ایپلیکیشن ہے جو OpenAI LLM کا استعمال کرتے ہوئے کسی دیے گئے موضوع پر معلوماتی واحد اسپیکر یا دو اسپیکر والی آڈیو بک/پوڈکاسٹ MP3 فائلیں تیار کرتی ہے۔ مواد ماڈل کے اندرونی علم یا فراہم کردہ مارک ڈاؤن سورس دستاویز سے آتا ہے؛ ویب تلاش استعمال نہیں کی جاتی۔
## یہ کیسے کام کرتا ہے
کسی موضوع کے لیے، یہ ٹول:
1. LLM کا استعمال کرتے ہوئے متعلقہ ذیلی موضوعات کی فہرست بناتا ہے (اگر موضوع نامعلوم یا غیر تعاون یافتہ ہو تو رک جاتا ہے)
2. LLM کے ذریعے آوازیں منتخب کرتا ہے (مونولوگ کے لیے ایک آواز؛ ڈیوولوگ کے لیے مرد اور خاتون)
3. ہر ذیلی موضوع کے لیے بیک وقت مونولوگ متن تیار کرتا ہے
4. سرخ-سیاہ طاق-جفت طریقہ استعمال کرتے ہوئے ملحقہ ذیلی موضوعات میں متن کی نقل کو ختم کرتا ہے، کل لمبائی میں 6-40% کمی کرتا ہے
5. ڈیوولوگ کے لیے، ڈائیلاگ متن اور لہجے کی ہدایات تیار کرتا ہے
6. OpenAI TTS ماڈلز کا استعمال کرتے ہوئے بیک وقت متن کو تقریر میں تبدیل کرتا ہے
7. `ffmpeg` کے ساتھ آڈیو حصوں کو جوڑتا ہے، حصوں اور ذیلی موضوعات کے درمیان وقفے شامل کرتا ہے
## استعمال شدہ ماڈلز
- **علمی ماڈل** (`gpt-6-sol`): ذیلی موضوعات کی فہرست، آواز کا انتخاب، مونولوگ متن کی تخلیق (اندرونی علم سے)، ڈیوولوگ متن کی تخلیق
- **متن ماڈل** (`gpt-6-sol`): سورس دستاویزات سے مونولوگ متن کی تخلیق، نقل کا خاتمہ
- **TTS ماڈل** (`gpt-4o-mini-tts-2025-12-15`): تقریر کی تخلیق
## استعمال
- [OpenAI API کلید](https://platform.openai.com/api-keys) درکار ہے
- ڈیفالٹ آؤٹ پٹ دورانیہ تقریباً 1 گھنٹہ ہے؛ جامع کوریج اکثر کئی گھنٹے کی فائلیں تیار کرتی ہے
- دورانیہ کنٹرول کرنے کے لیے `--max-sections` (کم از کم 3) کے ساتھ حصوں کو محدود کرسکتے ہیں
- سنگل اسپیکر (`--speakers 1`) اور دو اسپیکر موڈز کو سپورٹ کرتا ہے
- `--document` کے ذریعے مارک ڈاؤن سورس دستاویزات قبول کرتا ہے
- آؤٹ پٹ میں سیکشن باؤنڈری پر آڈیو مارکر شامل ہوسکتے ہیں
- مقامی طور پر `./work/<topic>` ڈائریکٹری میں کیش کیا جاتا ہے
## ترتیب
- `.env` فائل یا ماحول میں `OPENAI_API_KEY` سیٹ کریں
- اختیاری طور پر `PODGENAI_OPENAI_MAX_WORKERS` سیٹ کریں (ڈیفالٹ: 16، زیادہ سے زیادہ: 32)
- آڈیو جوڑنے کے لیے `ffmpeg` اور `ffprobe` درکار ہیں
## لاگت کا تخمینہ
10 گھنٹے کے پوڈکاسٹ کے لیے تخمینی لاگت $10 USD ہے، جس میں زیادہ تر اخراجات TTS تخلیق سے ہوتے ہیں۔ کم دورانیے متناسب طور پر کم لاگت رکھتے ہیں۔
## آؤٹ پٹ فارمیٹس
- آڈیو بک/پوڈکاسٹ استعمال کے لیے تیار کردہ MP3 فائلیں
- تجویز کردہ پلے بیک رفتار: غیر تکنیکی موضوعات کے لیے 1.05x، تکنیکی موضوعات کے لیے 1.0x، غیر ملکی زبان کے مواد کے لیے 0.95x
## تنصیب
PyPI کے ذریعے دستیاب: `pip install podgenai` یا `uv add podgenai`
`generate_media()` فنکشن کے ساتھ Python لائبریری کے طور پر بھی استعمال کیا جاسکتا ہے۔
## لائسنس
GNU Lesser General Public License (LGPL)
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.