প্রকল্প সম্পর্কে
# podgenai
podgenai একটি Python অ্যাপ্লিকেশন যা একটি প্রদত্ত বিষয়ে OpenAI LLM ব্যবহার করে তথ্যপূর্ণ এক-বক্তা বা দুই-বক্তার অডিওবুক/পডকাস্ট MP3 ফাইল তৈরি করে। বিষয়বস্তু মডেলের অভ্যন্তরীণ জ্ঞান বা প্রদত্ত মার্কডাউন উৎস নথি থেকে আসে; ওয়েব অনুসন্ধান ব্যবহার করা হয় না।
## এটি কীভাবে কাজ করে
একটি প্রদত্ত বিষয়ের জন্য, টুলটি:
1. LLM ব্যবহার করে প্রযোজ্য উপ-বিষয় তালিকাভুক্ত করে (বিষয় অজানা বা অসমর্থিত হলে বাতিল করে)
2. LLM এর মাধ্যমে ভয়েস নির্বাচন করে (একক বক্তৃতার জন্য একক ভয়েস; দ্বৈত বক্তৃতার জন্য পুরুষ ও মহিলা)
3. প্রতিটি উপ-বিষয়ের জন্য একসাথে একক বক্তৃতা পাঠ তৈরি করে
4. একটি লাল-কালো বিজোড়-জোড় পদ্ধতি ব্যবহার করে সংলগ্ন উপ-বিষয় জুড়ে পাঠ ডিডুপ্লিকেট করে, মোট দৈর্ঘ্য 6-40% কমিয়ে দেয়
5. দ্বৈত বক্তৃতার জন্য, সংলাপ পাঠ এবং স্বর নির্দেশনা তৈরি করে
6. OpenAI TTS মডেল ব্যবহার করে একসাথে পাঠকে বক্তৃতায় রূপান্তর করে
7. `ffmpeg` দিয়ে অডিও সেগমেন্ট সংযুক্ত করে, অংশ এবং উপ-বিষয়গুলির মধ্যে বিরতি যোগ করে
## ব্যবহৃত মডেল
- **জ্ঞান মডেল** (`gpt-6-sol`): উপ-বিষয় তালিকা, ভয়েস নির্বাচন, একক বক্তৃতা পাঠ তৈরি (অভ্যন্তরীণ জ্ঞান থেকে), দ্বৈত বক্তৃতা পাঠ তৈরি
- **টেক্সট মডেল** (`gpt-6-sol`): উৎস নথি থেকে একক বক্তৃতা পাঠ তৈরি, ডিডুপ্লিকেশন
- **TTS মডেল** (`gpt-4o-mini-tts-2025-12-15`): বক্তৃতা উৎপাদন
## ব্যবহার
- একটি [OpenAI API কী](https://platform.openai.com/api-keys) প্রয়োজন
- ডিফল্ট আউটপুট সময়কাল প্রায় ১ ঘন্টা লক্ষ্য করে; ব্যাপক কভারেজ প্রায়শই বহু-ঘণ্টার ফাইল তৈরি করে
- সময়কাল নিয়ন্ত্রণ করতে `--max-sections` (সর্বনিম্ন ৩) দিয়ে বিভাগ সীমিত করতে পারে
- একক-বক্তা (`--speakers 1`) এবং দুই-বক্তা মোড সমর্থন করে
- `--document` এর মাধ্যমে মার্কডাউন উৎস নথি গ্রহণ করে
- আউটপুটে বিভাগ সীমানায় অডিও মার্কার অন্তর্ভুক্ত থাকতে পারে
- `./work/<topic>` ডিরেক্টরিতে স্থানীয়ভাবে ক্যাশ করা হয়
## কনফিগারেশন
- `.env` ফাইল বা পরিবেশে `OPENAI_API_KEY` সেট করুন
- ঐচ্ছিকভাবে `PODGENAI_OPENAI_MAX_WORKERS` সেট করুন (ডিফল্ট: ১৬, সর্বোচ্চ: ৩২)
- অডিও সংযুক্তির জন্য `ffmpeg` এবং `ffprobe` প্রয়োজন
## খরচ অনুমান
আনুমানিক খরচ ১০ ঘন্টার পডকাস্টের জন্য $১০ USD, যার বেশিরভাগ খরচ TTS উৎপাদন থেকে। ছোট সময়কাল আনুপাতিকভাবে কম খরচ করে।
## আউটপুট ফরম্যাট
- অডিওবুক/পডকাস্ট ব্যবহারের জন্য তৈরি MP3 ফাইল
- প্রস্তাবিত প্লেব্যাক গতি: অ-প্রযুক্তিগত বিষয়ের জন্য 1.05x, প্রযুক্তিগত বিষয়ের জন্য 1.0x, বিদেশী ভাষার বিষয়বস্তুর জন্য 0.95x
## ইনস্টলেশন
PyPI-তে উপলব্ধ: `pip install podgenai` বা `uv add podgenai`
`generate_media()` ফাংশন সহ Python লাইব্রেরি হিসাবেও ব্যবহার করা যেতে পারে।
## লাইসেন্স
GNU Lesser General Public License (LGPL)
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.