প্রকল্প সম্পর্কে

# podgenai podgenai একটি Python অ্যাপ্লিকেশন যা একটি প্রদত্ত বিষয়ে OpenAI LLM ব্যবহার করে তথ্যপূর্ণ এক-বক্তা বা দুই-বক্তার অডিওবুক/পডকাস্ট MP3 ফাইল তৈরি করে। বিষয়বস্তু মডেলের অভ্যন্তরীণ জ্ঞান বা প্রদত্ত মার্কডাউন উৎস নথি থেকে আসে; ওয়েব অনুসন্ধান ব্যবহার করা হয় না। ## এটি কীভাবে কাজ করে একটি প্রদত্ত বিষয়ের জন্য, টুলটি: 1. LLM ব্যবহার করে প্রযোজ্য উপ-বিষয় তালিকাভুক্ত করে (বিষয় অজানা বা অসমর্থিত হলে বাতিল করে) 2. LLM এর মাধ্যমে ভয়েস নির্বাচন করে (একক বক্তৃতার জন্য একক ভয়েস; দ্বৈত বক্তৃতার জন্য পুরুষ ও মহিলা) 3. প্রতিটি উপ-বিষয়ের জন্য একসাথে একক বক্তৃতা পাঠ তৈরি করে 4. একটি লাল-কালো বিজোড়-জোড় পদ্ধতি ব্যবহার করে সংলগ্ন উপ-বিষয় জুড়ে পাঠ ডিডুপ্লিকেট করে, মোট দৈর্ঘ্য 6-40% কমিয়ে দেয় 5. দ্বৈত বক্তৃতার জন্য, সংলাপ পাঠ এবং স্বর নির্দেশনা তৈরি করে 6. OpenAI TTS মডেল ব্যবহার করে একসাথে পাঠকে বক্তৃতায় রূপান্তর করে 7. `ffmpeg` দিয়ে অডিও সেগমেন্ট সংযুক্ত করে, অংশ এবং উপ-বিষয়গুলির মধ্যে বিরতি যোগ করে ## ব্যবহৃত মডেল - **জ্ঞান মডেল** (`gpt-6-sol`): উপ-বিষয় তালিকা, ভয়েস নির্বাচন, একক বক্তৃতা পাঠ তৈরি (অভ্যন্তরীণ জ্ঞান থেকে), দ্বৈত বক্তৃতা পাঠ তৈরি - **টেক্সট মডেল** (`gpt-6-sol`): উৎস নথি থেকে একক বক্তৃতা পাঠ তৈরি, ডিডুপ্লিকেশন - **TTS মডেল** (`gpt-4o-mini-tts-2025-12-15`): বক্তৃতা উৎপাদন ## ব্যবহার - একটি [OpenAI API কী](https://platform.openai.com/api-keys) প্রয়োজন - ডিফল্ট আউটপুট সময়কাল প্রায় ১ ঘন্টা লক্ষ্য করে; ব্যাপক কভারেজ প্রায়শই বহু-ঘণ্টার ফাইল তৈরি করে - সময়কাল নিয়ন্ত্রণ করতে `--max-sections` (সর্বনিম্ন ৩) দিয়ে বিভাগ সীমিত করতে পারে - একক-বক্তা (`--speakers 1`) এবং দুই-বক্তা মোড সমর্থন করে - `--document` এর মাধ্যমে মার্কডাউন উৎস নথি গ্রহণ করে - আউটপুটে বিভাগ সীমানায় অডিও মার্কার অন্তর্ভুক্ত থাকতে পারে - `./work/<topic>` ডিরেক্টরিতে স্থানীয়ভাবে ক্যাশ করা হয় ## কনফিগারেশন - `.env` ফাইল বা পরিবেশে `OPENAI_API_KEY` সেট করুন - ঐচ্ছিকভাবে `PODGENAI_OPENAI_MAX_WORKERS` সেট করুন (ডিফল্ট: ১৬, সর্বোচ্চ: ৩২) - অডিও সংযুক্তির জন্য `ffmpeg` এবং `ffprobe` প্রয়োজন ## খরচ অনুমান আনুমানিক খরচ ১০ ঘন্টার পডকাস্টের জন্য $১০ USD, যার বেশিরভাগ খরচ TTS উৎপাদন থেকে। ছোট সময়কাল আনুপাতিকভাবে কম খরচ করে। ## আউটপুট ফরম্যাট - অডিওবুক/পডকাস্ট ব্যবহারের জন্য তৈরি MP3 ফাইল - প্রস্তাবিত প্লেব্যাক গতি: অ-প্রযুক্তিগত বিষয়ের জন্য 1.05x, প্রযুক্তিগত বিষয়ের জন্য 1.0x, বিদেশী ভাষার বিষয়বস্তুর জন্য 0.95x ## ইনস্টলেশন PyPI-তে উপলব্ধ: `pip install podgenai` বা `uv add podgenai` `generate_media()` ফাংশন সহ Python লাইব্রেরি হিসাবেও ব্যবহার করা যেতে পারে। ## লাইসেন্স GNU Lesser General Public License (LGPL)