इस प्रोजेक्ट के बारे में
Podcastfy एक ओपन-सोर्स Python पैकेज है जो जनरेटिव AI का उपयोग करके मल्टीमॉडल सामग्री को संवादात्मक ऑडियो पॉडकास्ट में परिवर्तित करता है। इसे अनुसंधान संश्लेषण के लिए बंद UI-आधारित उपकरणों के एक खुले, प्रोग्रामेटिक विकल्प के रूप में स्थापित किया गया है, जो एकल होस्टेड इंटरफ़ेस के बजाय अनुकूलन और पैमाने पर जोर देता है।
इनपुट और आउटपुट
- स्रोत सामग्री के रूप में वेबसाइटों, PDFs, छवियों, YouTube वीडियो और उपयोगकर्ता-प्रदत्त विषयों को स्वीकार करता है।
- बहुभाषी ऑडियो वार्तालाप उत्पन्न करता है, जिसमें छोटे (लगभग 2-5 मिनट) और लंबे (30+ मिनट) प्रारूपों के लिए समर्थन है।
- README छवियों, व्यक्तिगत वेबसाइटों, लंबे साक्षात्कारों, पुस्तकों और गैर-अंग्रेज़ी समाचार या अनुसंधान पृष्ठों से उत्पन्न उदाहरण आउटपुट दिखाता है।
इसका उपयोग कैसे किया जाता है
- PyPI से `podcastfy` के रूप में स्थापित किया जा सकता है; इसके लिए Python 3.11+ और ऑडियो प्रोसेसिंग के लिए ffmpeg की आवश्यकता होती है।
- Python उपयोग एक एकल कॉल है: `podcastfy.client` से `generate_podcast(urls=[...])`।
- एक CLI `python -m podcastfy.client --url ...` के माध्यम से उपलब्ध है।
- URL-आधारित अनुरोधों की सेवा के लिए एक बीटा FastAPI/Docker पथ प्रलेखित है।
अनुकूलन और एकीकरण
- वार्तालाप प्रारूप, शैली और आवाज़ें अनुकूलित की जा सकती हैं।
- ट्रांसक्रिप्ट निर्माण OpenAI, Anthropic और Google जैसे प्रदाताओं के 100+ LLM मॉडल, या अधिक गोपनीयता और नियंत्रण के लिए स्थानीय LLM (README में 156+ HuggingFace मॉडल का उल्लेख है) का उपयोग कर सकता है।
- टेक्स्ट-टू-स्पीच एकीकरण में OpenAI, Google, ElevenLabs और Microsoft Edge शामिल हैं।
- कॉन्फ़िगरेशन और API कुंजियाँ प्रलेखित सेटिंग्स फ़ाइलों के माध्यम से संभाली जाती हैं।
परियोजना स्थिति और पारिस्थितिकी तंत्र
- Apache 2.0 के तहत लाइसेंस प्राप्त, Read the Docs पर दस्तावेज़ीकरण, एक Colab नोटबुक, परीक्षण और Docker प्रकाशन वर्कफ़्लो के साथ।
- README Podcastfy के साथ निर्मित परियोजनाओं को सूचीबद्ध करता है, जिसमें OpenNotebook, SurfSense, OpenPod, Podcast-llm और एक Hugging Face डेमो शामिल हैं।
- बताए गए उपयोग के मामलों में सामग्री निर्माता लेखों को ऑडियो में पुनः उपयोग करना, शिक्षक व्याख्यान सामग्री को परिवर्तित करना, शोधकर्ता ऑडियो सारांश उत्पन्न करना, और पहुंच समर्थक लिखित या दृश्य सामग्री को श्रवण प्रारूपों में बदलना शामिल हैं।
यह अवलोकन केवल रिपॉजिटरी README में वर्णित क्षमताओं को दर्शाता है; यहां कोई स्वतंत्र बेंचमार्क, रैंकिंग या प्रदर्शन दावे नहीं किए गए हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.