À propos du projet

Podcastfy est un package Python open-source qui convertit du contenu multimodal en podcasts audio conversationnels à l'aide de l'IA générative. Il se positionne comme une alternative ouverte et programmable aux outils fermés basés sur une interface utilisateur pour la synthèse de recherche, en mettant l'accent sur la personnalisation et l'échelle plutôt que sur une interface hébergée unique. Entrées et sorties - Accepte les sites web, PDF, images, vidéos YouTube et sujets fournis par l'utilisateur comme matériel source. - Produit des conversations audio multilingues, avec prise en charge des formats courts (environ 2 à 5 minutes) et longs (30 minutes et plus). - Le README montre des exemples de sorties générées à partir d'images, de sites web personnels, de longues interviews, de livres et de pages d'actualités ou de recherche non anglaises. Comment il est utilisé - Installable depuis PyPI sous le nom `podcastfy` ; nécessite Python 3.11+ et ffmpeg pour le traitement audio. - L'utilisation en Python est un appel unique : `generate_podcast(urls=[...])` depuis `podcastfy.client`. - Une CLI est disponible via `python -m podcastfy.client --url ...`. - Un chemin FastAPI/Docker bêta est documenté pour servir les requêtes basées sur des URL. Personnalisation et intégrations - Le format de conversation, le style et les voix peuvent être personnalisés. - La génération de transcriptions peut utiliser plus de 100 modèles LLM de fournisseurs tels qu'OpenAI, Anthropic et Google, ou des LLM locaux (le README mentionne plus de 156 modèles HuggingFace) pour une plus grande confidentialité et un meilleur contrôle. - Les intégrations de synthèse vocale incluent OpenAI, Google, ElevenLabs et Microsoft Edge. - La configuration et les clés API sont gérées via des fichiers de paramètres documentés. Statut du projet et écosystème - Sous licence Apache 2.0, avec documentation sur Read the Docs, un notebook Colab, des tests et des workflows de publication Docker. - Le README liste des projets construits avec Podcastfy, notamment OpenNotebook, SurfSense, OpenPod, Podcast-llm et une démo Hugging Face. - Les cas d'utilisation déclarés incluent les créateurs de contenu réutilisant des articles en audio, les éducateurs convertissant des supports de cours, les chercheurs produisant des résumés audio et les défenseurs de l'accessibilité transformant du contenu écrit ou visuel en formats auditifs. Cet aperçu reflète uniquement les capacités décrites dans le README du dépôt ; aucune référence indépendante, classement ou affirmation de performance n'est fait ici.