Sobre el proyecto

Podcastfy es un paquete de Python de código abierto que convierte contenido multimodal en pódcasts de audio conversacionales mediante IA generativa. Se posiciona como una alternativa abierta y programática a las herramientas cerradas basadas en interfaz para la síntesis de investigación, y hace hincapié en la personalización y la escala en lugar de una única interfaz alojada. Entradas y salidas - Acepta sitios web, PDF, imágenes, videos de YouTube y temas proporcionados por el usuario como material de origen. - Produce conversaciones de audio multilingües, con compatibilidad con formatos cortos (aproximadamente 2-5 minutos) y de formato largo (más de 30 minutos). - El README muestra ejemplos de salidas generadas a partir de imágenes, sitios web personales, entrevistas largas, libros y páginas de noticias o investigación en idiomas distintos del inglés. Cómo se usa - Se puede instalar desde PyPI como `podcastfy`; requiere Python 3.11+ y ffmpeg para el procesamiento de audio. - El uso desde Python es una sola llamada: `generate_podcast(urls=[...])` desde `podcastfy.client`. - Hay una CLI disponible mediante `python -m podcastfy.client --url ...`. - Se documenta una ruta beta con FastAPI/Docker para servir solicitudes basadas en URL. Personalización e integraciones - El formato, el estilo y las voces de la conversación se pueden personalizar. - La generación de transcripciones puede usar más de 100 modelos LLM de proveedores como OpenAI, Anthropic y Google, o LLM locales (el README menciona más de 156 modelos de HuggingFace) para una mayor privacidad y control. - Las integraciones de texto a voz incluyen OpenAI, Google, ElevenLabs y Microsoft Edge. - La configuración y las claves de API se gestionan mediante archivos de configuración documentados. Estado del proyecto y ecosistema - Tiene licencia Apache 2.0, con documentación en Read the Docs, un cuaderno de Colab, pruebas y flujos de trabajo de publicación con Docker. - El README enumera proyectos creados con Podcastfy, incluidos OpenNotebook, SurfSense, OpenPod, Podcast-llm y una demo de Hugging Face. - Los casos de uso indicados incluyen creadores de contenido que reutilizan artículos en audio, educadores que convierten materiales de clase, investigadores que producen resúmenes en audio y defensores de la accesibilidad que convierten contenido escrito o visual en formatos auditivos. Esta descripción general refleja únicamente las capacidades descritas en el README del repositorio; aquí no se presentan evaluaciones independientes, clasificaciones ni afirmaciones de rendimiento.