Об этом проекте

Podcastfy — это пакет Python с открытым исходным кодом, который преобразует мультимодальный контент в разговорные аудиоподкасты с помощью генеративного ИИ. Он позиционируется как открытая программная альтернатива закрытым инструментам с пользовательским интерфейсом для синтеза исследований, с акцентом на настройку и масштабирование, а не на единый размещенный интерфейс. Входные и выходные данные - Принимает веб-сайты, PDF-файлы, изображения, видео YouTube и темы, предоставленные пользователем, в качестве исходного материала. - Создает многоязычные аудиоразговоры с поддержкой коротких (примерно 2–5 минут) и длинных (30+ минут) форматов. - В README показаны примеры выходных данных, созданных из изображений, личных веб-сайтов, длинных интервью, книг и неанглоязычных новостных или исследовательских страниц. Как это используется - Устанавливается из PyPI как `podcastfy`; требует Python 3.11+ и ffmpeg для обработки аудио. - Использование в Python — это один вызов: `generate_podcast(urls=[...])` из `podcastfy.client`. - Доступен CLI через `python -m podcastfy.client --url ...`. - Документирован бета-путь FastAPI/Docker для обработки запросов на основе URL. Настройка и интеграции - Можно настраивать формат разговора, стиль и голоса. - Для генерации транскриптов можно использовать более 100 моделей LLM от таких провайдеров, как OpenAI, Anthropic и Google, или локальные LLM (в README упоминается более 156 моделей HuggingFace) для большей конфиденциальности и контроля. - Интеграции преобразования текста в речь включают OpenAI, Google, ElevenLabs и Microsoft Edge. - Конфигурация и ключи API обрабатываются через документированные файлы настроек. Статус проекта и экосистема - Лицензирован под Apache 2.0, с документацией на Read the Docs, блокнотом Colab, тестами и рабочими процессами публикации Docker. - В README перечислены проекты, созданные с помощью Podcastfy, включая OpenNotebook, SurfSense, OpenPod, Podcast-llm и демо Hugging Face. - Заявленные варианты использования включают создателей контента, перепрофилирующих статьи в аудио, преподавателей, преобразующих учебные материалы, исследователей, создающих аудиосводки, и защитников доступности, превращающих письменный или визуальный контент в слуховые форматы. Этот обзор отражает только возможности, описанные в README репозитория; здесь не делается независимых бенчмарков, рейтингов или заявлений о производительности.