このプロジェクトについて

Podcastfyは、生成AIを用いてマルチモーダルコンテンツを会話型音声ポッドキャストに変換するオープンソースのPythonパッケージです。研究統合のためのクローズドなUIベースのツールに対する、オープンでプログラム的な代替手段として位置づけられており、単一のホスト型インターフェースではなく、カスタマイズ性とスケールを重視しています。 入力と出力 - ウェブサイト、PDF、画像、YouTube動画、ユーザー提供のトピックをソース素材として受け付けます。 - 多言語の音声会話を生成し、短編(約2〜5分)と長編(30分以上)の形式に対応しています。 - READMEには、画像、個人ウェブサイト、長いインタビュー、書籍、非英語のニュースや研究ページから生成された出力例が示されています。 使用方法 - PyPIから`podcastfy`としてインストール可能で、Python 3.11以上と音声処理用のffmpegが必要です。 - Pythonでの使用は、`podcastfy.client`から`generate_podcast(urls=[...])`を1回呼び出すだけです。 - CLIは`python -m podcastfy.client --url ...`で利用できます。 - URLベースのリクエストを処理するためのベータ版のFastAPI/Dockerパスが文書化されています。 カスタマイズと統合 - 会話形式、スタイル、音声をカスタマイズできます。 - トランスクリプト生成には、OpenAI、Anthropic、Googleなどのプロバイダーが提供する100以上のLLMモデル、またはプライバシーと制御性を高めるためのローカルLLM(READMEには156以上のHuggingFaceモデルが記載されています)を使用できます。 - テキスト読み上げの統合には、OpenAI、Google、ElevenLabs、Microsoft Edgeが含まれます。 - 設定とAPIキーは、文書化された設定ファイルを通じて管理されます。 プロジェクトの状況とエコシステム - Apache 2.0ライセンスの下で提供され、Read the Docsでのドキュメント、Colabノートブック、テスト、Docker公開ワークフローが用意されています。 - READMEには、OpenNotebook、SurfSense、OpenPod、Podcast-llm、Hugging Faceデモなど、Podcastfyを使用して構築されたプロジェクトがリストされています。 - 記載されているユースケースには、記事を音声に再利用するコンテンツクリエイター、講義資料を変換する教育者、音声要約を作成する研究者、書面や視覚コンテンツを聴覚形式に変換するアクセシビリティ推進者が含まれます。 この概要は、リポジトリのREADMEに記載されている機能のみを反映したものであり、独立したベンチマーク、ランキング、性能に関する主張はここでは行いません。