このプロジェクトについて

Fooocusは、Stable Diffusion XLアーキテクチャを基盤とし、Gradioウェブインターフェースを通じて提供されるオフライン・オープンソースの画像生成アプリケーションです。その設計目標は、Midjourneyなどのホスト型サービスと同様に、手動でのパラメータ調整ではなく、プロンプトと画像に集中できるようにすることです。このプロジェクトは、オフラインのGPT-2ベースのプロンプト処理エンジンと、短いプロンプトでも長いプロンプトでも良い結果を生成するためのサンプリング改善について説明しています。 READMEに記載されている主な機能には、テキストから画像への生成、入力画像のアップスケーリングとバリエーション、インペインティングとアウトペインティング(上下左右へのパン)、イメージプロンプト、InsightFaceによるフェイススワップ、画像説明、スタイルプリセット、ネガティブプロンプト、アスペクト比の選択、A1111スタイルのリウェイティングを使用したプロンプト重み付けが含まれます。また、独自のインペイントアルゴリズムとインペイントモデル、単一のk-sampler内でのネイティブなリファイナースワップ、ネガティブADMガイダンス、セルフアテンションガイダンスのバリエーションも文書化されています。 インストール方法は、Windows向けにはダウンロード可能なパッケージとrun.bat、Linux向けにはAnaconda、Python venv、またはネイティブPython 3.10、AMD GPU向けにはROCmまたはDirectML(ベータ版と記載)、Mac向けにはPyTorch MPS、そしてDockerが提供されています。Colabノートブックも用意されています。READMEには、最小要件としてNvidia VRAM 4GBとシステムRAM 8GBが必要で、システムスワップが必要であること、CPUのみの操作には32GBのRAMが必要であることが記載されています。デフォルト/一般、リアル、アニメの3つのプリセットがあり、それぞれ異なるデフォルトモデルと設定が使用されます。UIは--listenでローカルに公開するか、--shareで共有でき、auth.jsonファイルを通じて基本認証を追加できます。 このプロジェクトは、バグ修正のみの限定的な長期サポートであり、現在のところ新しいモデルアーキテクチャへの移行予定はないと説明されています。READMEは、多くの偽サイトが存在し、このリポジトリが唯一の公式ソースであると警告しています。