このプロジェクトについて
これはNotebook形式で構成されたマルチモーダルモデル学習プロジェクトであり、主线は「視覚基盤モデル → 画像テキストアラインメント → マルチモーダル理解と生成 → 拡散モデル → マルチモーダル大規模モデル」で、各Notebookには中国語コメントが付いており、入門から上級学習に適しています。
内容は番号順に進みます:
01 ViT:Vision Transformerをゼロから手書きし、Patch Embedding、学習可能な位置エンコーディング、CLS Token、Transformer Encoder、分類ヘッドを網羅し、Patch分割とアテンションヒートマップを可視化するとともに、HuggingFace公式APIも実演します。
02 CLIP:公式APIによる画像テキスト類似度とゼロショット分類を実演し、テキスト/画像エンコーディング、投影、L2正規化、温度スケーリング付きコサイン類似度を段階的に分解し、簡易版デュアルエンコーダと対照損失を手書きします。
03 ALBEF:「まずアラインメント、次に融合」という考え方で、ViT画像エンコーダ、BERTテキストエンコーダ、マルチヘッドクロスアテンション、マルチモーダル融合層を実装し、ITC/ITM/MLMの3目標とモーメンタム蒸留を説明します。
04 BLIP:MED統一エンコーダ・デコーダアーキテクチャを紹介し、同一のBERT重みがアテンションマスクによって単一モーダル符号化、クロスモーダル符号化、因果デコーディングの3モードを切り替えることを示し、画像キャプション、視覚的質問応答、特徴抽出、画像テキストマッチングを実演します。
05 BLIP-2:Q-Formerで凍結されたEVA-ViT-G/14と凍結されたOPTを橋渡しし、HookでQ-Former内部のテンソルを捕捉し、32個の学習可能なQuery Tokenの形状を表示し、簡易版Q-Formerを手書きします。
06 Stable Diffusionアーキテクチャ可視化:3つのサブNotebookでそれぞれprint(model)、torchinfo、torchvizを用いてVAE、CLIPテキストエンコーダ、Tokenizer、U-Netを表示し、テキストツリー、パラメータ表、autograd計算グラフの3つの視点を比較します。
07 DDIM手動推論:Diffusers Pipelineに依存せず、タイムステップ埋め込み、テキスト符号化、クロスアテンション、U-Netデノイズループ、VAEデコードをゼロから実装し、DDIMとDDPMの違いを説明します。
08 テキストから画像生成の実践:diffusersとModelScopeに基づき、重みのダウンロード、Pipelineの読み込み、Prompt推論、結果の可視化を完了します。
09 Qwen3-VL:Qwen3-VL-2B-Instructを読み込み、マルチモーダル推論と完全な構造を表示し、Patch Merger、DeepStack、3D畳み込みPatch埋め込みによる画像/動画の統合処理を解説します。
リポジトリには学習パス提案、依存関係リスト(torch、transformers、diffusers、modelscope、torchinfo、torchvizなど、torchvizはシステムレベルのGraphvizが必要)およびクイックスタート手順も示されています。モデル重みは初回実行時に自動ダウンロードされ、model_cache/の対応するサブディレクトリにキャッシュされます。プロジェクトはMITライセンスを採用しています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.