这个项目能做什么
这是一个以 Notebook 形式组织的多模态模型学习项目,主线为“视觉基础模型 → 图文对齐 → 多模态理解与生成 → 扩散模型 → 多模态大模型”,每个 Notebook 配有中文注释,适合入门与进阶学习。
内容按编号递进:
01 ViT:从零手写 Vision Transformer,涵盖 Patch Embedding、可学习位置编码、CLS Token、Transformer Encoder 与分类头,并可视化 Patch 划分与注意力热力图,同时演示 HuggingFace 官方 API。
02 CLIP:演示官方 API 的图文相似度与零样本分类,逐步拆解文本/图像编码、投影、L2 归一化与温度缩放余弦相似度,并手写简化版双编码器与对比损失。
03 ALBEF:以“先对齐后融合”为思路,实现 ViT 图像编码器、BERT 文本编码器、多头交叉注意力与多模态融合层,并说明 ITC/ITM/MLM 三目标与动量蒸馏。
04 BLIP:介绍 MED 统一编解码架构,同一 BERT 权重通过注意力掩码切换单模态编码、跨模态编码与因果解码三种模式,并演示图像描述、视觉问答、特征提取与图文匹配。
05 BLIP-2:以 Q-Former 桥接冻结的 EVA-ViT-G/14 与冻结的 OPT,用 Hook 捕获 Q-Former 内部张量,展示 32 个可学习 Query Token 的形状,并手写简化版 Q-Former。
06 Stable Diffusion 架构可视化:三个子 Notebook 分别用 print(model)、torchinfo、torchviz 展示 VAE、CLIP 文本编码器、Tokenizer 与 U-Net,对比文本树、参数表格与 autograd 计算图三种视角。
07 DDIM 手动推理:不依赖 Diffusers Pipeline,从零实现时间步嵌入、文本编码、交叉注意力、U-Net 去噪循环与 VAE 解码,并说明 DDIM 与 DDPM 的差异。
08 文生图实战:基于 diffusers 与 ModelScope 完成权重下载、Pipeline 加载、Prompt 推理与结果可视化。
09 Qwen3-VL:加载 Qwen3-VL-2B-Instruct,展示多模态推理与完整结构,讲解 Patch Merger、DeepStack 与 3D 卷积 Patch 嵌入对图像/视频的统一处理。
仓库还给出学习路径建议、依赖清单(torch、transformers、diffusers、modelscope、torchinfo、torchviz 等,torchviz 需系统级 Graphviz)以及快速开始步骤;模型权重首次运行时自动下载并缓存到 model_cache/ 对应子目录。项目采用 MIT 许可。
评论
0 评分人数达到10人后显示
登录后参与讨论。