عن المشروع

هذا مشروع تعلم نماذج متعددة الوسائط منظم في شكل دفاتر Notebook، وخطه الرئيسي هو "النماذج الأساسية للرؤية → المحاذاة بين الصورة والنص → الفهم والتوليد متعدد الوسائط → نماذج الانتشار → النماذج اللغوية الكبيرة متعددة الوسائط"، ويحتوي كل Notebook على تعليقات بالصينية، وهو مناسب للتعلم التمهيدي والمتقدم. المحتوى يتدرج حسب الترقيم: 01 ViT: كتابة Vision Transformer يدويا من الصفر، ويشمل Patch Embedding، والترميز الموضعي القابل للتعلم، وCLS Token، وTransformer Encoder، ورأس التصنيف، مع تصور تقسيم Patch وخرائط حرارة الانتباه، كما يعرض واجهة HuggingFace الرسمية. 02 CLIP: يعرض تشابه الصورة والنص والتصنيف الصفري عبر الواجهة الرسمية، ويفكك تدريجيا ترميز النص/الصورة، والإسقاط، وتطبيع L2، وتشابه جيب التمام مع قياس الحرارة، ويكتب نسخة مبسطة من المشفر المزدوج وخسارة التباين. 03 ALBEF: وفق فكرة "المحاذاة أولا ثم الدمج"، ينفذ مشفر صور ViT، ومشفر نص BERT، والانتباه المتقاطع متعدد الرؤوس، وطبقة الدمج متعددة الوسائط، ويشرح الأهداف الثلاثة ITC/ITM/MLM والتقطير الزخمي. 04 BLIP: يقدم بنية MED الموحدة للترميز وفك الترميز، حيث تبدل أوزان BERT نفسها عبر أقنعة الانتباه بين ثلاثة أنماط: الترميز أحادي الوسائط، والترميز عبر الوسائط، وفك الترميز السببي، ويعرض وصف الصورة، والأسئلة البصرية، واستخراج الميزات، ومطابقة الصورة والنص. 05 BLIP-2: يستخدم Q-Former للربط بين EVA-ViT-G/14 المجمد وOPT المجمد، ويستخدم Hook لالتقاط التنسورات الداخلية في Q-Former، ويعرض شكل 32 Query Token قابلا للتعلم، ويكتب نسخة مبسطة من Q-Former. 06 تصور بنية Stable Diffusion: ثلاثة Notebooks فرعية تعرض VAE، ومشفر نص CLIP، وTokenizer، وU-Net باستخدام print(model) وtorchinfo وtorchviz، وتقارن بين شجرة النص، وجدول المعاملات، ومخطط الحساب autograd. 07 استدلال DDIM اليدوي: من دون الاعتماد على Diffusers Pipeline، ينفذ من الصفر تضمين الخطوات الزمنية، وترميز النص، والانتباه المتقاطع، وحلقة إزالة الضوضاء في U-Net، وفك ترميز VAE، ويشرح الفرق بين DDIM وDDPM. 08 تطبيق توليد الصور من النص: يعتمد على diffusers وModelScope لإكمال تنزيل الأوزان، وتحميل Pipeline، واستدلال Prompt، وتصور النتائج. 09 Qwen3-VL: يحمل Qwen3-VL-2B-Instruct، ويعرض الاستدلال متعدد الوسائط والبنية الكاملة، ويشرح Patch Merger وDeepStack وتضمين Patch بالالتفاف ثلاثي الأبعاد للمعالجة الموحدة للصور/الفيديو. كما يقدم المستودع اقتراحات لمسار التعلم، وقائمة التبعيات (torch، transformers، diffusers، modelscope، torchinfo، torchviz وغيرها، ويحتاج torchviz إلى Graphviz على مستوى النظام)، وخطوات البدء السريع؛ ويتم تنزيل أوزان النماذج تلقائيا عند التشغيل الأول وتخزينها مؤقتا في الدليل الفرعي المقابل ضمن model_cache/. يستخدم المشروع ترخيص MIT.