इस प्रोजेक्ट के बारे में

यह एक Notebook रूप में संगठित मल्टीमॉडल मॉडल सीखने की परियोजना है, जिसकी मुख्य रेखा है “विज़न बेसिक मॉडल → इमेज-टेक्स्ट अलाइनमेंट → मल्टीमॉडल समझ और जनरेशन → डिफ्यूज़न मॉडल → मल्टीमॉडल बड़े मॉडल”, प्रत्येक Notebook में चीनी टिप्पणियाँ हैं, जो शुरुआती और उन्नत दोनों के लिए उपयुक्त है। सामग्री क्रमांकित और क्रमिक है: 01 ViT: शून्य से Vision Transformer लिखें, जिसमें Patch Embedding, सीखने योग्य पोज़िशनल एन्कोडिंग, CLS Token, Transformer Encoder और क्लासिफिकेशन हेड शामिल हैं, और Patch विभाजन तथा अटेंशन हीटमैप का विज़ुअलाइज़ेशन करें, साथ ही HuggingFace आधिकारिक API का प्रदर्शन करें। 02 CLIP: आधिकारिक API के इमेज-टेक्स्ट समानता और ज़ीरो-शॉट क्लासिफिकेशन का प्रदर्शन करें, चरणबद्ध रूप से टेक्स्ट/इमेज एन्कोडिंग, प्रोजेक्शन, L2 नॉर्मलाइज़ेशन और तापमान स्केलिंग कोसाइन समानता को विभाजित करें, और सरलीकृत दोहरे एन्कोडर तथा कंट्रास्टिव लॉस को हाथ से लिखें। 03 ALBEF: “पहले अलाइनमेंट फिर फ्यूज़न” के विचार से, ViT इमेज एन्कोडर, BERT टेक्स्ट एन्कोडर, मल्टी-हेड क्रॉस अटेंशन और मल्टीमॉडल फ्यूज़न लेयर को लागू करें, और ITC/ITM/MLM तीन लक्ष्यों तथा मोमेंटम डिस्टिलेशन को समझाएँ। 04 BLIP: MED एकीकृत एन्कोडर-डिकोडर आर्किटेक्चर का परिचय दें, एक ही BERT वेट अटेंशन मास्क के माध्यम से यूनिमॉडल एन्कोडिंग, क्रॉस-मॉडल एन्कोडिंग और कॉज़ल डिकोडिंग तीन मोड स्विच करता है, और इमेज कैप्शनिंग, विज़ुअल क्वेश्चन आंसरिंग, फीचर एक्सट्रैक्शन तथा इमेज-टेक्स्ट मैचिंग का प्रदर्शन करें। 05 BLIP-2: Q-Former के माध्यम से फ्रोज़न EVA-ViT-G/14 और फ्रोज़न OPT को जोड़ें, Hook का उपयोग करके Q-Former के आंतरिक टेंसर को कैप्चर करें, 32 सीखने योग्य Query Token का आकार दिखाएँ, और सरलीकृत Q-Former को हाथ से लिखें। 06 Stable Diffusion आर्किटेक्चर विज़ुअलाइज़ेशन: तीन उप-Notebook क्रमशः print(model), torchinfo, torchviz का उपयोग करके VAE, CLIP टेक्स्ट एन्कोडर, Tokenizer और U-Net को प्रदर्शित करते हैं, और टेक्स्ट ट्री, पैरामीटर तालिका तथा autograd कंप्यूटेशन ग्राफ तीन दृष्टिकोणों की तुलना करते हैं। 07 DDIM मैनुअल इन्फरेंस: Diffusers Pipeline पर निर्भर न रहते हुए, शून्य से टाइम स्टेप एम्बेडिंग, टेक्स्ट एन्कोडिंग, क्रॉस अटेंशन, U-Net डीनॉइज़िंग लूप और VAE डिकोडिंग को लागू करें, और DDIM तथा DDPM के अंतर को समझाएँ। 08 टेक्स्ट-टू-इमेज व्यावहारिक: diffusers और ModelScope के आधार पर वेट डाउनलोड, Pipeline लोडिंग, Prompt इन्फरेंस और परिणाम विज़ुअलाइज़ेशन पूरा करें। 09 Qwen3-VL: Qwen3-VL-2B-Instruct लोड करें, मल्टीमॉडल इन्फरेंस और पूर्ण संरचना प्रदर्शित करें, Patch Merger, DeepStack और 3D कन्वोल्यूशन Patch एम्बेडिंग द्वारा इमेज/वीडियो के एकीकृत प्रसंस्करण को समझाएँ। रिपॉजिटरी में सीखने के पथ का सुझाव, निर्भरता सूची (torch, transformers, diffusers, modelscope, torchinfo, torchviz आदि, torchviz के लिए सिस्टम-स्तरीय Graphviz आवश्यक) तथा त्वरित शुरुआत के चरण भी दिए गए हैं; मॉडल वेट पहली बार चलाने पर स्वचालित रूप से डाउनलोड होकर model_cache/ के संबंधित उप-निर्देशिका में कैश हो जाते हैं। परियोजना MIT लाइसेंस का उपयोग करती है।