প্রকল্প সম্পর্কে

এটি Notebook আকারে সংগঠিত একটি মাল্টিমোডাল মডেল শেখার প্রকল্প, যার মূল সূত্র হলো “ভিজ্যুয়াল ফাউন্ডেশন মডেল → ইমেজ-টেক্সট অ্যালাইনমেন্ট → মাল্টিমোডাল বোঝাপড়া ও জেনারেশন → ডিফিউশন মডেল → মাল্টিমোডাল লার্জ ল্যাঙ্গুয়েজ মডেল”; প্রতিটি Notebook-এ চীনা মন্তব্য রয়েছে, যা প্রাথমিক ও উন্নত উভয় স্তরের শেখার জন্য উপযুক্ত। বিষয়বস্তু ক্রমিক নম্বর অনুসারে এগিয়েছে: 01 ViT: শূন্য থেকে Vision Transformer হাতে লেখা হয়েছে, যেখানে Patch Embedding, শেখারযোগ্য পজিশন এনকোডিং, CLS Token, Transformer Encoder ও ক্লাসিফিকেশন হেড অন্তর্ভুক্ত; Patch বিভাজন ও অ্যাটেনশন হিটম্যাপ ভিজ্যুয়ালাইজ করা হয়েছে এবং HuggingFace-এর অফিসিয়াল API-ও দেখানো হয়েছে। 02 CLIP: অফিসিয়াল API-এর ইমেজ-টেক্সট সাদৃশ্য ও জিরো-শট ক্লাসিফিকেশন প্রদর্শন করা হয়েছে, ধাপে ধাপে টেক্সট/ইমেজ এনকোডিং, প্রজেকশন, L2 নরমালাইজেশন ও টেম্পারেচার স্কেলিং কোসাইন সাদৃশ্য বিশ্লেষণ করা হয়েছে, এবং একটি সরলীকৃত ডুয়াল এনকোডার ও কনট্রাস্টিভ লস হাতে লেখা হয়েছে। 03 ALBEF: “প্রথমে অ্যালাইন, পরে ফিউশন” ধারণায় ViT ইমেজ এনকোডার, BERT টেক্সট এনকোডার, মাল্টি-হেড ক্রস অ্যাটেনশন ও মাল্টিমোডাল ফিউশন লেয়ার বাস্তবায়ন করা হয়েছে, এবং ITC/ITM/MLM তিনটি লক্ষ্য ও মোমেন্টাম ডিস্টিলেশন ব্যাখ্যা করা হয়েছে। 04 BLIP: MED একীভূত এনকোডার-ডিকোডার আর্কিটেকচার পরিচয় করানো হয়েছে, যেখানে একই BERT ওয়েট অ্যাটেনশন মাস্কের মাধ্যমে ইউনিমোডাল এনকোডিং, ক্রস-মোডাল এনকোডিং ও কজাল ডিকোডিং—এই তিন মোডে পরিবর্তিত হয়; ইমেজ ক্যাপশনিং, ভিজ্যুয়াল কোয়েশ্চন অ্যানসারিং, ফিচার এক্সট্রাকশন ও ইমেজ-টেক্সট ম্যাচিং প্রদর্শন করা হয়েছে। 05 BLIP-2: Q-Former-এর মাধ্যমে ফ্রিজ করা EVA-ViT-G/14 ও ফ্রিজ করা OPT-কে সেতু করা হয়েছে, Hook ব্যবহার করে Q-Former-এর অভ্যন্তরীণ টেনসর ধরা হয়েছে, ৩২টি শেখারযোগ্য Query Token-এর আকৃতি দেখানো হয়েছে, এবং একটি সরলীকৃত Q-Former হাতে লেখা হয়েছে। 06 Stable Diffusion আর্কিটেকচার ভিজ্যুয়ালাইজেশন: তিনটি উপ-Notebook-এ যথাক্রমে print(model), torchinfo, torchviz ব্যবহার করে VAE, CLIP টেক্সট এনকোডার, Tokenizer ও U-Net প্রদর্শন করা হয়েছে, এবং টেক্সট ট্রি, প্যারামিটার টেবিল ও autograd কম্পিউটেশন গ্রাফ—এই তিন দৃষ্টিকোণ তুলনা করা হয়েছে। 07 DDIM ম্যানুয়াল ইনফারেন্স: Diffusers Pipeline-এর উপর নির্ভর না করে শূন্য থেকে টাইমস্টেপ এমবেডিং, টেক্সট এনকোডিং, ক্রস অ্যাটেনশন, U-Net ডিনয়েজিং লুপ ও VAE ডিকোডিং বাস্তবায়ন করা হয়েছে, এবং DDIM ও DDPM-এর পার্থক্য ব্যাখ্যা করা হয়েছে। 08 টেক্সট-টু-ইমেজ হ্যান্ডস-অন: diffusers ও ModelScope-এর ভিত্তিতে ওয়েট ডাউনলোড, Pipeline লোড, Prompt ইনফারেন্স ও ফলাফল ভিজ্যুয়ালাইজেশন সম্পন্ন করা হয়েছে। 09 Qwen3-VL: Qwen3-VL-2B-Instruct লোড করা হয়েছে, মাল্টিমোডাল ইনফারেন্স ও সম্পূর্ণ গঠন প্রদর্শন করা হয়েছে, এবং Patch Merger, DeepStack ও 3D কনভোলিউশন Patch এমবেডিং কীভাবে ইমেজ/ভিডিওকে একীভূতভাবে প্রক্রিয়া করে তা ব্যাখ্যা করা হয়েছে। রিপোজিটরিতে শেখার পথের সুপারিশ, নির্ভরতা তালিকা (torch, transformers, diffusers, modelscope, torchinfo, torchviz ইত্যাদি; torchviz-এর জন্য সিস্টেম-স্তরের Graphviz প্রয়োজন) এবং দ্রুত শুরু করার ধাপও দেওয়া আছে; মডেল ওয়েট প্রথমবার চালানোর সময় স্বয়ংক্রিয়ভাবে ডাউনলোড হয়ে model_cache/ -এর সংশ্লিষ্ট উপ-ডিরেক্টরিতে ক্যাশ হয়। প্রকল্পটি MIT লাইসেন্স ব্যবহার করে।