প্রকল্প সম্পর্কে

PixelRAG হলো বার্কলে বিশ্ববিদ্যালয়ের SkyLab, BAIR এবং NLP গ্রুপে উন্নীত একটি ওপেন-সোর্স ভিজ্যুয়াল রিট্রিভাল-অগমেন্টেড জেনারেশন (RAG) সিস্টেম। ওয়েব পেজ বা PDF-কে টেক্সট অংশে ভাগ করার পরিবর্তে—যা টেবিল, চার্ট, ডায়াগ্রাম এবং লেআউটের মতো ভিজ্যুয়াল গঠন বাদ দেয়—PixelRAG নথিগুলোকে স্ক্রিনশট টাইল হিসেবে রেন্ডার করে এবং ছবির উপর সরাসরি অনুসন্ধান করে। একটি রিডার মডেল তখন ভিজ্যুয়াল বিষয়বস্তু সম্পর্কিত প্রশ্নের উত্তর দিতে পারে, যা টেক্সট-ভিত্তিক RAG মিস করত। সিস্টেমটি দুটি মূল অপারেশনের উপর নির্মিত: রেন্ডারিং (Playwright/CDP বা PDF-এর জন্য poppler ব্যবহার করে পেজ বা নথিকে ইমেজ টাইলে রূপান্তর করা) এবং অনুসন্ধান (স্ক্রিনশট ডেটার উপর LoRA-ফাইন-টিউন করা Qwen3-VL-Embedding মডেল দিয়ে সেই টাইলগুলো এমবেড করা, তারপর FAISS বা Qdrant ভেক্টর ইনডেক্সে প্রশ্ন করা)। পাইপলাইনটি মডুলার: `pixelshot` রেন্ডারিং পরিচালনা করে, আর `pixelrag chunk`, `embed`, `build-index`, `index` এবং `serve` বাকি কাজগুলো কভার করে। প্রতিটি ধাপ pip extras-এর মাধ্যমে আলাদাভাবে ইনস্টল করা যায়। api.pixelrag.ai-তে একটি হোস্টেড API আছে, যা ৮.২৮ মিলিয়ন উইকিপিডিয়া পেজের প্রি-নির্মিত ইনডেক্স পরিবেশন করে, কোনো সেটআপ বা API কী প্রয়োজন হয় না। এটি টেক্সট এবং ইমেজ উভয় ধরনের প্রশ্ন গ্রহণ করে। pixelrag.ai-তে একটি ব্রাউজার ডেমো এবং একটি Colab নোটবুক দ্রুত শুরু করার জন্য উপলব্ধ। স্থানীয় ব্যবহারের জন্য, সিস্টেমটি Linux (CUDA) এবং macOS (Apple Silicon/MPS) সমর্থন করে, স্বয়ংক্রিয় ডিভাইস নির্বাচন সহ। ব্যবহারকারীরা YAML কনফিগারেশন ফাইল ব্যবহার করে নিজস্ব নথি থেকে ইনডেক্স তৈরি করতে পারে, তারপর FastAPI-ভিত্তিক সার্চ এন্ডপয়েন্টের মাধ্যমে সেগুলো পরিবেশন করতে পারে। Qdrant ব্যাকএন্ড বিকল্পটি কনফিগারযোগ্য কোয়ান্টাইজেশন, ডিস্ক-ব্যাকড ভেক্টর, পেলোড ফিল্টারিং এবং মাল্টি-সার্ভার সংগ্রহ শেয়ারিং যোগ করে। PixelRAG একটি Claude Code প্লাগইন হিসেবেও আসে, যার নাম pixelbrowse, যা ক্লaude-কে পেজের স্ক্রিনশট নিতে এবং ছবিগুলো সরাসরি পড়তে দেয়—চার্ট, টেবিল এবং লেআউট দেখে মানুষের মতো। @startrail/pixelbrowse npm প্যাকেজের মাধ্যমে একটি opencode ইন্টিগ্রেশনও রয়েছে, যা opencode ব্যবহারকারীদের জন্য একই স্ক্রিনশট টুল সরবরাহ করে। প্রশিক্ষণ পাইপলাইনটি train/ অধীনে একটি আলাদা uv প্রজেক্টে থাকে, যা ওয়েবপেজ রিট্রিভালের জন্য Qwen3-VL-Embedding-2B-কে LoRA-ফাইন-টিউন করে। প্রি-ট্রেইনড অ্যাডাপ্টার এবং সম্পূর্ণ প্রশিক্ষণ ডেটাসেট Hugging Face-এ প্রকাশিত, এবং ডেটা কিউরেশন পাইপলাইন (LLM-অগমেন্টেড কোয়েরি জেনারেশন, ফিল্টারিং, হার্ড-নেগেটিভ মাইনিং) এমন ব্যবহারকারীদের জন্য নথিভুক্ত যারা অন্যান্য এমবেডিং ব্যাকবোন মানিয়ে নিতে চান। প্রজেক্টটি Apache-2.0 লাইসেন্সের অধীনে।