منصوبے کے بارے میں
PixelRAG ایک اوپن سورس بصری بازیافت-اضافہ شدہ جنریشن (RAG) نظام ہے جو یونیورسٹی آف کیلیفورنیا، برکلے کے SkyLab، BAIR، اور NLP گروپ میں تیار کیا گیا ہے۔ ویب صفحات یا PDFs کو ٹیکسٹ کے ٹکڑوں میں تبدیل کرنے کے بجائے—جو جدولوں، چارٹس، خاکوں، اور ترتیب جیسی بصری ساخت کو ضائع کر دیتا ہے—PixelRAG دستاویزات کو اسکرین شاٹ ٹائلوں کے طور پر پیش کرتا ہے اور تصاویر پر براہ راست تلاش کرتا ہے۔ اس کے بعد ایک ریڈر ماڈل بصری مواد کے بارے میں سوالات کے جواب دے سکتا ہے جو ٹیکسٹ پر مبنی RAG سے محروم رہ جاتا ہے۔
یہ نظام دو بنیادی کارروائیوں پر مبنی ہے: رینڈرنگ (Playwright/CDP یا PDFs کے لیے poppler کے ذریعے صفحات یا دستاویزات کو امیج ٹائلوں میں تبدیل کرنا) اور تلاش (ان ٹائلوں کو Qwen3-VL-Embedding ماڈل کے ساتھ ایمبیڈ کرنا جو اسکرین شاٹ ڈیٹا پر LoRA-fine-tuned ہے، پھر FAISS یا Qdrant ویکٹر انڈیکس سے استفسار کرنا)۔ پائپ لائن ماڈیولر ہے: `pixelshot` رینڈرنگ سنبھالتا ہے، جبکہ `pixelrag chunk`، `embed`، `build-index`، `index`، اور `serve` باقی ورک فلو کا احاطہ کرتے ہیں۔ ہر مرحلہ pip extras کے ذریعے آزادانہ طور پر انسٹال کیا جا سکتا ہے۔
api.pixelrag.ai پر ایک میزبان API 8.28 ملین ویکیپیڈیا صفحات کا پہلے سے تیار کردہ انڈیکس پیش کرتا ہے جس کے لیے کسی سیٹ اپ یا API کلید کی ضرورت نہیں ہے۔ یہ ٹیکسٹ اور امیج دونوں استفسارات قبول کرتا ہے۔ pixelrag.ai پر ایک براؤزر ڈیمو دستیاب ہے، اور ایک Colab نوٹ بک فوری آغاز فراہم کرتی ہے۔
مقامی استعمال کے لیے، یہ نظام خودکار ڈیوائس انتخاب کے ساتھ Linux (CUDA) اور macOS (Apple Silicon/MPS) کو سپورٹ کرتا ہے۔ صارفین YAML کنفیگریشن فائل کا استعمال کرتے ہوئے اپنی دستاویزات سے انڈیکس بنا سکتے ہیں، پھر انہیں FastAPI پر مبنی تلاش کے اینڈ پوائنٹ کے ذریعے پیش کر سکتے ہیں۔ Qdrant بیک اینڈ آپشن قابل ترتیب کوانٹائزیشن، ڈسک پر مبنی ویکٹر، پے لوڈ فلٹرنگ، اور ملٹی سرور کلیکشن شیئرنگ شامل کرتا ہے۔
PixelRAG ایک Claude Code پلگ ان کے طور پر بھی آتا ہے جسے pixelbrowse کہتے ہیں، جو Claude کو صفحات کے اسکرین شاٹ لینے اور تصاویر کو براہ راست پڑھنے کی اجازت دیتا ہے—چارٹس، جدولوں، اور ترتیب کو اس طرح دیکھتا ہے جیسے انسان دیکھتا ہے۔ @startrail/pixelbrowse npm پیکج کے ذریعے ایک opencode انٹیگریشن opencode صارفین کے لیے وہی اسکرین شاٹ ٹول فراہم کرتا ہے۔
ٹریننگ پائپ لائن train/ کے تحت ایک علیحدہ uv پروجیکٹ میں رہتی ہے، جو ویب پیج بازیافت کے لیے Qwen3-VL-Embedding-2B کو LoRA-fine-tune کرتی ہے۔ پہلے سے تربیت یافتہ اڈاپٹر اور مکمل تربیتی ڈیٹاسیٹ Hugging Face پر شائع کیے گئے ہیں، اور ڈیٹا کیوریشن پائپ لائن (LLM-augmented query جنریشن، فلٹرنگ، hard-negative mining) ان صارفین کے لیے دستاویزی ہے جو دوسرے ایمبیڈنگ بیک بونز کو اپنانا چاہتے ہیں۔
یہ پروجیکٹ Apache-2.0 لائسنس کے تحت ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.