इस प्रोजेक्ट के बारे में
PixelRAG एक ओपन-सोर्स विज़ुअल रिट्रीवल-ऑगमेंटेड जनरेशन (RAG) सिस्टम है जो UC Berkeley के SkyLab, BAIR, और NLP Group में विकसित किया गया है। वेब पेजों या PDFs को टेक्स्ट चंक्स में पार्स करने के बजाय—जो टेबल, चार्ट, डायग्राम, और लेआउट जैसी दृश्य संरचना को त्याग देता है—PixelRAG दस्तावेज़ों को स्क्रीनशॉट टाइल्स के रूप में प्रस्तुत करता है और छवियों पर सीधे खोज करता है। एक रीडर मॉडल फिर दृश्य सामग्री के बारे में सवालों के जवाब दे सकता है जो टेक्स्ट-आधारित RAG से छूट जाते हैं।
सिस्टम दो मुख्य कार्यों के आसपास बनाया गया है: रेंडरिंग (Playwright/CDP या PDFs के लिए poppler के माध्यम से पेजों या दस्तावेज़ों को इमेज टाइल्स में बदलना) और खोज (उन टाइल्स को Qwen3-VL-Embedding मॉडल के साथ एम्बेड करना जो स्क्रीनशॉट डेटा पर LoRA-फाइन-ट्यून किया गया है, फिर FAISS या Qdrant वेक्टर इंडेक्स पर क्वेरी करना)। पाइपलाइन मॉड्यूलर है: `pixelshot` रेंडरिंग संभालता है, जबकि `pixelrag chunk`, `embed`, `build-index`, `index`, और `serve` बाकी वर्कफ़्लो को कवर करते हैं। प्रत्येक चरण को pip extras के माध्यम से स्वतंत्र रूप से स्थापित किया जा सकता है।
api.pixelrag.ai पर एक होस्टेड API 8.28 मिलियन Wikipedia पेजों का पहले से निर्मित इंडेक्स प्रदान करता है, जिसके लिए किसी सेटअप या API कुंजी की आवश्यकता नहीं है। यह टेक्स्ट और इमेज दोनों क्वेरी स्वीकार करता है। pixelrag.ai पर एक ब्राउज़र डेमो उपलब्ध है, और एक Colab नोटबुक त्वरित शुरुआत प्रदान करता है।
स्थानीय उपयोग के लिए, सिस्टम Linux (CUDA) और macOS (Apple Silicon/MPS) का समर्थन करता है, जिसमें स्वचालित डिवाइस चयन होता है। उपयोगकर्ता YAML कॉन्फ़िगरेशन फ़ाइल का उपयोग करके अपने स्वयं के दस्तावेज़ों से इंडेक्स बना सकते हैं, फिर उन्हें FastAPI-आधारित खोज एंडपॉइंट के माध्यम से सेवा कर सकते हैं। Qdrant बैकएंड विकल्प कॉन्फ़िगर करने योग्य क्वांटाइज़ेशन, डिस्क-समर्थित वैक्टर, पेलोड फ़िल्टरिंग, और मल्टी-सर्वर कलेक्शन साझाकरण जोड़ता है।
PixelRAG एक Claude Code प्लगइन के रूप में भी आता है जिसे pixelbrowse कहा जाता है, जो Claude को पेजों के स्क्रीनशॉट लेने और छवियों को सीधे पढ़ने की अनुमति देता है—चार्ट, टेबल, और लेआउट को उसी तरह देखता है जैसे एक इंसान देखता है। @startrail/pixelbrowse npm पैकेज के माध्यम से एक opencode एकीकरण opencode उपयोगकर्ताओं के लिए वही स्क्रीनशॉट टूल प्रदान करता है।
प्रशिक्षण पाइपलाइन train/ के तहत एक अलग uv प्रोजेक्ट में रहती है, जो वेबपेज रिट्रीवल के लिए Qwen3-VL-Embedding-2B को LoRA-फाइन-ट्यून करती है। पूर्व-प्रशिक्षित एडेप्टर और पूरा प्रशिक्षण डेटासेट Hugging Face पर प्रकाशित किया गया है, और डेटा क्यूरेशन पाइपलाइन (LLM-संवर्धित क्वेरी जनरेशन, फ़िल्टरिंग, हार्ड-नेगेटिव माइनिंग) उन उपयोगकर्ताओं के लिए प्रलेखित है जो अन्य एम्बेडिंग बैकबोन्स को अनुकूलित करना चाहते हैं।
परियोजना Apache-2.0 के तहत लाइसेंस प्राप्त है।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.