منصوبے کے بارے میں
LightRAG ایک اوپن سورس بازیافت-افزودہ جنریشن (RAG) فریم ورک ہے جو علمی گرافس کے گرد بنایا گیا ہے، اور اسے Microsoft GraphRAG کے ہلکے پھلکے متبادل کے طور پر پیش کیا گیا ہے۔ یہ گراف پر مبنی انڈیکسنگ کو ویکٹر ایمبیڈنگز کے ساتھ دو پرتوں والے فن تعمیر میں یکجا کرتا ہے، جس کا مقصد روایتی چنک پر مبنی ویکٹر RAG اور گراف پر مبنی RAG کے درمیان پل کا کردار ادا کرنا ہے۔
README میں بیان کردہ بنیادی صلاحیتیں:
- گراف پر مبنی انڈیکسنگ جو اداروں کے درمیان معنوی انحصار کو حاصل کرتی ہے، جس کا مقصد چنک پر مبنی بازیافت میں بکھرے ہوئے سیاق و سباق پر قابو پانا ہے۔
- دوہری سطح کی بازیافت جس میں پانچ استفسار موڈز ہیں: مقامی (مخصوص ادارے اور خصوصیات)، عالمی (بڑے موضوعات اور بین دستاویزی تعلقات)، ہائبرڈ (مقامی + عالمی)، سادہ (متن کے چنکس پر سادہ ویکٹر مماثلت)، اور مکس (مقامی + عالمی + سادہ، جو ڈیفالٹ ہے)۔
- اضافی اپ ڈیٹس اور انتخابی حذف: جب کوئی دستاویز ہٹائی جاتی ہے تو نظام انڈیکسنگ کے وقت کے LLM کیشے کا استعمال کرتے ہوئے متاثرہ اداروں اور تعلقات کو دوبارہ تعمیر کر سکتا ہے۔
- متعدد دستاویز پارسنگ انجن: MinerU، Docling، اور ایک مقامی انجن جو Word اور Markdown دستاویزات میں تصاویر، جدولوں اور فارمولوں کو سنبھالتا ہے، نیز .docx فائلوں کے لیے spaCy ماڈلز کے ذریعے اختیاری سمارٹ ہیڈنگ کا پتہ لگانا۔
- متن کو چنکس میں تقسیم کرنے کی چار حکمت عملیاں: مقررہ لمبائی، تکراری حرف، ویکٹر معنوی، اور پیراگراف معنوی، آخری حکمت عملی چنک کی حدود کو سرخیوں، پیراگرافوں اور جدولوں کے ساتھ ہم آہنگ کرتی ہے۔
- ملٹی موڈل پروسیسنگ (v1.5+) جو تصاویر، فارمولوں اور جدولوں کو علمی گراف کے ذریعے مرکزی متن سے جوڑتی ہے، اور PDFs، تصاویر، Office دستاویزات، جدولوں اور فارمولوں کے لیے RAG-Anything انضمام کے ساتھ۔
- کردار کے لحاظ سے LLM ترتیب جس میں چار کردار ہیں: EXTRACT، QUERY، KEYWORD، اور VLM، ہر ایک آزادانہ طور پر ترتیب دیا جا سکتا ہے۔
- اسٹوریج بیک اینڈز جن میں ڈیفالٹ میموری میں اسٹوریج شامل ہے جس میں مقامی فائل پرسسٹنس ہے، نیز PostgreSQL، MongoDB، Neo4j، Milvus، OpenSearch، اور دیگر؛ پروڈکشن کے لیے PostgreSQL تجویز کیا جاتا ہے۔
- ماخذ کی نسبت کے لیے حوالہ جات کی حمایت، ریرینکر سپورٹ، RAGAS تشخیص انضمام، اور Langfuse ٹریسنگ۔
تعیناتی اور استعمال:
- PyPI سے lightrag-hku کے طور پر api ایکسٹرا کے ساتھ، یا uv یا pip کا استعمال کرتے ہوئے سورس سے انسٹال کیا جا سکتا ہے؛ ایک Makefile make dev اور make env-base جیسے اہداف فراہم کرتا ہے۔
- Docker Compose تعیناتی معاون ہے، جس میں سرکاری GHCR امیجز Sigstore Cosign کے ذریعے دستخط شدہ ہیں؛ Apple Silicon کے لیے Docker Desktop کے بغیر Apple Container سیٹ اپ گائیڈ موجود ہے۔
- ایک انٹرایکٹو سیٹ اپ وزرڈ LLM، ایمبیڈنگ، ریرینکر، اسٹوریج، سرور، تصدیق، اور SSL ترتیبات کے لیے .env اور docker-compose.final.yml کنفیگریشنز تیار کرتا ہے۔
- سرور ایک ویب UI اور REST API فراہم کرتا ہے؛ README میں خبردار کیا گیا ہے کہ نیٹ ورک پر نمائش سے پہلے تصدیق (LIGHTRAG_API_KEY یا TOKEN_SECRET کے ساتھ AUTH_ACCOUNTS) ترتیب دی جانی چاہیے، اور یہ کہ Ollama-مطابق /api/* روٹس ڈیفالٹ طور پر کھلے رہتے ہیں جب تک کہ WHITELIST_PATHS سیٹ نہ کیا جائے۔
- اختیاری سسٹم انحصارات میں مقامی مارک ڈاؤن/ٹیکسٹ پارسنگ میں SVG راسٹرائزیشن کے لیے libcairo، اور docx سمارٹ ہیڈنگ کے لیے spaCy زبان کے ماڈل شامل ہیں۔
README میں ماڈل رہنمائی تجویز کرتی ہے کہ نکالنے کے لیے ایک تیز غیر سوچنے والا ماڈل، استفسار کے جوابات کے لیے ایک مضبوط ماڈل، کلیدی الفاظ نکالنے کے لیے ایک ہلکا پھلکا غیر سوچنے والا ماڈل، اور VLM کاموں کے لیے ایک ملٹی موڈل ماڈل استعمال کیا جائے؛ ایمبیڈنگ ماڈلز کو انڈیکسنگ سے پہلے منتخب کیا جانا چاہیے اور مستقل رکھا جانا چاہیے، مقامی تعیناتی کے لیے BAAI/bge-m3 تجویز کیا گیا ہے۔ یہ پروجیکٹ ایک arXiv مقالے (2410.05779) سے منسلک ہے اور اسے EMNLP 2025 میں قبول شدہ قرار دیا گیا ہے۔
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.