منصوبے کے بارے میں

ایل ایل ایم راؤٹر ایک FastAPI-بیسڈ بیک اینڈ سروس ہے جو ڈیزائن کی گئی ہے تاکہ صارف کے پرامپٹس کو OpenAI، Google Gemini، اور Mistral میں سے کسی موزوں Large Language Model (LLM) کو راستہ دے سکے۔ یہ نظام ماڈلز کو اسکورنگ سسٹم کے ذریعے استعمالی، لاگت، اور اعتماد کے توازن پر جانچتا ہے — صرف خام کارکردگی نہیں۔ یہ تین راؤٹنگ موڈز کو سپورٹ کرتا ہے: مکمل آٹو (سسٹم بہترین ماڈل منتخب کرتا ہے)، نیم آٹو (صارف فراہم کنندہ منتخب کرتا ہے، سسٹم ماڈل منتخب کرتا ہے)، اور مینوئل (صارف دونوں مقرر کرتا ہے)۔ اس میں Mistral ایम्बڈنگ اور cosine similarity retrieval پر مبنی Retrieval-Augmented Generation (RAG) شامل ہے، جو .txt، .md، اور .pdf فائلز کو سپورٹ کرتا ہے۔ صارف /upload کے ذریعے دستاویز اپلوڈ کر سکتے ہیں اور /clear-data کے ذریعے ڈیٹا صاف کر سکتے ہیں۔ ہر صارف کے پاس سیاق و سباق پر مبنی جوابات کے لیے 2-ٹرن کنورسیشن میموری ہوتی ہے۔ آرکیٹیکچر فیصلہ سازی کو عمل درآمد سے الگ کرتا ہے: راؤٹنگ لاژک ماڈل کا انتخاب کرتی ہے، جبکہ کلائنٹ ماڈیولز اصل API کالز سنبھالتے ہیں۔ ماڈلز کو اس وقت نامنظور قرار دیا جاتا ہے جب وہ token limits سے تجاوز کریں۔ جوابات میں فراہم کنندہ، ماڈل، اعتماد، استعمال شدہ tokens، اور لاگت کا تخمینہ جیسی metadata شامل ہوتی ہے۔ WebSocket سپورٹ ریئل ٹائم اسٹریمنگ کو ممکن بناتی ہے۔ مستقبل کے منصوبوں میں فیڈبک پر مبنی ٹوننگ، مقامی LLM انضمام، اور A/B ٹیسٹنگ شامل ہے۔ یہ پروجیکٹ فعال طور پر ترقی کے مرحلے میں ہے، جس میں نیت پر مبنی راؤٹنگ، لاگت کی بہتری، اور RAG جیسی بنیادی خصوصیات پہلے ہی نافذ ہو چکی ہیں۔