منصوبے کے بارے میں

AI Gateway ایک intelligent routing infrastructure ہے جو production environments میں LLM usage کو optimize کرنے کے لیے design کیا گیا ہے۔ یہ ہر request کو intent classification، cost efficiency اور real-time provider health metrics کی بنیاد پر سب سے مناسب model تک dynamically route کرتا ہے۔ سسٹم simple queries کے لیے مہنگے models پر اضافی رقم خرچ ہونے سے روکتا ہے، انہیں سستے models کی طرف بھجواتا ہے جبکہ complex tasks کے لیے powerful reasoning models reserve رکھتا ہے۔ یہ Node.js اور Express کے ساتھ build کیا گیا ہے، Groq اور Google Gemini جیسے providers کے ساتھ integrate ہوتا ہے، intent detection کے لیے local BGE embeddings یا hosted alternatives استعمال کرتا ہے۔ Key features میں daily quotas کے ساتھ multi-tenant API key management، دو تہوں والا caching (exact + semantic)، providers کے درمیان automatic failover، اور cheap سے reasoning models تک confidence-based escalation شامل ہیں۔ Health-aware selection Welford’s algorithm کا استعمال کرتی ہے تاکہ ہر model کی latency اور failure rates کو track کیا جا سکے، جس سے dynamic rerouting ممکن ہوتی ہے۔ Observability admin endpoints کے ذریعے built-in ہے جو cache hit rates، latency اور per-tenant usage دکھاتے ہیں۔ Redis persistence اور caching کے لیے استعمال ہوتا ہے، development کے لیے in-memory fallback موجود ہے۔ Architecture modular، testable اور Koyeb jaisi platforms پر Upstash Redis کے ساتھ deployable ہے۔ یہ نہ تو chatbot ہے نہ single-model wrapper، بلکہ یہ ایک control plane ہے جو reliability enhance کرتی ہے، لاگت کم کرتی ہے اور AI model operations میں full visibility فراہم کرتی ہے۔ یہ ایسی teams کے لیے مثالی ہے جو production میں متعدد LLMs manage کر رہی ہوں اور intelligent routing، resilience اور tenant-level controls چاہتی ہوں بغیر custom infrastructure بنائے۔