इस प्रोजेक्ट के बारे में
LLM Router एक FastAPI-आधारित बैकएंड सेवा है जो उपयोगकर्ता prompts को dynamically राउट करती है — OpenAI, Google Gemini, और Mistral में से सबसे उपयुक्त Large Language Model (LLM) को चुनने के लिए। यह सिस्टम raw performance के बजाय usefulness, cost, और reliability के बीच संतुलन बनाकर मॉडल का मूल्यांकन करता है।
सिस्टम तीन routing modes को सपोर्ट करता है: full auto (सिस्टम सबसे अच्छा मॉडल चुनता है), semi-auto (उपयोगकर्ता provider चुनता है, सिस्टम मॉडल चुनता है), और manual (उपयोगकर्ता दोनों निर्दिष्ट करता है)। इसमें Mistral embeddings और cosine similarity retrieval द्वारा संचालित Retrieval-Augmented Generation (RAG) शामिल है, जो .txt, .md, और .pdf फ़ाइलों को सपोर्ट करता है।
उपयोगकर्ता /upload endpoint के माध्यम से दस्तावेज़ अपलोड कर सकते हैं और /clear-data के माध्यम से डेटा क्लियर कर सकते हैं। प्रत्येक उपयोगकर्ता के पास context-aware responses के लिए 2-turn conversation memory बनाए रखी जाती है।
आर्किटेक्चर में decision-making और execution को अलग रखा गया है: routing logic मॉडल चुनती है, जबकि client modules actual API calls हैंडल करते हैं। यदि कोई मॉडल token limits से अधिक होता है तो उसे disqualify कर दिया जाता है।
Responses में provider, model, confidence, tokens used, और cost estimate जैसे metadata शामिल होते हैं। WebSocket support real-time streaming के लिए उपलब्ध है।
भविष्य की योजनाओं में feedback-driven tuning, local LLM integration, और A/B testing शामिल हैं। यह प्रोजेक्ट सक्रिय रूप से विकास के अधीन है, जहां intent-aware routing, cost optimization, और RAG जैसे core features पहले ही लागू हो चुके हैं।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.