इस प्रोजेक्ट के बारे में

LLM gateway एक हल्का, सेल्फ-कंटेन्ड प्रॉक्सी/राउटर है जिसे स्थानीय हार्डवेयर के साथ व्यक्तिगत सिंगल-यूज़र उपयोग के लिए डिज़ाइन किया गया है। यह गतिशील रूप से कई Llama.cpp-संगत इंजनों का प्रबंधन करता है, और आने वाले अनुरोध मापदंडों — विशेष रूप से कॉन्टेक्स्ट साइज आवश्यकताओं — के आधार पर उपयुक्त मॉडल वेरिएंट का स्वचालित रूप से चयन और लॉन्च करता है। सिस्टम स्टैंडअलोन टोकेनाइज़र या रनिंग इंजन एंडपॉइंट्स के माध्यम से टोकन उपयोग का अनुमान लगाता है, आवश्यकता पड़ने पर अनुकूलित कॉन्फ़िगरेशन के साथ इंजनों को रीस्टार्ट करता है, और मेमोरी बचाने के लिए आइडल इंस्टेंस को बंद कर देता है। यह Lua स्क्रिप्ट्स (जैसे, example.cfg.lua) के माध्यम से कॉन्फ़िगरेशन का समर्थन करता है, जिसमें सर्वर सेटिंग्स और अलग-अलग कॉन्टेक्स्ट साइज, बाइनरी पाथ और स्टार्टअप आर्गुमेंट्स वाले मॉडल वेरिएंट परिभाषित किए जाते हैं। उपयोगकर्ता गतिशील स्विचिंग के लिए प्रति मॉडल कई वेरिएंट (जैसे, लो VRAM बनाम हाई परफॉरमेंस) कॉन्फ़िगर कर सकते हैं। गेटवे कॉन्फ़िगर करने योग्य IPv4/IPv6 एड्रेस पर सुनता है और /v1/chat/completions और /v1/models जैसे OpenAI API-संगत एंडपॉइंट्स उपलब्ध कराता है। आंतरिक लॉकिंग के कारण एक समय में केवल एक ही अनुरोध संसाधित किया जाता है। यह वर्तमान में केवल चैट कम्पलीशन्स एंडपॉइंट को लागू करता है और केवल llama.cpp इंजनों का समर्थन करता है, हालांकि आर्किटेक्चर विस्तार की अनुमति देता है। सेटअप में init.bat/sh के माध्यम से Python डिपेंडेंसी इंस्टॉल करना, कॉन्फ़िगरेशन फ़ाइलों को एडिट करना और run.bat/sh या uv run main.py के साथ लॉन्च करना शामिल है। चेतावनी: गलत कॉन्फ़िगरेशन के कारण मेमोरी समाप्त हो सकती है या सिस्टम फ्रीज हो सकता है। लोड होने पर एम्बेडेड Lua स्क्रिप्ट्स का उपयोग करके कॉन्फ़िगरेशन को वैलिडेट किया जाता है। यह एक प्रयोगात्मक सॉफ़्टवेयर है जो अनुसंधान/परीक्षण के लिए है; प्रोडक्शन उपयोग के लिए अनुशंसित नहीं है।