À propos du projet
La passerelle LLM est un proxy/routeur léger et autonome conçu pour un usage personnel mono-utilisateur avec du matériel local. Elle gère dynamiquement plusieurs moteurs compatibles Llama.cpp, sélectionnant et lançant automatiquement la variante de modèle appropriée en fonction des paramètres de la requête entrante — en particulier les exigences de taille de contexte. Le système estime l'utilisation des jetons via un tokenizer autonome ou des points de terminaison du moteur en cours d'exécution, redémarre les moteurs avec des configurations optimisées si nécessaire et ferme les instances inactives pour économiser la mémoire.
Elle prend en charge la configuration via des scripts Lua (par exemple, example.cfg.lua), définissant les paramètres du serveur et les variantes de modèles avec différentes tailles de contexte, chemins de binaires et arguments de démarrage. Les utilisateurs peuvent configurer plusieurs variantes par modèle (par exemple, VRAM faible vs haute performance) pour une commutation dynamique. La passerelle écoute sur des adresses IPv4/IPv6 configurables et expose des points de terminaison compatibles avec l'API OpenAI tels que /v1/chat/completions et /v1/models.
Une seule requête est traitée à la fois en raison d'un verrouillage interne. Elle n'implémente actuellement que le point de terminaison chat completions et ne prend en charge que les moteurs llama.cpp, bien que l'architecture permette une extension. L'installation implique l'installation des dépendances Python via init.bat/sh, la modification des fichiers de configuration et le lancement avec run.bat/sh ou uv run main.py.
AVERTISSEMENT : Une configuration incorrecte peut entraîner l'épuisement de la mémoire ou le gel du système. La configuration est validée au chargement à l'aide de scripts Lua intégrés. Il s'agit d'un logiciel expérimental destiné à la recherche/test ; il n'est pas recommandé pour une utilisation en production.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.