À propos du projet
Jano est un routeur HTTP minimal, compatible OpenAI, conçu pour les utilisateurs exécutant plusieurs LLM locaux sur un seul GPU. Il réduit la surcharge grâce au regroupement gourmand (greedy batching) : au lieu de changer de modèle à chaque requête, il sert toutes les requêtes en attente du modèle actuellement chargé, puis effectue un seul changement lorsque nécessaire. Cela peut réduire les changements de modèle de plusieurs à un seul par rafale, économisant entre 30 secondes et 3 minutes sur du matériel local.
Jano prend en charge les backends locaux (comme llama-server ou vLLM) ainsi que les API distantes (par exemple DeepSeek), avec une réécriture automatique des noms de modèle pour les fournisseurs distants. Il intègre une télémétrie via les points de terminaison /health, /status et des métriques Prometheus, suivent la profondeur de la file d'attente, la durée des changements, le débit de tokens et la santé des backends.
La configuration se fait par variables d'environnement et un fichier models.json, où l'utilisateur définit les noms de modèle, les URL, les alias et des scripts de changement optionnels. Le contrat du script de changement est simple : étant donné un nom de modèle, il doit activer ce backend et se terminer proprement ; un rapport d'état optionnel aide à détecter l'état initial.
Jano sérialise toutes les requêtes par backend pour garder la logique simple, ce qui le rend idéal pour les setups personnels ou à petite échelle plutôt que pour les services multi-locataires. Il ne gère pas la température du GPU ni les ressources système, car cela dépasse son périmètre. Conçu comme une fine couche au-dessus des outils existants, Jano offre un contrôle explicite sur le changement de modèle, une compatibilité avec tout backend de style OpenAI, et un transit transparent des flux et des appels d'outils. Inutile si vous utilisez Ollama ou un seul modèle ; il convient mieux aux utilisateurs possédant déjà des backends personnalisés et souhaitant un contrôle fin du routage et du changement de modèle.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.