À propos du projet
LLM Gateway est un proxy inverse de cache pour l'API OpenAI completions chat qui réduit les coûts en servant les questions répétées ou sémantiquement similaires depuis Redis. Il prend en charge deux niveaux de cache : la correspondance exacte (normalisation des prompts) et la correspondance sémantique (recherche vectorielle via Redis Stack). Les questions de suivi sont réécrites sous forme autonome avant l'embedding afin de permettre une correspondance inter-conversation. Construit avec FastAPI et Redis Stack, il ajoute des en-têtes X-Cache aux réponses pour que les utilisateurs puissent vérifier quel niveau a servi chaque requête. L'installation locale nécessite Python 3.12+, Docker et une clé OpenAI. Il inclut un playground de démonstration, des tests de charge et des métriques montrant des hits exacts à ~2 ms, des hits sémantiques à ~250 ms et des misses à 1–4 s. Conçu pour un déploiement en tant que conteneur sans état avec Redis Stack, il prend en charge des contrôles de budget, des limites de débit et une modération lorsque celle-ci est activée pour les démos publiques. Les entrées du cache expirent au bout d'une heure ; aucune prise en charge du streaming ni couche d'authentification n'est incluse.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.