Sobre o projeto
O LLM Gateway é um proxy reverso com cache para a API de conclusões de chat da OpenAI que reduz custos ao servir perguntas repetidas ou semanticamente semelhantes a partir do Redis. Suporta dois níveis de cache: correspondência exata (normalizando prompts) e correspondência semântica (usando busca vetorial via Redis Stack). Perguntas de acompanhamento são reescritas em forma autônoma antes da incorporação para permitir correspondência entre conversas. Construído com FastAPI e Redis Stack, adiciona cabeçalhos X-Cache às respostas para que os usuários possam verificar qual nível serviu cada solicitação. A configuração local exige Python 3.12+, Docker e uma chave da OpenAI. Inclui playground de demonstração, testes de carga e métricas mostrando acertos exatos em ~2ms, acertos semânticos em ~250ms e falhas de 1–4s. Projetado para implantação como contêiner sem estado com Redis Stack, suporta controle de orçamento, limites de taxa e moderação quando habilitado para demonstrações públicas. As entradas do cache expiram após uma hora; não há suporte a streaming nem camada de autenticação.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.