Sobre o projeto
LLM Cache Proxy é uma camada de cache para a API da OpenAI construída com FastAPI. Ele intercepta requisições para o endpoint de conclusão de chat da OpenAI e serve respostas em cache para requisições idênticas, o que ajuda a reduzir os custos da API e melhorar a latência das respostas durante o desenvolvimento.
Principais capacidades incluem:
- Armazenamento em cache de respostas da API da OpenAI com suporte para modos de streaming e não streaming.
- Compatibilidade com a API da OpenAI para endpoints de conclusão de chat.
- Armazenamento de cache persistente para manter os dados entre reinicializações.
- Opções de implantação via Python ou Docker.
- Dois endpoints distintos: `/cache/chat/completions` para requisições em cache e `/chat/completions` para requisições sem cache.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.