Sobre o projeto

LLM Cache Proxy é uma camada de cache para a API da OpenAI construída com FastAPI. Ele intercepta requisições para o endpoint de conclusão de chat da OpenAI e serve respostas em cache para requisições idênticas, o que ajuda a reduzir os custos da API e melhorar a latência das respostas durante o desenvolvimento. Principais capacidades incluem: - Armazenamento em cache de respostas da API da OpenAI com suporte para modos de streaming e não streaming. - Compatibilidade com a API da OpenAI para endpoints de conclusão de chat. - Armazenamento de cache persistente para manter os dados entre reinicializações. - Opções de implantação via Python ou Docker. - Dois endpoints distintos: `/cache/chat/completions` para requisições em cache e `/chat/completions` para requisições sem cache.