Sobre el proyecto

LLM Cache Proxy es una capa de caché para la API de OpenAI construida con FastAPI. Intercepta las solicitudes al endpoint de completado de chat de OpenAI y sirve respuestas en caché para solicitudes idénticas, lo que ayuda a reducir los costos de la API y mejora la latencia de respuesta durante el desarrollo. Las capacidades principales incluyen: - Almacenamiento en caché de respuestas de la API de OpenAI con soporte para modos de streaming y no streaming. - Compatibilidad con la API de OpenAI para endpoints de completado de chat. - Almacenamiento de caché persistente para mantener los datos entre reinicios. - Opciones de implementación mediante Python o Docker. - Dos endpoints distintos: /cache/chat/completions para solicitudes en caché y /chat/completions para solicitudes sin caché.