Sobre o projeto

O LLM Context Squeezer é um proxy de API local construído com FastAPI que atua como intermediário entre aplicativos e provedores de LLM compatíveis com OpenAI. Ele visa reduzir o consumo de tokens e os custos de API por meio de várias técnicas automatizadas de otimização: - **Compressão Dinâmica de Contexto**: Quando o histórico de conversas excede um limite definido, o proxy utiliza um modelo mais econômico (por exemplo, gpt-4o-mini) para resumir a parte mais antiga do chat, injetando um resumo denso no prompt do sistema. - **Remoção de Redundância**: Um mecanismo em duas etapas usa hash SHA-256 para correspondências exatas de blocos de código e similaridade de Jaccard para correspondência aproximada de texto quase duplicado, substituindo repetições por marcadores compactos. - **Cache Semântico**: Utiliza SQLite em modo WAL para fornecer correspondência exata e aproximada de prompts, retornando respostas em cache para eliminar chamadas de API redundantes. - **Integração Plug-and-Play**: Implementa o contrato OpenAI /v1/chat/completions, permitindo que funcione com o SDK Python da OpenAI, LangChain, AutoGen e CrewAI apenas alterando a URL base. O proxy fornece observabilidade por meio de campos injetados nas respostas, como `x-squeezer-tokens-saved` e `x-squeezer-cache-hit`, e inclui endpoints para verificações de integridade e estatísticas em tempo de execução.