Sobre o projeto
O LLM Context Squeezer é um proxy de API local construído com FastAPI que atua como intermediário entre aplicativos e provedores de LLM compatíveis com OpenAI. Ele visa reduzir o consumo de tokens e os custos de API por meio de várias técnicas automatizadas de otimização:
- **Compressão Dinâmica de Contexto**: Quando o histórico de conversas excede um limite definido, o proxy utiliza um modelo mais econômico (por exemplo, gpt-4o-mini) para resumir a parte mais antiga do chat, injetando um resumo denso no prompt do sistema.
- **Remoção de Redundância**: Um mecanismo em duas etapas usa hash SHA-256 para correspondências exatas de blocos de código e similaridade de Jaccard para correspondência aproximada de texto quase duplicado, substituindo repetições por marcadores compactos.
- **Cache Semântico**: Utiliza SQLite em modo WAL para fornecer correspondência exata e aproximada de prompts, retornando respostas em cache para eliminar chamadas de API redundantes.
- **Integração Plug-and-Play**: Implementa o contrato OpenAI /v1/chat/completions, permitindo que funcione com o SDK Python da OpenAI, LangChain, AutoGen e CrewAI apenas alterando a URL base.
O proxy fornece observabilidade por meio de campos injetados nas respostas, como `x-squeezer-tokens-saved` e `x-squeezer-cache-hit`, e inclui endpoints para verificações de integridade e estatísticas em tempo de execução.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.