Sobre el proyecto

LLM Context Squeezer es un proxy de API local construido con FastAPI que actúa como intermediario entre aplicaciones y proveedores de LLM compatibles con OpenAI. Su objetivo es reducir el consumo de tokens y los costos de API mediante varias técnicas de optimización automatizada: - **Compresión dinámica del contexto**: Cuando el historial de conversación excede un umbral configurado, el proxy utiliza un modelo más económico (por ejemplo, gpt-4o-mini) para resumir la parte más antigua del chat, inyectando un resumen denso en el prompt del sistema. - **Eliminación de redundancias**: Un motor de dos fases utiliza hash SHA-256 para coincidencias exactas de bloques de código y similitud de Jaccard para coincidencia aproximada de texto casi duplicado, reemplazando repeticiones con marcadores compactos. - **Caché semántica**: Utiliza SQLite en modo WAL para proporcionar coincidencia exacta y aproximada de prompts, devolviendo respuestas en caché para eliminar llamadas redundantes a la API. - **Integración Plug-and-play**: Implementa el contrato OpenAI /v1/chat/completions, lo que le permite funcionar con el SDK de Python de OpenAI, LangChain, AutoGen y CrewAI simplemente cambiando la URL base. El proxy ofrece observabilidad mediante campos de respuesta inyectados como `x-squeezer-tokens-saved` y `x-squeezer-cache-hit`, e incluye endpoints para verificaciones de estado y estadísticas en tiempo de ejecución.