Sobre el proyecto

El Unified Latent-State Memory Fabric (UL-SMF) se presenta como un tejido de compresión de memoria co-diseñado hardware-software que aborda el cuello de botella de memoria en la inferencia de Transformers de contexto largo. El enfoque declarado combina Finite Scalar Quantization (FSQ) con un mapeo latente dinámico de 16 dimensiones, implementado mediante un componente propietario llamado Aegis-KV Oracle Core. El proyecto afirma comprimir los tensores de caché Key-Value (KV) hasta 384x mientras retiene más del 94% del contenido semántico. El repositorio está licenciado bajo AGPLv3 y requiere Python 3.10+ y PyTorch 2.0+. Sin embargo, una limitación estructural crítica está documentada prominentemente en el README: mientras que el marco de orquestación y las interfaces son de código abierto, el pipeline de producción completo depende de un binario propietario compilado (`aegis_kv_oracle_core.pt`) que no está incluido en el repositorio. El script de inicio rápido de código abierto define la estructura del pipeline y el flujo de datos, pero la ejecución local de la compresión real depende de este binario central con licencia. Los titulares de licencias comerciales son dirigidos a una dirección de contacto separada (inquiries@lawrencearchitectures.com) para el binario optimizado, soporte de integración y enrutamiento VRAM de copia cero. El README incluye varias tablas de benchmarks. Una prueba de recuperación de contexto multi-aguja en `unsloth/llama-3-8b-Instruct-bnb-4bit` reporta 100% de fidelidad de recuperación en tres objetivos a 4,892 tokens con compresión de 128D a 16D. Una tabla de perfilado de hardware reporta una reducción de VRAM del 14.66% (1317.52 MB a 1124.34 MB) con una sobrecarga de velocidad de generación del 3%. Una tabla de perfilado de tensores aislados afirma una reducción de 384x (48.00 MB a 0.12 MB) para 4096 tokens. Una auditoría de perplejidad en WikiText-2 reporta una degradación neta de aproximadamente 0.0020. Se presenta un barrido de distorsión de tasa a través de dimensiones latentes de 32D, 16D, 8D y 4D, identificando 16D como el punto óptimo de la frontera de Pareto. Una tabla de escalado de concurrencia muestra tamaños de lote de 1 a 16 con crecimiento lineal de sobrecarga. Los usuarios deben notar que la parte de código abierto de este repositorio proporciona solo la capa de interfaz y orquestación. Los algoritmos de compresión reales residen en el binario propietario Aegis-KV, que no está disponible en el repositorio. Las cifras de benchmark son auto-reportadas y no pueden verificarse independientemente sin acceso al binario cerrado. La consistencia matemática de las tasas de compresión reportadas en relación con la arquitectura de modelo declarada debe ser evaluada por usuarios potenciales antes de confiar en estos resultados.