Sobre o projeto

O Unified Latent-State Memory Fabric (UL-SMF) é apresentado como um framework de compressão de memória co-projetado em hardware e software, visando o gargalo de memória na inferência de Transformers de contexto longo. A abordagem declarada combina Quantização Escalar Finita (FSQ) com um mapeamento latente dinâmico de 16 dimensões, implementado por meio de um componente proprietário chamado Aegis-KV Oracle Core. O projeto alega comprimir tensores de cache Key-Value (KV) em até 384x, mantendo mais de 94% do conteúdo semântico. O repositório é licenciado sob AGPLv3 e requer Python 3.10+ e PyTorch 2.0+. No entanto, uma limitação estrutural crítica é documentada de forma proeminente no README: enquanto o framework de orquestração e as interfaces são de código aberto, o pipeline de produção completo depende de um binário proprietário compilado (`aegis_kv_oracle_core.pt`) que não está incluído no repositório. O script de início rápido de código aberto define a estrutura do pipeline e o fluxo de dados, mas a execução local da compressão real depende desse binário central licenciado. Detentores de licença comercial são direcionados a um endereço de contato separado (inquiries@lawrencearchitectures.com) para o binário otimizado, suporte de integração e roteamento VRAM de cópia zero. O README inclui várias tabelas de benchmark. Um teste de recuperação de contexto com múltiplas agulhas em `unsloth/llama-3-8b-Instruct-bnb-4bit` relata 100% de fidelidade de recuperação em três alvos com 4.892 tokens e compressão de 128D para 16D. Uma tabela de perfil de hardware relata uma redução de VRAM de 14,66% (de 1317,52 MB para 1124,34 MB) com uma sobrecarga de velocidade de geração de 3%. Uma tabela isolada de perfil de tensores alega uma redução de 384x (de 48,00 MB para 0,12 MB) para 4.096 tokens. Uma auditoria de perplexidade no WikiText-2 relata uma degradação líquida de aproximadamente 0,0020. Uma varredura de taxa-distorção em dimensões latentes de 32D, 16D, 8D e 4D é apresentada, identificando 16D como o ponto ótimo da fronteira de Pareto. Uma tabela de escalonamento de concorrência mostra tamanhos de lote de 1 a 16 com crescimento linear de sobrecarga. Os usuários devem observar que a parte de código aberto deste repositório fornece apenas a camada de interface e orquestração. Os algoritmos de compressão reais residem no binário proprietário Aegis-KV, que não está disponível no repositório. Os números de benchmark são auto-relatados e não podem ser verificados de forma independente sem acesso ao binário fechado. A consistência matemática das taxas de compressão relatadas em relação à arquitetura de modelo declarada deve ser avaliada por usuários em potencial antes de confiar nesses resultados.