프로젝트 소개

UL-SMF(Unified Latent-State Memory Fabric)는 장기 컨텍스트 트랜스포머 추론의 메모리 병목 현상을 대상으로 하는 하드웨어-소프트웨어 공동 설계 메모리 압축 패브릭으로 제시된다. 제시된 접근 방식은 FSQ(Finite Scalar Quantization)와 동적 16차원 잠재 매핑을 결합하며, Aegis-KV Oracle Core라는 독점 구성 요소를 통해 구현된다. 이 프로젝트는 KV(Key-Value) 캐시 텐서를 최대 384배까지 압축하면서도 의미 콘텐츠의 94% 이상을 유지한다고 주장한다. 이 저장소는 AGPLv3 라이선스를 따르며 Python 3.10 이상과 PyTorch 2.0 이상이 필요하다. 그러나 중요한 구조적 제한 사항이 README에 두드러지게 문서화되어 있다. 오케스트레이션 프레임워크와 인터페이스는 오픈소스이지만, 전체 프로덕션 파이프라인은 저장소에 포함되지 않은 컴파일된 독점 바이너리(aegis_kv_oracle_core.pt)에 의존한다. 오픈소스 퀵스타트 스크립트는 파이프라인 구조와 데이터 흐름을 정의하지만, 실제 압축의 로컬 실행은 이 라이선스 코어 바이너리에 의존한다. 상업용 라이선스 보유자는 최적화된 바이너리, 통합 지원, 제로 카피 VRAM 라우팅을 위해 별도의 문의처(inquiries@lawrencearchitectures.com)로 안내된다. README에는 여러 벤치마크 표가 포함되어 있다. unsloth/llama-3-8b-Instruct-bnb-4bit에서의 다중 니들 컨텍스트 검색 테스트는 128D에서 16D로의 압축으로 4,892개 토큰에서 세 가지 대상에 대해 100% 검색 충실도를 보고한다. 하드웨어 프로파일링 표는 3% 생성 속도 오버헤드와 함께 14.66%의 VRAM 절감(1317.52MB에서 1124.34MB)을 보고한다. 단독 텐서 프로파일링 표는 4096개 토큰에 대해 384배 절감(48.00MB에서 0.12MB)을 주장한다. WikiText-2에 대한 혼란도 감사는 약 0.0020의 순 열화를 보고한다. 32D, 16D, 8D, 4D 잠재 차원에 걸친 율-왜곡 스윕이 제시되며, 16D가 최적 파레토 최전선 지점으로 식별된다. 동시성 확장 표는 배치 크기 1~16에서 선형 오버헤드 증가를 보여준다. 사용자는 이 저장소의 오픈소스 부분이 인터페이스와 오케스트레이션 계층만 제공한다는 점에 유의해야 한다. 실제 압축 알고리즘은 저장소에서 제공되지 않는 독점 Aegis-KV 바이너리에 있다. 벤치마크 수치는 자체 보고된 것으로, 폐쇄형 바이너리에 접근하지 않고서는 독립적으로 검증할 수 없다. 보고된 압축 비율이 명시된 모델 아키텍처와 수학적으로 일치하는지 여부는 잠재 사용자가 이러한 결과에 의존하기 전에 평가해야 한다.