About this project
## 项目概览
该仓库是论文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的官方实现,由 DeepSeek 发布。它研究“条件记忆”(conditional memory)这一与混合专家(MoE)互补的稀疏性维度,并将其实例化为 Engram 模块——对经典 N-gram 嵌入进行现代化改造,实现 O(1) 查找。
## 核心内容
- **稀疏性分配**:论文形式化了神经计算(MoE)与静态记忆(Engram)之间的权衡,提出 U 型缩放规律以指导容量分配。
- **实证验证**:在等参数量、等 FLOPs 约束下,Engram-27B 模型在知识、推理、代码和数学领域相较 MoE 基线表现出一致改进。
- **机制分析**:分析表明 Engram 可减轻早期层重建静态模式的负担,从而可能为复杂推理保留有效深度。
- **系统效率**:模块采用确定性寻址,可将庞大的嵌入表卸载到主机内存,推理开销极小。
## 架构与评估
Engram 模块通过检索静态 N-gram 记忆并与动态隐藏状态融合来增强主干网络,仓库提供了架构图及 drawio 源文件。评估部分包含缩放规律、大规模预训练、长上下文训练以及案例研究等图表。
## 快速开始
推荐 Python 3.8+ 与 PyTorch,安装依赖后运行演示脚本即可查看 Engram 模块的核心逻辑。需注意该代码为演示版本,对 Attention/MoE/mHC 等标准组件做了模拟,重点展示 Engram 模块的数据流。
## 许可与联系
模型使用受仓库内 LICENSE 约束,问题可通过 issue 或邮件反馈。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.