프로젝트 소개
## 项目概览
该仓库是论文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的官方实现,由DeepSeek发布。它研究“条件记忆”(conditional memory)这一与混合专家(MoE)互补的稀疏性维度,并将其实例化为Engram模块——对经典N-gram嵌入进行现代化改造,实现O(1)查找。
## 核心内容
- **稀疏性分配**:论文形式化了神经计算(MoE)与静态记忆(Engram)之间的权衡,提出U型缩放规律以指导容量分配。
- **实证验证**:在等参数量、等FLOPs约束下,Engram-27B模型在知识、推理、代码和数学领域相较MoE基线表现出一致改进。
- **机制分析**:分析表明Engram可减轻早期层重建静态模式的负担,从而可能为复杂推理保留有效深度。
- **系统效率**:模块采用确定性寻址,可将庞大的嵌入表卸载到主机内存,推理开销极小。
## 架构与评估
Engram模块通过检索静态N-gram记忆并与动态隐藏状态融合来增强主干网络,仓库提供了架构图及drawio源文件。评估部分包含缩放规律、大规模预训练、长上下文训练以及案例研究等图表。
## 快速开始
推荐Python 3.8+与PyTorch,安装依赖后运行演示脚本即可查看Engram模块的核心逻辑。需注意该代码为演示版本,对Attention/MoE/mHC等标准组件做了模拟,重点展示Engram模块的数据流。
## 许可与联系
模型使用受仓库内LICENSE约束,问题可通过issue或邮件反馈。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.