这个项目能做什么

## 项目概览 本仓库是 DeepSeek 发布的论文《Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models》的官方实现。该研究探索“条件记忆”这一与混合专家(MoE)互补的稀疏性维度,并将其实例化为 Engram 模块——对经典 N-gram 嵌入进行现代化改造,实现了 O(1) 级别的查找效率。 ## 核心内容 - **稀疏性分配**:论文形式化了神经计算(MoE)与静态记忆(Engram)之间的权衡关系,提出 U 型缩放规律以指导容量分配。 - **实证验证**:在参数量和 FLOPs 相同的约束下,Engram-27B 模型在知识、推理、代码和数学领域相较 MoE 基线均表现出一致的性能提升。 - **机制分析**:分析表明 Engram 可减轻早期层重建静态模式的负担,从而可能为复杂推理保留有效深度。 - **系统效率**:该模块采用确定性寻址,可将庞大的嵌入表卸载到主机内存,推理时的开销极小。 ## 架构与评估 Engram 模块通过检索静态 N-gram 记忆并与动态隐藏状态融合来增强主干网络,仓库提供了架构图及 drawio 源文件。评估部分包含缩放规律、大规模预训练、长上下文训练以及案例研究等相关图表。 ## 快速开始 推荐使用 Python 3.8+ 与 PyTorch,安装依赖后运行演示脚本即可查看 Engram 模块的核心逻辑。需注意该代码为演示版本,对 Attention、MoE、mHC 等标准组件做了模拟,重点展示 Engram 模块的数据流。 ## 许可与联系 模型使用受仓库内 LICENSE 条款约束,相关问题可通过 issue 或邮件反馈。