このプロジェクトについて
## プロジェクト概要
このリポジトリは、DeepSeekが公開した論文「Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models」の公式実装です。混合専門家(MoE)と相補的なスパース性の軸である「条件付きメモリ」(conditional memory)を研究し、それをEngramモジュールとして具体化したものです。Engramは古典的なN-gram埋め込みを現代的に改良し、O(1)の検索を実現します。
## 中核となる内容
- **スパース性の配分**: この論文は、神経計算(MoE)と静的メモリ(Engram)の間のトレードオフを形式化し、容量配分を導くU字型スケーリング則を提案しています。
- **実証的検証**: 等パラメータ数・等FLOPsの制約下で、Engram-27Bモデルは知識・推論・コード・数学の各領域においてMoEベースラインと比較して一貫した改善を示しました。
- **メカニズム分析**: 分析によると、Engramは初期層における静的パターン再構築の負担を軽減し、複雑な推論のために有効な深さを確保できる可能性があります。
- **システム効率**: このモジュールは決定的アドレッシングを採用しており、大規模な埋め込みテーブルをホストメモリに退避させることができ、推論時のオーバーヘッドは最小限です。
## アーキテクチャと評価
Engramモジュールは、静的N-gramメモリを検索し、動的隠れ状態と融合させることでバックボーンネットワークを強化します。リポジトリにはアーキテクチャ図とdrawioソースファイルが含まれています。評価セクションには、スケーリング則、大規模事前学習、長文脈学習、ケーススタディなどの図が含まれています。
## クイックスタート
Python 3.8以上とPyTorchを推奨します。依存関係をインストール後、デモスクリプトを実行するとEngramモジュールの中核ロジックを確認できます。このコードはデモ版であり、Attention/MoE/mHCなどの標準コンポーネントはシミュレーションされ、Engramモジュールのデータフローに焦点を当てていることに注意してください。
## ライセンスと連絡先
モデルの使用はリポジトリ内のLICENSEに従います。質問はissueまたはメールで受け付けています。
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.