このプロジェクトについて

## プロジェクト概要 このリポジトリは、DeepSeekが公開した論文「Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models」の公式実装です。混合専門家(MoE)と相補的なスパース性の軸である「条件付きメモリ」(conditional memory)を研究し、それをEngramモジュールとして具体化したものです。Engramは古典的なN-gram埋め込みを現代的に改良し、O(1)の検索を実現します。 ## 中核となる内容 - **スパース性の配分**: この論文は、神経計算(MoE)と静的メモリ(Engram)の間のトレードオフを形式化し、容量配分を導くU字型スケーリング則を提案しています。 - **実証的検証**: 等パラメータ数・等FLOPsの制約下で、Engram-27Bモデルは知識・推論・コード・数学の各領域においてMoEベースラインと比較して一貫した改善を示しました。 - **メカニズム分析**: 分析によると、Engramは初期層における静的パターン再構築の負担を軽減し、複雑な推論のために有効な深さを確保できる可能性があります。 - **システム効率**: このモジュールは決定的アドレッシングを採用しており、大規模な埋め込みテーブルをホストメモリに退避させることができ、推論時のオーバーヘッドは最小限です。 ## アーキテクチャと評価 Engramモジュールは、静的N-gramメモリを検索し、動的隠れ状態と融合させることでバックボーンネットワークを強化します。リポジトリにはアーキテクチャ図とdrawioソースファイルが含まれています。評価セクションには、スケーリング則、大規模事前学習、長文脈学習、ケーススタディなどの図が含まれています。 ## クイックスタート Python 3.8以上とPyTorchを推奨します。依存関係をインストール後、デモスクリプトを実行するとEngramモジュールの中核ロジックを確認できます。このコードはデモ版であり、Attention/MoE/mHCなどの標準コンポーネントはシミュレーションされ、Engramモジュールのデータフローに焦点を当てていることに注意してください。 ## ライセンスと連絡先 モデルの使用はリポジトリ内のLICENSEに従います。質問はissueまたはメールで受け付けています。