প্রকল্প সম্পর্কে

## প্রকল্প সংক্ষিপ্ত বিবরণ এই রিপোজিটরি হলো গবেষণাপত্র "Conditional Memory via Scalable Lookup: A New Axis of Sparsity for Large Language Models"-এর অফিসিয়াল বাস্তবায়ন, যা DeepSeek প্রকাশ করেছে। এটি কন্ডিশনাল মেমরি (conditional memory) নামক স্পারসিটির একটি মাত্রা অধ্যয়ন করে, যা মিক্সচার অফ এক্সপার্টস (MoE)-এর পরিপূরক, এবং এটিকে Engram মডিউল হিসেবে রূপায়িত করে—ক্লাসিক N-gram এমবেডিংয়ের আধুনিক রূপান্তর, যা O(1) লুকআপ সক্ষম। ## মূল বিষয়বস্তু - **স্পারসিটি বরাদ্দ**: গবেষণাপত্রটি নিউরাল কম্পিউটেশন (MoE) এবং স্ট্যাটিক মেমরি (Engram)-এর মধ্যে ট্রেড-অফ আনুষ্ঠানিকভাবে উপস্থাপন করে, এবং ক্ষমতা বরাদ্দের নির্দেশনার জন্য U-আকৃতির স্কেলিং আইন প্রস্তাব করে। - **পরীক্ষামূলক যাচাই**: সমান প্যারামিটার এবং সমান FLOPs সীমাবদ্ধতায়, Engram-27B মডেল জ্ঞান, যুক্তি, কোড এবং গণিত ক্ষেত্রে MoE বেসলাইনের তুলনায় ধারাবাহিক উন্নতি দেখায়। - **প্রক্রিয়া বিশ্লেষণ**: বিশ্লেষণে দেখা যায় Engram প্রাথমিক স্তরগুলিতে স্ট্যাটিক প্যাটার্ন পুনর্গঠনের বোঝা কমাতে পারে, যা সম্ভাব্যভাবে জটিল যুক্তির জন্য কার্যকর গভীরতা সংরক্ষণ করে। - **সিস্টেম দক্ষতা**: মডিউলটি নির্ধারক অ্যাড্রেসিং ব্যবহার করে, যা বিশাল এমবেডিং টেবিলকে হোস্ট মেমরিতে অফলোড করতে দেয়, সাথে ন্যূনতম ইনফারেন্স ওভারহেড। ## আর্কিটেকচার ও মূল্যায়ন Engram মডিউল স্ট্যাটিক N-gram মেমরি পুনরুদ্ধার করে এবং ডায়নামিক হিডেন স্টেটের সাথে একীভূত করে মূল নেটওয়ার্ককে শক্তিশালী করে; রিপোজিটরিতে আর্কিটেকচার ডায়াগ্রাম এবং drawio সোর্স ফাইল রয়েছে। মূল্যায়নে স্কেলিং আইন, বৃহৎ-স্কেল প্রি-ট্রেনিং, দীর্ঘ-প্রসঙ্গ প্রশিক্ষণ এবং কেস স্টাডির চার্ট অন্তর্ভুক্ত। ## দ্রুত শুরু Python 3.8+ এবং PyTorch সুপারিশ করা হয়; নির্ভরতা ইনস্টল করার পর ডেমো স্ক্রিপ্ট চালিয়ে Engram মডিউলের মূল লজিক দেখা যায়। লক্ষণীয় যে এই কোডটি ডেমো সংস্করণ, যা Attention/MoE/mHC-এর মতো স্ট্যান্ডার্ড উপাদান সিমুলেট করে, মূলত Engram মডিউলের ডেটা ফ্লো প্রদর্শনের উপর জোর দেয়। ## লাইসেন্স ও যোগাযোগ মডেলটি রিপোজিটরির LICENSE-এর অধীন; প্রশ্ন issue বা ইমেইলের মাধ্যমে জানানো যেতে পারে।