প্রকল্প সম্পর্কে
nanochat একটি মিনিমাল, হ্যাকযোগ্য পরীক্ষামূলক হারনেস যা একটি একক GPU নোডে বড় ভাষা মডেল (LLM) প্রশিক্ষণের জন্য তৈরি। এটি পুরো LLM পাইপলাইন আচ্ছাদন করে: টোকেনাইজেশন, প্রিট্রেনিং, ফাইন-টিউনিং (SFT এবং RL), মূল্যায়ন এবং ইনফারেন্স।
প্রকল্পটির কেন্দ্রীয় দর্শন হল সরলতা — ডজন ডজন কনফিগারেশন নিব্ব exposing করার পরিবর্তে, nanochat একটি মাত্র জটিলতার ডায়াল (`--depth`, ট্রান্সফরমার স্তরের সংখ্যা) ব্যবহার করে স্বয়ংক্রিয়ভাবে অন্য সমস্ত হাইপারপ্যারামিটার (মডেল প্রস্থ, হেড, লার্নিং রেট, প্রশিক্ষণ সময়কাল, ওয়েট ডিকেকে) compute-optimal উপায়ে অনুবাদ করে। এই পরামিতিটি স্কুইপ করলে বিভিন্ন আকারের একটি মিনিসিরিজ মডেল তৈরি হয়।
একটি 8×H100 নোডে GPT-2-ক্লাস মডেল (প্রায় গভীরতা 24–26) প্রশিক্ষণ দিতে প্রায় 1.5 ঘন্টা এবং $48 (~$3/GPU/ঘন্টা) খরচ হয়। স্পট ইনস্ট্যান্সে, খরচ $15-এ নেমে আসে। 2019 সালে মূল GPT-2 প্রশিক্ষণের খরচ ছিল ~$43,000।
মূল বৈশিষ্ট্য:
- GPT-4-স্টাইল চ্যাট রেন্ডারিং সহ BPE টোকেনাইজার
- ভ্যানিলা PyTorch-এ GPT ট্রান্সফরমার বাস্তবায়ন
- `torchrun` এর মাধ্যমে বিতরণকৃত প্রশিক্ষণ, স্বয়ংক্রিয়ভাবে সিঙ্গেল-GPU এবং গ্র্যাডিয়েন্ট অ্যাকুমুলেশনে ফলব্যাক সহ
- `autocast` ছাড়া স্পষ্ট মিক্সড-প্রিসিশন ব্যবস্থাপনা (bfloat16, float16, float32)
- DCLM CORE স্কোর, bits-per-byte লস, এবং কাজের বেঞ্চমার্ক (ARC, GSM8K, MMLU, HumanEval) এর মাধ্যমে মূল্যায়ন
- চ্যাট মডেলগুলোর জন্য RL এবং SFT প্রশিক্ষণ স্ক্রিপ্ট
- KV ক্যাশ সমর্থন সহ ইনফারেন্স ইঞ্জিন
- গাণিতিকভাবে গতি রেக்கোর্ড লিডারবোর্ড যা GPT-2 স্তরের দক্ষতায় পৌঁছানোর দেয়াল-ঘড়ির সময় ট্র্যাক করে
কোডবেসটি গবেষণা ইটারেশনের জন্য ডিজাইন করা হয়েছে: একটি দ্রুত 12-স্তরের পরীক্ষা (~5 মিনিট) ডেভেলপারদের পূর্ণ প্রশিক্ষণ চালানোর আগে পরিবর্তনগুলি পরীক্ষা করতে দেয়। প্রকল্পটি Andrej Karpathy দ্বারা লেখা ও রক্ষণাবেক্ষণ করা হয়।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.