منصوبے کے بارے میں

tiny-llm ایک عملی کورس ہے ان سسٹمز انجینئرز کے لیے جو LLM انفرنس کو شروع سے آخر تک سمجھنا چاہتے ہیں۔ یہ CMU کے Needle پروجیکٹ کے LLM-serving ہم منصب کے طور پر پیش کیا گیا ہے: سیکھنے والے وہ راستہ بناتے ہیں جو Qwen3 ماڈل لوڈ کرتا ہے، tokens کو logits میں بدلتا ہے، اور متن generate کرتا ہے۔ کورس array اور matrix operations سے شروع ہوتا ہے، پھر kernels اور serving machinery متعارف کراتا ہے جیسے چلتے ماڈل کو ان کی ضرورت ہوتی ہے۔ implementation اتنی چھوٹی رکھی گئی ہے کہ شروع سے آخر تک پڑھی جا سکے، equations کو memory traffic، kernel occupancy، KV-cache growth، batching، اور request scheduling سے جوڑتی ہے۔ یہ MLX arrays اور MLX extension runtime پر بنایا گیا ہے، بغیر high-level neural-network layers کے۔ جب کوئی باب کسی operator کو سکھاتا ہے، تو سیکھنے والے اس operator کو Python، C++، یا Metal میں implement کرتے ہیں بجائے متعلقہ optimized MLX operation کال کرنے کے۔ MLX correctness oracle اور performance baseline کا کام کرتا ہے۔ چار ہفتوں کا learning path احاطہ کرتا ہے: - ہفتہ 1: mlx.core array operations سے Qwen3 ماڈل بنانا، بشمول attention، RoPE، GQA، RMSNorm، MLP، sampling، اور autoregressive loop۔ - ہفتہ 2: kv-cache، capacity-cache، packed W4 weights، SIMD matrix prefill، fused primitives، اور tiled prefill کے ساتھ ایک single request کو تیز تر بنانا۔ - ہفتہ 3: continuous batching، chunked admission، paged KV cache، direct paged attention، اور paged FlashAttention کے ساتھ ایک mini vLLM بنانا۔ - ہفتہ 4: ایک coding agent بنانا، جس میں validated agent loop، workspace inspection، approved edits، validation commands، checkpoint-and-resume، context compaction، inspect-and-steer pauses، outcome evaluation، forked steered branches، اور bounded tool evidence شامل ہیں۔ یہ پروجیکٹ Apple Silicon کو نشانہ بناتا ہے کیونکہ یہ ایک عملی مقامی ماحول فراہم کرتا ہے جس میں ایک مشترکہ memory space اور Metal kernels تک براہ راست رسائی ہوتی ہے۔ Qwen3-4B اتنا بڑا ہے کہ حقیقی weight-bandwidth، attention، اور cache costs کو ظاہر کرے، جبکہ اتنا چھوٹا بھی ہے کہ مقامی iteration کے لیے موزوں رہے۔ یہ کتاب skyzh.github.io/tiny-llm پر شائع کی گئی ہے۔ repository میں طلبہ کے implementations کے لیے ایک tiny_llm package اور reference solution کے ساتھ tiny_llm_ref شامل ہے۔ ایک roadmap table ہر باب کے لیے implementation، tests، documentation، اور editorial audit status کو ٹریک کرتا ہے۔