প্রকল্প সম্পর্কে

AirLLM মাত্র ২ GB VRAM-সহ সাধারণ গ্রাহক-স্তরের GPU-তে বিলিয়ন-প্যারামিটার ভাষা মডেলের ইনফারেন্স ও ফাইন-টিউনিং সম্ভব করে। এটি কাজ করে যেকোনো মুহূর্তে GPU-তে কেবল একটি ট্রান্সফরমার লেয়ার রেখে — ওয়েটগুলো ডিস্ক থেকে লেয়ার ধরে ধরে স্ট্রিম হয় — তাই GPU মেমোরির প্রয়োজন লেয়ারের আকারের উপর নির্ভর করে, মোট মডেলের আকারের উপর নয়। মূল সক্ষমতা: - একটি নিম্নমানের GPU-তে ~৮B থেকে ২.৮T প্যারামিটার পর্যন্ত মডেলের ইনফারেন্স - ঐচ্ছিক ব্লক-ভিত্তিক কোয়ান্টাইজেশন (৪-বিট বা ৮-বিট), যা ইনফারেন্স ৩× পর্যন্ত দ্রুত করে - ছোট VRAM-এ বিশাল মডেলের LoRA ফাইন-টিউনিং; ফ্রোজেন বেস ওয়েট ডিস্ক থেকে স্ট্রিম হয় আর অ্যাডাপ্টার মেমোরিতে থাকে - MoE, Flash, FP8 এবং নেটিভ ভিশন (VL) আর্কিটেকচারের সমর্থন - ক্রস-প্ল্যাটফর্ম: Linux/CUDA এবং macOS (MLX-এর মাধ্যমে Apple Silicon) সমর্থিত মডেল পরিবারের মধ্যে রয়েছে Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3/3.5/3.8, dense ও MoE), DeepSeek (V2/V3/R1), Mistral ও Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi এবং Kimi K3। ব্যবহারের উদাহরণ: ```python from airllm import AutoModel model = AutoModel.from_pretrained("Qwen/Qwen3-32B") input_tokens = model.tokenizer(text, return_tensors="pt", truncation=True, max_length=128) generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20) ``` ঐচ্ছিক কম্প্রেশনসহ: ```python model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct", compression='4bit') ``` ট্রেনিং উদাহরণ (LoRA): ```bash python air_llm/examples/train_qwen38_flash_next_lora.py --data my_data.jsonl --seq-len 512 --save-adapter adapter.pt ``` কনফিগারেশন অপশন: compression (none/4bit/8bit), profiling_mode, layer_shards_saving_path, hf_token, prefetching (ডিফল্টে চালু), delete_original। প্রথম রানে মূল মডেলটি লেয়ার-ভিত্তিকভাবে ভাগ ও ক্যাশ করা হয়, তাই Hugging Face ক্যাশ ডিরেক্টরিতে পর্যাপ্ত ডিস্ক স্পেস প্রয়োজন।