প্রকল্প সম্পর্কে
AirLLM মাত্র ২ GB VRAM-সহ সাধারণ গ্রাহক-স্তরের GPU-তে বিলিয়ন-প্যারামিটার ভাষা মডেলের ইনফারেন্স ও ফাইন-টিউনিং সম্ভব করে। এটি কাজ করে যেকোনো মুহূর্তে GPU-তে কেবল একটি ট্রান্সফরমার লেয়ার রেখে — ওয়েটগুলো ডিস্ক থেকে লেয়ার ধরে ধরে স্ট্রিম হয় — তাই GPU মেমোরির প্রয়োজন লেয়ারের আকারের উপর নির্ভর করে, মোট মডেলের আকারের উপর নয়।
মূল সক্ষমতা:
- একটি নিম্নমানের GPU-তে ~৮B থেকে ২.৮T প্যারামিটার পর্যন্ত মডেলের ইনফারেন্স
- ঐচ্ছিক ব্লক-ভিত্তিক কোয়ান্টাইজেশন (৪-বিট বা ৮-বিট), যা ইনফারেন্স ৩× পর্যন্ত দ্রুত করে
- ছোট VRAM-এ বিশাল মডেলের LoRA ফাইন-টিউনিং; ফ্রোজেন বেস ওয়েট ডিস্ক থেকে স্ট্রিম হয় আর অ্যাডাপ্টার মেমোরিতে থাকে
- MoE, Flash, FP8 এবং নেটিভ ভিশন (VL) আর্কিটেকচারের সমর্থন
- ক্রস-প্ল্যাটফর্ম: Linux/CUDA এবং macOS (MLX-এর মাধ্যমে Apple Silicon)
সমর্থিত মডেল পরিবারের মধ্যে রয়েছে Llama (2/3/3.1/3.3/4), Qwen (1/2/2.5/3/3.5/3.8, dense ও MoE), DeepSeek (V2/V3/R1), Mistral ও Mixtral, Phi, Gemma, ChatGLM, Baichuan, InternLM, Yi এবং Kimi K3।
ব্যবহারের উদাহরণ:
```python
from airllm import AutoModel
model = AutoModel.from_pretrained("Qwen/Qwen3-32B")
input_tokens = model.tokenizer(text, return_tensors="pt", truncation=True, max_length=128)
generation_output = model.generate(input_tokens['input_ids'].cuda(), max_new_tokens=20)
```
ঐচ্ছিক কম্প্রেশনসহ:
```python
model = AutoModel.from_pretrained("garage-bAInd/Platypus2-70B-instruct", compression='4bit')
```
ট্রেনিং উদাহরণ (LoRA):
```bash
python air_llm/examples/train_qwen38_flash_next_lora.py --data my_data.jsonl --seq-len 512 --save-adapter adapter.pt
```
কনফিগারেশন অপশন: compression (none/4bit/8bit), profiling_mode, layer_shards_saving_path, hf_token, prefetching (ডিফল্টে চালু), delete_original। প্রথম রানে মূল মডেলটি লেয়ার-ভিত্তিকভাবে ভাগ ও ক্যাশ করা হয়, তাই Hugging Face ক্যাশ ডিরেক্টরিতে পর্যাপ্ত ডিস্ক স্পেস প্রয়োজন।
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.