منصوبے کے بارے میں
# Cactus
Cactus ایک ہائبرڈ ایج-کلاؤڈ AI انجن ہے جو موبائل آلات اور پہننے کے قابل آلات کے لیے ڈیزائن کیا گیا ہے۔ یہ آن-ڈیوائس AI انفرنس کے لیے ایک مکمل اسٹیک فراہم کرتا ہے، جس میں کوانٹائزیشن، کرنلز، ایک کمپیوٹیشن گراف، اور ایک رن ٹائم انجن شامل ہیں۔
## آرکیٹیکچر
یہ پروجیکٹ چار بنیادی تہوں میں ترتیب دیا گیا ہے:
- **Cactus Engine**: متن، تقریر اور بصارت کے کاموں کے لیے OpenAI-مطابق APIs فراہم کرتا ہے، جن میں چیٹ کمپلیشن، اسٹریمنگ، ٹول کالنگ، ٹرانسکرپشن، ایمبیڈنگز، RAG، اور کلاؤڈ ہینڈ آف شامل ہیں۔
- **Cactus Graph**: ٹینسر آپریشنز جیسے میٹرکس ضرب، توجہ، نارملائزیشن، اور ایکٹیویشن فنکشنز کے لیے ایک زیرو-کاپی کمپیوٹیشن گراف۔
- **Cactus Kernels**: Apple، Samsung، Pixel، اور دیگر موبائل پلیٹ فارمز کے لیے بہتر بنائے گئے CPU/GPU کرنلز، جو ARM NEON SIMD استعمال کرتے ہیں۔
- **Cactus Quants**: ایک کسٹم روٹیشن-بیسڈ کوانٹائزیشن تکنیک جو 4-بٹ سے 1-بٹ درستگی کی حمایت کرتی ہے۔
## فوری آغاز (Mac)
Homebrew کے ذریعے انسٹال کریں اور چلائیں:
```bash
brew install cactus-compute/cactus/cactus
cactus run
```
## اہم خصوصیات
- **ہائبرڈ ایج-کلاؤڈ**: مقامی ماڈل اعتماد کی بنیاد پر مشکل استفسارات کو خودکار طور پر کلاؤڈ پر بھیجتا ہے۔
- **ماڈل سپورٹ**: Liquid، Gemma، Whisper، Parakeet، اور Qwen ماڈل خاندانوں کے ساتھ کام کرتا ہے۔ کسی بھی HuggingFace ماڈل کو تجرباتی طور پر تبدیل کیا جا سکتا ہے۔
- **متعدد بائنڈنگز**: Swift، Kotlin، Flutter، React Native، Python، اور Rust۔
- **آن-ڈیوائس ٹول کالنگ**: آن-ڈیوائس ٹول کالنگ کے لیے "Needle" نامی 26M پیرامیٹر ماڈل شامل ہے۔
- **CLI ٹولز**: ماڈلز چلانے، ٹرانسکرپشن، سرونگ، کنورژن، بینچ مارکنگ، اور ٹیسٹنگ کے لیے کمانڈز۔
## کارکردگی
بینچ مارکس Apple سلیکون اور موبائل آلات پر مضبوط کارکردگی ظاہر کرتے ہیں۔ مثال کے طور پر، Mac M5 Max پر، انجن 1k-کانٹیکسٹ LLM بینچ مارک کے لیے 2964 ٹوکنز/سیکنڈ پریفِل اور 154 ٹوکنز/سیکنڈ ڈی کوڈ حاصل کرتا ہے۔ iPhone 17 Pro پر، یہ 729 ٹوکنز/سیکنڈ پریفِل اور 37 ٹوکنز/سیکنڈ ڈی کوڈ حاصل کرتا ہے۔
## آؤٹ پٹ کوالٹی
کوانٹائزیشن کوالٹی کا جائزہ متعدد بینچ مارکس (ARC، HellaSwag، WinoGrande، MMLU، GPQA، GSM8K، HumanEval، BFCL) میں لیا جاتا ہے۔ CQ4 کوانٹائزیشن زیادہ تر کاموں میں اصل FP16 ماڈل کے قریب کوالٹی برقرار رکھتی ہے۔
## استعمال
CLI درج ذیل کے لیے کمانڈز فراہم کرتا ہے:
- `cactus run`: کوانٹائزیشن بٹس، بیک اینڈ، تصویر/آڈیو ان پٹ، ٹولز، اور مزید کے اختیارات کے ساتھ ماڈل چلائیں۔
- `cactus transcribe`: لائیو مائیکروفون ٹرانسکرپشن یا فائل ٹرانسکرپشن۔
- `cactus download`: پہلے سے تیار ماڈل بنڈلز ڈاؤن لوڈ کریں۔
- `cactus convert`: HuggingFace ماڈلز کو Cactus CQ وزن میں تبدیل کریں۔
- `cactus serve`: ایک OpenAI-مطابق مقامی HTTP سرور شروع کریں۔
- `cactus code`: ایک AI کوڈنگ ایجنٹ چلائیں۔
- `cactus benchmark`: بینچ مارک سوئٹ چلائیں۔
- `cactus test`: ٹیسٹ سوئٹ چلائیں۔
## دستاویزات
ہر جزو کے لیے تفصیلی دستاویزات دستیاب ہیں:
- Cactus Engine (C API)
- Cactus Graph (C++)
- Cactus Kernels (C++)
- Cactus Quants (C++)
- Cactus Hybrid (C/Python)
- Python Package
## حوالہ
اگر آپ تحقیق میں Cactus استعمال کرتے ہیں، تو براہ کرم حوالہ دیں:
```bibtex
@software{cactus,
title = {Cactus: AI Inference Engine for Phones & Wearables},
author = {Ndubuaku, Henry and Cactus Team},
url = {https://github.com/cactus-compute/cactus},
year = {2025}
}
```
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.