منصوبے کے بارے میں

ODS (Osmantic Deployment System) ایک self-hosted AI سرور اسٹیک ہے جو ان لوگوں کے لیے ہے جو اپنے ہارڈویئر پر نجی AI چاہتے ہیں، بغیر درجنوں سروسز خود جوڑنے کے۔ ریپوزٹری اس وقت V3 Pre-Release حالت میں ہے: سرکاری V3 لانچ سے پہلے عوامی جانچ اور بہتری، اور reproducibility کے لیے ایک pinned source snapshot (v3.0.0) فراہم کیا گیا ہے۔ README بتاتا ہے کہ مکمل fleet qualification نامکمل ہے اور known limitations اور باقی gates کے لیے release notes اور promotion record کی طرف اشارہ کرتا ہے۔ یہ کیا کیا شامل کرتا ہے ODS ان اجزاء کو انسٹال اور آپس میں جوڑتا ہے جنہیں ورنہ الگ الگ کنفیگر کرنا پڑتا۔ دستاویزی اجزاء میں شامل ہیں: - llama-server کے ذریعے local model inference، ہارڈویئر کی بنیاد پر ماڈل کے انتخاب کے ساتھ۔ - Open WebUI بطور ChatGPT طرز کا براؤزر چیٹ انٹرفیس۔ - ماڈلز، سروسز، سیٹ اپ، GPU اسٹیٹس اور extensions کے لیے ایک کنٹرول ڈیش بورڈ، نیز ایک dashboard API۔ - LiteLLM بطور API gateway جو local، cloud اور hybrid modes کو سپورٹ کرتا ہے۔ - RAG اور search workflows کے لیے TEI embeddings۔ - Voice: speech-to-text کے لیے Whisper اور text-to-speech کے لیے Kokoro۔ - Agents اور automation: Portal (qualified macOS/Ubuntu/Debian systemd hosts پر ایک bundled conversational assistant)، Hermes Agent، deprecated OpenClaw agent، n8n workflow automation، APE (Agent Policy Engine)، OpenCode، اور Memory Shepherd۔ - Knowledge اور search: Qdrant vector database، SearXNG self-hosted search، Perplexica، اور اختیاری Brave Search API integration۔ - Creative: node-based image generation کے لیے ComfyUI۔ - Privacy اور ops: Privacy Shield PII scrubbing proxy، Token Spy usage monitoring، اور اختیاری Langfuse observability۔ انسٹالیشن اور پلیٹ فارمز Linux/macOS پر انسٹالیشن ایک کمانڈ ہے جو hosted script کے ذریعے چلتی ہے، اور Windows پر ایک PowerShell block جو source ZIP ڈاؤن لوڈ کر کے Windows installer چلاتا ہے۔ Docker انسٹال اور چل رہا ہونا ضروری ہے؛ Windows کے لیے Docker Desktop بمع WSL2 backend اور ایک غیر-Administrator PowerShell session درکار ہے۔ انسٹال کے بعد، web UI localhost:3000 پر دستیاب ہوتا ہے۔ ہر پلیٹ فارم کے لیے uninstall کمانڈز فراہم کی گئی ہیں۔ README کے مطابق supported platforms: Linux (NVIDIA اور AMD Strix Halo)، Windows (NVIDIA اور AMD)، اور macOS Apple Silicon۔ SYCL کے ذریعے Intel Arc والا Linux experimental/Tier C کے طور پر نشان زد ہے۔ Tested distros میں Ubuntu، Debian، Linux Mint، Fedora، Rocky Linux، Arch، Manjaro، CachyOS، اور openSUSE Tumbleweed شامل ہیں۔ macOS کے لیے Apple Silicon درکار ہے اور یہ llama-server کو Metal acceleration کے ساتھ natively چلاتا ہے جبکہ دیگر سروسز Docker میں چلتی ہیں۔ ہارڈویئر کی شناخت اور ماڈلز Installer GPU کی شناخت کرتا ہے، ایک hardware tier تفویض کرتا ہے، اور memory envelope کی بنیاد پر ایک versioned catalog (model-library.json) سے ماڈل منتخب کرتا ہے۔ یہ انتخاب .env میں LLM_MODEL، GGUF_FILE، MAX_CONTEXT، اور MODEL_RECOMMENDATION_* variables کے طور پر لکھا جاتا ہے۔ MODEL_PROFILE=qwen، gemma4، یا auto جیسے profiles منتخب کیے جانے والے family پر اثر ڈالتے ہیں، اور tier selection کو install کے وقت override کیا جا سکتا ہے۔ README میں NVIDIA، AMD Strix Halo، Apple Silicon، اور Intel Arc envelopes کے لیے مثال کے طور پر catalog picks درج ہیں، اس نوٹ کے ساتھ کہ exact installs مختلف ہو سکتی ہیں اور throughput کے لیے local benchmark ضروری ہے۔ Bootstrap mode بطور ڈیفالٹ ODS پہلے ایک چھوٹا 1.5B ماڈل ڈاؤن لوڈ کرتا ہے تاکہ صارف جلد چیٹ کر سکے، پھر پس منظر میں مکمل ماڈل ڈاؤن لوڈ کرتا ہے اور اس پر hot-swap کرتا ہے۔ Bootstrap کو --no-bootstrap کے ذریعے skip کیا جا سکتا ہے۔ ماڈل مینجمنٹ اور CLI ods CLI status اور health checks، service listing، logs، restarts، start/stop، local/cloud/hybrid modes کے درمیان switching، model tier swaps، extensions کو enable یا disable کرنا، masked configuration دیکھنا، اور presets محفوظ یا لوڈ کرنا شامل کرتا ہے۔ Model rollback کو خودکار بتایا گیا ہے اگر نیا ماڈل لوڈ ہونے میں ناکام ہو جائے۔ Extensibility ہر سروس کو ایک extension سمجھا جاتا ہے: ایک فولڈر جس میں manifest.yaml اور compose.yaml ہوتے ہیں، جسے dashboard، CLI، health checks، اور compose stack خودکار طور پر دریافت کرتے ہیں۔ Installer خود بھی modular بتایا گیا ہے، library modules، ایک مشترکہ service registry، اور ordered phases کے ساتھ۔ پوزیشننگ README ODS کو Ollama/llama.cpp، Open WebUI، n8n، اور privacy tools کو دستی طور پر stitch کرنے سے بچنے کا ایک طریقہ قرار دیتا ہے، اور ان منصوبوں سے اپنا موازنہ کرتا ہے کہ یہ ایک surrounding server stack، installer، اور control plane شامل کرتا ہے۔ یہ local-first operation پر زور دیتا ہے، اختیاری cloud یا hybrid API modes کے ساتھ، اور بتاتا ہے کہ prompts اور data مشین پر ہی رہتے ہیں جب تک صارف خود کچھ اور منتخب نہ کرے۔