প্রকল্প সম্পর্কে

LocalAI एक स्व‑होस्टेड, ओपन‑सोर्स AI इन्फरेंस इंजन है जो GPU की आवश्यकता के बिना स्थानीय रूप से विस्तृत मॉडल्स चलाने के लिए डिज़ाइन किया गया है। यह एक मोनोलिथिक बंडल के बजाय एक छोटा कोर पेश करता है: प्रत्येक बैकएंड एक अपस्ट्रीम इंजन (जैसे llama.cpp, vLLM, whisper.cpp, stable‑diffusion, या MLX) को अपने włas conteneur इमेज में लपेटता है, जिसे केवल तब खींचा जाता है जब किसी मॉडल की आवश्यकता होती है। इसका मतलब है कि उपयोगकर्ता केवल उनके चुने हुए मॉडल के लिए आवश्यक घटक ही इंस्टॉल करते हैं। README में वर्णित मुख्य विशेषताएं: - कंपोज़ेबल आर्किटेक्चर: बैकएंड अलग‑अलग हैं और मांग पर फेच किए जाते हैं। - खुला और विस्तार योग्य: उपयोगकर्ता कोई भी मॉडल लोड कर सकते हैं या खुले इंटरफ़ेस के खिलाफ किसी भी भाषा में कस्टम बैकएंड बना सकते हैं। - ड्रॉप‑इन API संगतता: OpenAI, Anthropic और ElevenLabs API सभी बैकएंड में समर्थित हैं। - बहु‑मोडैलिटी: एक ही API के पीछे टेक्स्ट जनरेशन, टेक्स्ट‑टू‑ऑडियो, ऑडियो‑टू‑टेक्स्ट, इमेज जनरेशन, विज़न, ऑब्जेक्ट डिटेक्शन, रीरैंकिंग और एम्बेडिंग्स। - हार्डवेयर समर्थन: NVIDIA (CUDA 12/13), AMD (ROCm), Intel (oneAPI/SYCL), Apple Silicon (Metal), Vulkan, NVIDIA Jetson (L4T), और CPU‑केवल। - मल्टी‑यूज़र सुविधाएँ: API कुंजी प्रमाणीकरण, उपयोगकर्ता कोटा, और भूमिका‑आधारित एक्सेस। - बिल्ट‑इन एजेंट: टूल उपयोग, RAG, MCP और स्किल्स वाले स्वायत्त एजेंट, साथ ही एक एजेंट हब। - गोपनीयता‑प्रथम स्थिति: डेटा उपयोगकर्ता के अपने इंफ्रास्ट्रक्चर पर रहता है। इंस्टॉलेशन विकल्पों में एक macOS DMG (असाइन्ड, क्वारंटाइन एट्रिब्यूट हटाने की आवश्यकता) और Docker या podman के लिए कंटेनर इमेज शामिल हैं, जिनमें CPU, NVIDIA CUDA 12/13, Jetson ARM64, AMD ROCm, Intel oneAPI, और Vulkan वेरिएंट शामिल हैं। मॉडल मॉडल गैलरी, Hugging Face, Ollama OCI रजिस्ट्री, YAML कॉन्फ़िग, या मानक OCI रजिस्ट्री से लोड किए जा सकते हैं। एक टर्मिनल एजेंट चल रहे सर्वर के साथ इंटरैक्ट करने के लिए उपलब्ध है, जो /models और /model जैसे कमांड्स का समर्थन करता है। प्रोजेक्ट 60+ समर्थित बैकएंड की रिपोर्ट करता है और कई नेटिव C/C++/GGML इंजन बनाए रखता है, जिनमें vllm.cpp, parakeet.cpp, moss‑transcribe.cpp, moss‑tts.cpp, magpie‑tts.cpp, ced.cpp, voice‑detect.cpp, voxtral‑tts.c, vibevoice.cpp, rf‑detr.cpp, locate‑anything.cpp, depth‑anything.cpp, face‑detect.cpp, free‑splatter.cpp, trellis2.cpp, privacy‑filter.cpp, LocalVQE, और एक लोकल वेक्टर स्टोर शामिल हैं। यह inoltre apex‑quant बनाए रखता है, जो Mixture‑of‑Experts मॉडल के लिए एक क्वांटाइज़ेशन रेसिपी है। अतिरिक्त सूचीबद्ध सुविधाओं में सीमित ग्रामर, P2P इन्फरेंस, PostgreSQL और NATS के साथ वितरित मोड, वॉयस एक्टिविटी डिटेक्शन (Silero‑VAD), एक इंटीग्रेटेड WebUI, फाइन‑ट्यूनिंग और क्वांटाइज़ेशन वर्कफ़्लो, WebRTC समर्थन, और स्पीच‑टू‑स्पीच के लिए एक रियलटाइम API शामिल है। प्रोजेक्ट MIT‑लाइसेंस प्राप्त है, Ettore Di Giacinto द्वारा बनाया गया है और एक छोटी टीम द्वारा समुदाय के योगदान के साथ बनाए रखा गया है।