इस प्रोजेक्ट के बारे में

LocalAI एक स्व-होस्टेड, ओपन-स्रोत AI इन्फरेंस इंजन है जिसे GPU की आवश्यकता बिना स्थानीय रूप से विस्तृत मॉडल्स की सीमा चलाने के लिए डिज़ाइन किया गया है। यह एक मोनोलिथिक बंडल के बजाय एक छोटा कोर होने के रूप में खुद को पेश करता है: प्रत्येक बैकएंड एक अपस्ट्रीम इंजन (जैसे llama.cpp, vLLM, whisper.cpp, stable-diffusion, या MLX) को अपने कंटेनर इमेज में लपेटता है, जिसे केवल तब खींचा जाता है जब किसी मॉडल को इसकी आवश्यकता होती है। इसका मतलब है कि उपयोगकर्ता केवल उन घटकों को स्थापित करते हैं जिनकी उनकी चुनी हुई मॉडल्स को आवश्यकता होती है। Key characteristics described in the README: - कंपोज़ेबल आर्किटेक्चर: बैकएंड अलग-अलग हैं और मांग पर लाए जाते हैं। - खुला और विस्तारयोग्य: उपयोगकर्ता किसी भी मॉडल को लोड कर सकते हैं या किसी भी भाषा में खुले इंटरफ़ेस के खिलाफ कस्टम बैकएंड बना सकते हैं। - ड्रॉप-इन API संगतता: OpenAI, Anthropic, और ElevenLabs API सभी बैकएंड में समर्थित हैं। - मल्टी-मोडैलिटी: टेक्स्ट जनरेशन, टेक्स्ट-टू-ऑडियो, ऑडियो-टू-टेक्स्ट, इमेज जनरेशन, विज़न, ऑब्जेक्ट डिटेक्शन, रीरैंकिंग, और एम्बेडिंग्स एक ही API के पीछे। - हार्डवेयर समर्थन: NVIDIA (CUDA 12/13), AMD (ROCm), Intel (oneAPI/SYCL), Apple Silicon (Metal), Vulkan, NVIDIA Jetson (L4T), और CPU‑only। - मल्टी‑यूज़र सुविधाएँ: API कुंजी प्रमाणीकरण, उपयोगकर्ता कोटा, और भूमिका‑आधारित एक्सेस। - बिल्ट‑इन एजेंट्स: टूल उपयोग, RAG, MCP, और स्किल्स वाले स्वायत्त एजेंट्स, साथ ही एक एजेंट हब। - प्राइवेसी‑फर्स्ट पोजिशनिंग: डेटा उपयोगकर्ता के इंफ्रास्ट्रक्चर पर रहता है। इंस्टॉलेशन विकल्पों में एक macOS DMG (असाइन्ड, क्वारंटीन एट्रिब्यूट हटाने की आवश्यकता) और Docker या podman के लिए कंटेनर इमेज शामिल हैं, जिनके variants CPU, NVIDIA CUDA 12/13, Jetson ARM64, AMD ROCm, Intel oneAPI, और Vulkan के लिए हैं। मॉडल्स को मॉडल गैलरी, Hugging Face, Ollama OCI रजिस्ट्री, YAML कॉन्फ़िग्स, या मानक OCI रजिस्ट्रीज़ से लोड किया जा सकता है। एक टर्मिनल एजेंट चल रहे सर्वर के साथ इंटरैक्ट करने के लिए उपलब्ध है, जो /models और /model जैसे कमांड्स का समर्थन करता है। परियोजना 60+ समर्थित बैकएंड की रिपोर्ट देती है और कई नैटिव C/C++/GGML इंजन बनाए रखती है, जिनमें vllm.cpp, parakeet.cpp, moss-transcribe.cpp, moss-tts.cpp, magpie-tts.cpp, ced.cpp, voice-detect.cpp, voxtral-tts.c, vibevoice.cpp, rf-detr.cpp, locate-anything.cpp, depth-anything.cpp, face-detect.cpp, free-splatter.cpp, trellis2.cpp, privacy-filter.cpp, LocalVQE, और एक लोकल वेक्टर स्टोर शामिल हैं। यह inoltre apex-quant को भी बनाए रखती है, जो Mixture-of-Experts मॉडल्स के लिए एक क्वांटाइज़ेशन रेसिपी है। सूचीबद्ध अतिरिक्त सुविधाओं में सीमित ग्रामर, P2P इन्फरेंस, PostgreSQL और NATS के साथ वितरित मोड, वॉयस एक्टिविटी डिटेक्शन (Silero-VAD), एक इंटीग्रेटेड WebUI, फाइन‑ट्यूनिंग और क्वांटाइज़ेशन वर्कफ़्लो, WebRTC समर्थन, और स्पीच‑टू‑स्पीच के लिए एक रियल‑टाइम API शामिल हैं। परियोजना MIT‑लाइसेंस प्राप्त है, Ettore Di Giacinto द्वारा बनाई गई है और समुदाय योगदान के साथ एक छोटी टीम द्वारा बनाए रखी गई है।