इस प्रोजेक्ट के बारे में

HFL एक लोकल मॉडल रनर है जो Hugging Face Hub से मॉडल फ़ेच करता है और उन्हें एक ही पोर्ट (localhost:11434) पर OpenAI, Ollama और Anthropic-संगत API के ज़रिए एक्सपोज़ करता है। इसे किसी अकाउंट की ज़रूरत नहीं होती और यह पूरी तरह आपकी ही मशीन पर चलता है। **मॉडल बैकएंड।** GGUF रेपो llama.cpp के ज़रिए चलते हैं; MLX बिल्ड Apple Silicon पर नेटिव रूप से चलते हैं; safetensors चेकपॉइंट pull के समय अपने आप GGUF में कन्वर्ट और क्वांटाइज़ हो जाते हैं। पहले से क्वांटाइज़्ड GGUF और MLX मॉडल के लिए किसी कंपाइलेशन की ज़रूरत नहीं। **Hub ब्राउज़िंग।** `hfl search` लाइव Hub को साइज़, डाउनलोड और फ़ॉर्मैट के साथ पेज करता है; आप GGUF, पैरामीटर काउंट से फ़िल्टर कर सकते हैं, या likes से सॉर्ट कर सकते हैं। मॉडल pull करने के लिए कोई नंबर दबाएँ (पहले लाइसेंस चेक होता है)। `hfl recommend` आपकी मशीन की RAM/VRAM में फ़िट होने वाले मॉडल सुझाता है, और `hfl pull-smart` आपके हार्डवेयर के लिए सबसे अच्छा कम्युनिटी क्वांट चुनता है। **मेमोरी प्रबंधन।** हर लोड से पहले, HFL मेमोरी ज़रूरतों (वेट्स + KV cache) का अनुमान लगाता है और मशीन को एक कॉन्फ़िगर करने योग्य बजट (डिफ़ॉल्ट रूप से RAM का 85%) के अंदर रखता है। कई मॉडल साथ रह सकते हैं; आइडल वाले LRU-शैली में हटा दिए जाते हैं; उपयोग में मौजूद मॉडल कभी अनलोड नहीं होता; जो मॉडल फ़िट नहीं हो सकता, उसे कुछ भी अनलोड करने से पहले HTTP 507 के साथ अस्वीकार कर दिया जाता है। NVIDIA पर GPU-अवेयर। **API संगतता।** OpenAI एंडपॉइंट में chat completions, completions, embeddings, responses, audio speech/transcriptions, और image generations शामिल हैं। Ollama एंडपॉइंट में chat, generate, embed, tags, ps, pull, और delete शामिल हैं। Anthropic एंडपॉइंट में messages और token counting शामिल हैं। स्ट्रक्चर्ड टूल कॉलिंग Qwen, Llama 3, Mistral, Gemma, gpt-oss, DeepSeek, GLM, और Hermes फ़ैमिलीज़ में काम करती है। रीज़निंग/थिंकिंग कंटेंट को प्रति API उपयुक्त फ़ील्ड में रूट किया जाता है। **चैट और सेशन।** `hfl run` एक टर्मिनल चैट शुरू करता है; `--session` बातचीत को JSON फ़ाइलों के रूप में सेव और रिज़्यूम करता है। उसी पते पर एक बिल्ट-इन वेब चैट पेज सर्व किया जाता है, जिसमें प्रति-बातचीत system prompts, temperature, और विज़न मॉडल के लिए इमेज सपोर्ट होता है। **कोडिंग एजेंट।** `hfl launch claude` या `hfl launch codex` किसी लोकल मॉडल पर Claude Code या Codex खोलता है, और एजेंट की अपनी सेटिंग्स बदले बिना डाउनलोड, सर्वर स्टार्टअप, मॉडल लोडिंग, और कॉन्टेक्स्ट विंडो कॉन्फ़िगरेशन संभालता है। **अतिरिक्त फ़ीचर।** LoRA अडैप्टर हॉट-स्वैपिंग, वॉर्म स्टार्ट के लिए KV cache स्नैपशॉट, ड्राफ़्ट मॉडल सिफ़ारिशों के ज़रिए speculative decoding, लोकल LoRA ट्रेनिंग (Apple Silicon/MLX), Model Context Protocol क्लाइंट और सर्वर, text-to-speech (Bark, SpeechT5, Coqui XTTS), speech-to-text (Whisper), लाइसेंस अनुपालन डैशबोर्ड, Hub अपलोड, WebSocket द्विदिशात्मक चैट, और Prometheus मेट्रिक्स। **इंस्टॉलेशन।** pip (`pip install "hfl[llama,mlx]"`), Docker, .dmg/.msi इंस्टॉलर, और स्टैंडअलोन बाइनरीज़ के ज़रिए उपलब्ध। वैकल्पिक extras GPU इन्फ़रेंस (transformers, vLLM), कन्वर्ज़न टूल्स, TTS/STT, और MCP सपोर्ट जोड़ते हैं। मौजूदा `OLLAMA_*` एनवायरनमेंट वेरिएबल्स का सम्मान किया जाता है। प्रोजेक्ट Apache 2.0 लाइसेंस के अंतर्गत है और बीटा में है, जिसमें ~90% कवरेज के साथ 4,000+ टेस्ट हैं।