عن المشروع

HFL هو مشغّل نماذج محلي يقوم بجلب النماذج من Hugging Face Hub ويعرضها عبر واجهات برمجية متوافقة مع OpenAI وOllama وAnthropic على منفذ واحد (localhost:11434). لا يتطلب أي حساب ويعمل بالكامل على جهازك الخاص. **خلفيات النماذج.** تعمل مستودعات GGUF عبر llama.cpp؛ وتبنى MLX تعمل أصليًا على Apple Silicon؛ ويتم تحويل نقاط تفتيش safetensors تلقائيًا وتكميمها إلى GGUF عند السحب. لا تحتاج نماذج GGUF وMLX المكمّمة مسبقًا إلى أي تجميع. **تصفح Hub.** يتنقل `hfl search` عبر Hub المباشر مع الأحجام والتنزيلات والصيغ؛ يمكنك التصفية حسب GGUF أو عدد المعاملات أو الترتيب حسب الإعجابات. اضغط على رقم لسحب نموذج (يتم التحقق من الترخيص أولًا). يقترح `hfl recommend` نماذج تناسب ذاكرة RAM/VRAM لجهازك، ويختار `hfl pull-smart` أفضل تكميم مجتمعي لعتادك. **إدارة الذاكرة.** قبل كل تحميل، يقدّر HFL احتياجات الذاكرة (الأوزان + ذاكرة KV المؤقتة) ويبقي الجهاز ضمن ميزانية قابلة للتكوين (افتراضيًا 85% من RAM). يمكن لعدة نماذج التعايش؛ يتم إخلاء النماذج الخاملة بنمط LRU؛ لا يتم أبدًا إلغاء تحميل نموذج قيد الاستخدام؛ ويُرفض النموذج الذي لا يمكن أن يتسع مع HTTP 507 قبل إلغاء تحميل أي شيء. واعٍ بوحدة GPU على NVIDIA. **توافق API.** تشمل نقاط نهاية OpenAI إكمالات الدردشة، والإكمالات، والتضمينات، والردود، والكلام/النسخ الصوتي، وتوليد الصور. تشمل نقاط نهاية Ollama الدردشة، والتوليد، والتضمين، والوسوم، وps، والسحب، والحذف. تشمل نقاط نهاية Anthropic الرسائل وعدّ الرموز. يعمل استدعاء الأدوات المنظم عبر عائلات Qwen وLlama 3 وMistral وGemma وgpt-oss وDeepSeek وGLM وHermes. يتم توجيه محتوى الاستدلال/التفكير إلى الحقل المناسب لكل API. **الدردشة والجلسات.** يبدأ `hfl run` دردشة طرفية؛ ويحفظ `--session` المحادثات ويستأنفها كملفات JSON. تُقدَّم صفحة دردشة ويب مدمجة على نفس العنوان مع مطالبات نظام لكل محادثة، ودرجة حرارة، ودعم الصور لنماذج الرؤية. **وكلاء البرمجة.** يفتح `hfl launch claude` أو `hfl launch codex` Claude Code أو Codex على نموذج محلي، مع التعامل مع التنزيل وبدء الخادم وتحميل النموذج وتكوين نافذة السياق دون تعديل إعدادات الوكيل نفسه. **ميزات إضافية.** التبديل الساخن لمحوّل LoRA، ولقطات ذاكرة KV المؤقتة لبدايات دافئة، وفك التشفير التخميني عبر توصيات النموذج المسودة، والتدريب المحلي لـ LoRA (Apple Silicon/MLX)، وعميل وخادم Model Context Protocol، وتحويل النص إلى كلام (Bark، SpeechT5، Coqui XTTS)، وتحويل الكلام إلى نص (Whisper)، ولوحة الامتثال للتراخيص، والرفع إلى Hub، ودردشة WebSocket ثنائية الاتجاه، ومقاييس Prometheus. **التثبيت.** متاح عبر pip (`pip install "hfl[llama,mlx]"`)، وDocker، ومثبّتات .dmg/.msi، وملفات ثنائية مستقلة. تضيف الإضافات الاختيارية استدلال GPU (transformers، vLLM)، وأدوات التحويل، وTTS/STT، ودعم MCP. يتم احترام متغيرات البيئة `OLLAMA_*` الموجودة. المشروع مرخّص بموجب Apache 2.0 وفي مرحلة تجريبية مع أكثر من 4,000 اختبار بتغطية تقارب 90%.