À propos du projet

HFL est un exécuteur de modèles local qui récupère les modèles depuis le Hugging Face Hub et les expose via des API compatibles OpenAI, Ollama et Anthropic sur un seul port (localhost:11434). Il ne nécessite aucun compte et fonctionne entièrement sur votre propre machine. **Backends de modèles.** Les dépôts GGUF s'exécutent via llama.cpp ; les builds MLX s'exécutent nativement sur Apple Silicon ; les checkpoints safetensors sont automatiquement convertis et quantifiés en GGUF lors du pull. Les modèles GGUF et MLX pré-quantifiés ne nécessitent aucune compilation. **Navigation dans le Hub.** `hfl search` parcourt le Hub en direct avec tailles, téléchargements et formats ; vous pouvez filtrer par GGUF, nombre de paramètres, ou trier par likes. Appuyez sur un numéro pour tirer un modèle (la licence est vérifiée au préalable). `hfl recommend` suggère des modèles adaptés à la RAM/VRAM de votre machine, et `hfl pull-smart` choisit la meilleure quantification communautaire pour votre matériel. **Gestion de la mémoire.** Avant chaque chargement, HFL estime les besoins en mémoire (poids + cache KV) et maintient la machine sous un budget configurable (85 % de la RAM par défaut). Plusieurs modèles peuvent coexister ; les modèles inactifs sont évincés selon une stratégie LRU ; un modèle en cours d'utilisation n'est jamais déchargé ; un modèle qui ne peut pas tenir est refusé avec un HTTP 507 avant tout déchargement. Conscient du GPU sur NVIDIA. **Compatibilité API.** Les endpoints OpenAI incluent chat completions, completions, embeddings, responses, audio speech/transcriptions et image generations. Les endpoints Ollama incluent chat, generate, embed, tags, ps, pull et delete. Les endpoints Anthropic incluent messages et token counting. L'appel d'outils structuré fonctionne sur les familles Qwen, Llama 3, Mistral, Gemma, gpt-oss, DeepSeek, GLM et Hermes. Le contenu de raisonnement/thinking est routé vers le champ approprié selon l'API. **Chat et sessions.** `hfl run` démarre un chat en terminal ; `--session` sauvegarde et reprend les conversations sous forme de fichiers JSON. Une page de chat web intégrée est servie à la même adresse avec des prompts système, une température et un support d'images par conversation pour les modèles de vision. **Agents de codage.** `hfl launch claude` ou `hfl launch codex` ouvre Claude Code ou Codex sur un modèle local, en gérant le téléchargement, le démarrage du serveur, le chargement du modèle et la configuration de la fenêtre de contexte sans modifier les propres paramètres de l'agent. **Fonctionnalités supplémentaires.** Échange à chaud d'adaptateurs LoRA, instantanés du cache KV pour des démarrages à chaud, décodage spéculatif via des recommandations de modèles draft, entraînement LoRA local (Apple Silicon/MLX), client et serveur Model Context Protocol, synthèse vocale (Bark, SpeechT5, Coqui XTTS), reconnaissance vocale (Whisper), tableau de bord de conformité des licences, upload vers le Hub, chat bidirectionnel WebSocket et métriques Prometheus. **Installation.** Disponible via pip (`pip install "hfl[llama,mlx]"`), Docker, installateurs .dmg/.msi et binaires autonomes. Des extras optionnels ajoutent l'inférence GPU (transformers, vLLM), les outils de conversion, TTS/STT et le support MCP. Les variables d'environnement `OLLAMA_*` existantes sont honorées. Le projet est sous licence Apache 2.0 et en beta avec plus de 4 000 tests à environ 90 % de couverture.