Sobre o projeto

O HFL é um executor de modelos local que busca modelos do Hugging Face Hub e os expõe por meio de APIs compatíveis com OpenAI, Ollama e Anthropic em uma única porta (localhost:11434). Não requer conta e opera inteiramente na sua própria máquina. **Backends de modelos.** Repositórios GGUF são executados via llama.cpp; builds MLX rodam nativamente em Apple Silicon; checkpoints safetensors são convertidos e quantizados automaticamente para GGUF no pull. Modelos GGUF e MLX pré-quantizados não precisam de compilação. **Navegação no Hub.** `hfl search` pagina pelo Hub ao vivo com tamanhos, downloads e formatos; você pode filtrar por GGUF, contagem de parâmetros ou ordenar por curtidas. Pressione um número para baixar um modelo (a licença é verificada primeiro). `hfl recommend` sugere modelos que cabem na RAM/VRAM da sua máquina, e `hfl pull-smart` escolhe a melhor quantização da comunidade para o seu hardware. **Gerenciamento de memória.** Antes de cada carregamento, o HFL estima as necessidades de memória (pesos + cache KV) e mantém a máquina dentro de um orçamento configurável (padrão de 85% da RAM). Vários modelos podem coexistir; os ociosos são removidos no estilo LRU; um modelo em uso nunca é descarregado; um modelo que não cabe é recusado com HTTP 507 antes que qualquer coisa seja descarregada. Consciente de GPU em NVIDIA. **Compatibilidade de API.** Os endpoints OpenAI incluem chat completions, completions, embeddings, responses, áudio fala/transcrições e geração de imagens. Os endpoints Ollama incluem chat, generate, embed, tags, ps, pull e delete. Os endpoints Anthropic incluem messages e contagem de tokens. O chamado estruturado de ferramentas funciona nas famílias Qwen, Llama 3, Mistral, Gemma, gpt-oss, DeepSeek, GLM e Hermes. O conteúdo de raciocínio/pensamento é roteado para o campo apropriado por API. **Chat e sessões.** `hfl run` inicia um chat no terminal; `--session` salva e retoma conversas como arquivos JSON. Uma página de chat web integrada é servida no mesmo endereço com prompts de sistema por conversa, temperatura e suporte a imagens para modelos de visão. **Agentes de programação.** `hfl launch claude` ou `hfl launch codex` abre o Claude Code ou o Codex em um modelo local, cuidando do download, inicialização do servidor, carregamento do modelo e configuração da janela de contexto sem modificar as configurações do próprio agente. **Recursos adicionais.** Troca a quente de adaptadores LoRA, snapshots de cache KV para inicializações rápidas, decodificação especulativa via recomendações de modelo draft, treinamento LoRA local (Apple Silicon/MLX), cliente e servidor Model Context Protocol, text-to-speech (Bark, SpeechT5, Coqui XTTS), speech-to-text (Whisper), painel de conformidade de licenças, upload para o Hub, chat bidirecional via WebSocket e métricas Prometheus. **Instalação.** Disponível via pip (`pip install "hfl[llama,mlx]"`), Docker, instaladores .dmg/.msi e binários autônomos. Extras opcionais adicionam inferência em GPU (transformers, vLLM), ferramentas de conversão, TTS/STT e suporte a MCP. Variáveis de ambiente `OLLAMA_*` existentes são respeitadas. O projeto é licenciado sob Apache 2.0 e está em beta com mais de 4.000 testes em cerca de 90% de cobertura.