Об этом проекте
HFL — это локальный запуск моделей, который загружает модели из Hugging Face Hub и предоставляет к ним доступ через API, совместимые с OpenAI, Ollama и Anthropic, на одном порту (localhost:11434). Аккаунт не требуется, всё работает полностью на вашей машине.
**Бэкенды моделей.** Репозитории GGUF работают через llama.cpp; сборки MLX работают нативно на Apple Silicon; контрольные точки safetensors автоматически конвертируются и квантуются в GGUF при загрузке. Предварительно квантованные модели GGUF и MLX не требуют компиляции.
**Просмотр Hub.** `hfl search` постранично просматривает живой Hub с размерами, числом загрузок и форматами; можно фильтровать по GGUF, числу параметров или сортировать по лайкам. Нажмите номер, чтобы загрузить модель (сначала проверяется лицензия). `hfl recommend` предлагает модели, подходящие под RAM/VRAM вашей машины, а `hfl pull-smart` выбирает лучший общественный квант для вашего оборудования.
**Управление памятью.** Перед каждой загрузкой HFL оценивает потребности в памяти (веса + KV-кэш) и удерживает машину в пределах настраиваемого бюджета (по умолчанию 85% RAM). Несколько моделей могут сосуществовать; простаивающие вытесняются по схеме LRU; используемая модель никогда не выгружается; модель, которая не помещается, отклоняется с HTTP 507 до того, как что-либо будет выгружено. Учитывает GPU на NVIDIA.
**Совместимость API.** Конечные точки OpenAI включают chat completions, completions, embeddings, responses, audio speech/transcriptions и image generations. Конечные точки Ollama включают chat, generate, embed, tags, ps, pull и delete. Конечные точки Anthropic включают messages и подсчёт токенов. Структурированный вызов инструментов работает в семействах Qwen, Llama 3, Mistral, Gemma, gpt-oss, DeepSeek, GLM и Hermes. Содержимое рассуждений/размышлений направляется в соответствующее поле для каждого API.
**Чат и сессии.** `hfl run` запускает терминальный чат; `--session` сохраняет и возобновляет разговоры в виде JSON-файлов. Встроенная веб-страница чата обслуживается по тому же адресу с системными подсказками для каждого разговора, температурой и поддержкой изображений для vision-моделей.
**Агенты для кодинга.** `hfl launch claude` или `hfl launch codex` открывает Claude Code или Codex на локальной модели, выполняя загрузку, запуск сервера, загрузку модели и настройку контекстного окна без изменения собственных настроек агента.
**Дополнительные возможности.** Горячая замена LoRA-адаптеров, снимки KV-кэша для тёплых стартов, спекулятивное декодирование через рекомендации draft-моделей, локальное обучение LoRA (Apple Silicon/MLX), клиент и сервер Model Context Protocol, синтез речи (Bark, SpeechT5, Coqui XTTS), распознавание речи (Whisper), панель соблюдения лицензий, загрузка в Hub, двунаправленный чат через WebSocket и метрики Prometheus.
**Установка.** Доступно через pip (`pip install "hfl[llama,mlx]"`), Docker, установщики .dmg/.msi и автономные бинарные файлы. Дополнительные компоненты добавляют GPU-инференс (transformers, vLLM), инструменты конвертации, TTS/STT и поддержку MCP. Существующие переменные окружения `OLLAMA_*` учитываются. Проект лицензирован под Apache 2.0 и находится в бета-версии с более чем 4 000 тестов при покрытии около 90%.
Comments
0 people shared their preference · Deer Point appears after 10 participants
Sign in to join the discussion.