这个项目能做什么

HFL 是一个本地模型运行器,可从 Hugging Face Hub 获取模型,并通过 OpenAI、Ollama 和 Anthropic 兼容 API 在单一端口(localhost:11434)上暴露这些模型。它不需要账户,完全在你自己的机器上运行。 **模型后端。** GGUF 仓库通过 llama.cpp 运行;MLX 构建在 Apple Silicon 上原生运行;safetensors 检查点在拉取时自动转换并量化为 GGUF。预量化的 GGUF 和 MLX 模型无需编译。 **Hub 浏览。** `hfl search` 会分页浏览实时 Hub,显示大小、下载量和格式;你可以按 GGUF、参数量筛选,或按点赞数排序。按数字即可拉取模型(会先检查许可证)。`hfl recommend` 会推荐适合你机器 RAM/VRAM 的模型,`hfl pull-smart` 会为你的硬件挑选最佳的社区量化版本。 **内存管理。** 每次加载前,HFL 会估算内存需求(权重 + KV 缓存),并将机器保持在可配置预算内(默认 RAM 的 85%)。多个模型可以共存;空闲模型会按 LRU 方式驱逐;正在使用的模型绝不会被卸载;无法容纳的模型会在卸载任何内容之前以 HTTP 507 拒绝。在 NVIDIA 上支持 GPU 感知。 **API 兼容性。** OpenAI 端点包括聊天补全、补全、嵌入、响应、音频语音/转录和图像生成。Ollama 端点包括 chat、generate、embed、tags、ps、pull 和 delete。Anthropic 端点包括 messages 和 token counting。结构化工具调用适用于 Qwen、Llama 3、Mistral、Gemma、gpt-oss、DeepSeek、GLM 和 Hermes 系列。推理/思考内容会按各 API 路由到相应字段。 **聊天和会话。** `hfl run` 启动终端聊天;`--session` 将会话保存为 JSON 文件并可恢复。内置网页聊天页面在同一地址提供服务,支持按对话设置系统提示、温度,以及为视觉模型提供图像支持。 **编码代理。** `hfl launch claude` 或 `hfl launch codex` 可在本地模型上打开 Claude Code 或 Codex,处理下载、服务器启动、模型加载和上下文窗口配置,而不会修改代理自身的设置。 **附加功能。** LoRA 适配器热插拔、用于热启动的 KV 缓存快照、通过草稿模型推荐进行投机解码、本地 LoRA 训练(Apple Silicon/MLX)、Model Context Protocol 客户端和服务器、文本转语音(Bark、SpeechT5、Coqui XTTS)、语音转文本(Whisper)、许可证合规仪表板、Hub 上传、WebSocket 双向聊天和 Prometheus 指标。 **安装。** 可通过 pip(`pip install "hfl[llama,mlx]"`)、Docker、.dmg/.msi 安装程序和独立二进制文件获取。可选附加组件增加 GPU 推理(transformers、vLLM)、转换工具、TTS/STT 和 MCP 支持。现有的 `OLLAMA_*` 环境变量会被遵循。该项目采用 Apache 2.0 许可证,处于 beta 阶段,拥有 4,000+ 测试,覆盖率约 90%。