このプロジェクトについて

HFLは、Hugging Face Hubからモデルを取得し、単一ポート(localhost:11434)でOpenAI、Ollama、Anthropic互換APIを通じて公開するローカルモデルランナーです。アカウントは不要で、完全に自分のマシン上で動作します。 **モデルバックエンド。** GGUFリポジトリはllama.cpp経由で実行され、MLXビルドはApple Silicon上でネイティブに動作し、safetensorsチェックポイントはプル時に自動的にGGUFへ変換・量子化されます。事前量子化済みのGGUFおよびMLXモデルにはコンパイルは不要です。 **Hubの閲覧。** `hfl search`はライブHubをサイズ、ダウンロード数、フォーマットとともにページ送りで表示します。GGUF、パラメータ数でフィルタしたり、いいね順で並べ替えたりできます。番号を押すとモデルをプルします(最初にライセンスが確認されます)。`hfl recommend`はマシンのRAM/VRAMに合うモデルを提案し、`hfl pull-smart`はハードウェアに最適なコミュニティ量子化を選びます。 **メモリ管理。** 各ロードの前に、HFLは必要なメモリ(重み+KVキャッシュ)を見積もり、マシンを設定可能な予算(デフォルトはRAMの85%)以内に保ちます。複数のモデルを共存させることができ、アイドル状態のものはLRU方式で退避され、使用中のモデルは決してアンロードされず、収まらないモデルは何かがアンロードされる前にHTTP 507で拒否されます。NVIDIAではGPUを認識します。 **API互換性。** OpenAIエンドポイントにはchat completions、completions、embeddings、responses、audio speech/transcriptions、image generationsが含まれます。Ollamaエンドポイントにはchat、generate、embed、tags、ps、pull、deleteが含まれます。Anthropicエンドポイントにはmessagesとtoken countingが含まれます。構造化ツール呼び出しはQwen、Llama 3、Mistral、Gemma、gpt-oss、DeepSeek、GLM、Hermesファミリーで動作します。推論/思考コンテンツはAPIごとに適切なフィールドへルーティングされます。 **チャットとセッション。** `hfl run`はターミナルチャットを開始します。`--session`は会話をJSONファイルとして保存・再開します。同じアドレスで提供される組み込みのWebチャットページでは、会話ごとのシステムプロンプト、temperature、ビジョンモデル向けの画像サポートが利用できます。 **コーディングエージェント。** `hfl launch claude`または`hfl launch codex`は、ローカルモデル上でClaude CodeまたはCodexを起動し、エージェント自身の設定を変更することなく、ダウンロード、サーバー起動、モデルロード、コンテキストウィンドウの設定を処理します。 **追加機能。** LoRAアダプタのホットスワップ、ウォームスタート用のKVキャッシュスナップショット、ドラフトモデル推薦による投機的デコーディング、ローカルLoRAトレーニング(Apple Silicon/MLX)、Model Context Protocolクライアントおよびサーバー、テキスト読み上げ(Bark、SpeechT5、Coqui XTTS)、音声認識(Whisper)、ライセンスコンプライアンスダッシュボード、Hubアップロード、WebSocket双方向チャット、Prometheusメトリクス。 **インストール。** pip(`pip install "hfl[llama,mlx]"`)、Docker、.dmg/.msiインストーラ、スタンドアロンバイナリで利用できます。オプションの追加機能により、GPU推論(transformers、vLLM)、変換ツール、TTS/STT、MCPサポートが加わります。既存の`OLLAMA_*`環境変数が尊重されます。このプロジェクトはApache 2.0ライセンスで、ベータ版であり、約90%のカバレッジで4,000以上のテストを備えています。