À propos du projet
llmfit est un outil en ligne de commande qui vous aide à décider quels modèles de langage open-source votre machine peut réellement exécuter. Il inspecte les cœurs CPU, la RAM système, les GPU discrets ou intégrés, la VRAM et les configurations de mémoire unifiée (NVIDIA CUDA, Apple Silicon, AMD ROCm, Intel OneAPI), puis évalue les modèles de son catalogue selon quatre dimensions : adéquation mémoire, vitesse estimée, qualité et longueur de contexte.
Capacités clés décrites dans le README :
- Détection automatique du matériel sur macOS (Apple Silicon et Intel), Linux (x86_64 et ARM64) et Windows (x86_64).
- Un moteur de compatibilité qui prend en compte les nombres de paramètres, les longueurs de contexte et les formats de quantification (GGUF, AWQ, GPTQ, EXL2) pour projeter les empreintes mémoire et les performances en tokens par seconde.
- Une interface terminal interactive (par défaut) plus un mode CLI classique, avec filtres, raccourcis d'aide et navigation.
- Un tableau de bord web et un serveur API HTTP natif exposant des endpoints JSON tels que /api/v1/system et /api/v1/models, destinés aux orchestrateurs, tableaux de bord et pipelines de déploiement.
- Prise en charge des configurations multi-GPU, architectures MoE, sélection dynamique de quantification et fournisseurs d'exécution locaux incluant Ollama, llama.cpp, MLX, Docker Model Runner et LM Studio.
- Benchmarking : télécharger et servir un modèle, mesurer les tok/s réels et le TTFT, sauvegarder les résultats localement, et éventuellement les partager au projet via une PR depuis la TUI. Les mesures communautaires peuvent remplacer les estimations dans le tableau d'adéquation.
- Commandes de planification de stockage pour estimer la capacité SSD nécessaire afin de conserver un nombre choisi de modèles exécutables.
Les options d'installation incluent Scoop sur Windows, Homebrew et MacPorts sur macOS/Linux, un script d'installation curl, un packaging uv/pip, des binaires précompilés, et une image Docker multi-architecture (ghcr.io/alexsjones/llmfit) supportant les modes TUI interactif et serveur sans interface. La compilation depuis les sources utilise Cargo.
Les commandes typiques incluent `llmfit recommend` (avec `--json`), `llmfit fit`, `llmfit info "<modèle>"`, `llmfit bench`, `llmfit doctor`, `llmfit storage` et `llmfit serve`. Le README note que les estimations de vitesse proviennent d'un modèle de bande passante mémoire basé sur l'échantillonnage d'exécution et les mesures communautaires, et que `llmfit info` montre les hypothèses derrière chaque estimation. Le projet est sous licence MIT et accueille les contributions, en particulier les nouvelles entrées de modèles.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.