Sobre o projeto

llmfit é uma ferramenta de linha de comando que ajuda a decidir quais modelos de linguagem de grande porte de código aberto sua máquina realmente consegue executar. Ela inspeciona núcleos de CPU, RAM do sistema, GPUs dedicadas ou integradas, VRAM e configurações de memória unificada (NVIDIA CUDA, Apple Silicon, AMD ROCm, Intel OneAPI), depois pontua os modelos de seu catálogo em quatro dimensões: ajuste de memória, velocidade estimada, qualidade e comprimento de contexto. Principais capacidades descritas no README: - Detecção automática de hardware em macOS (Apple Silicon e Intel), Linux (x86_64 e ARM64) e Windows (x86_64). - Um mecanismo de compatibilidade que considera contagens de parâmetros, comprimentos de contexto e formatos de quantização (GGUF, AWQ, GPTQ, EXL2) para projetar pegadas de memória e desempenho em tokens por segundo. - Uma interface de terminal interativa (padrão) mais um modo CLI clássico, com filtragem, atalhos de ajuda e navegação. - Um painel web e um servidor de API HTTP nativo que expõe endpoints JSON como /api/v1/system e /api/v1/models, destinados a orquestradores, painéis e pipelines de implantação. - Suporte a configurações multi-GPU, arquiteturas MoE, seleção dinâmica de quantização e provedores de runtime locais, incluindo Ollama, llama.cpp, MLX, Docker Model Runner e LM Studio. - Benchmarking: baixar e servir um modelo, medir tok/s e TTFT reais, salvar resultados localmente e, opcionalmente, compartilhá-los de volta com o projeto via PR a partir da TUI. Medições da comunidade podem substituir estimativas na tabela de ajuste. - Comandos de planejamento de armazenamento para estimar a capacidade do SSD necessária para manter um número escolhido de modelos executáveis. As opções de instalação incluem Scoop no Windows, Homebrew e MacPorts no macOS/Linux, um script de instalação via curl, empacotamento uv/pip, binários de release pré-compilados e uma imagem Docker multiarquitetura (ghcr.io/alexsjones/llmfit) com suporte a TUI interativa e modos de servidor headless. A compilação a partir do código-fonte usa Cargo. Comandos típicos incluem llmfit recommend (com --json), llmfit fit, llmfit info "modelo", llmfit bench, llmfit doctor, llmfit storage e llmfit serve. O README observa que as estimativas de velocidade vêm de um modelo de largura de banda de memória baseado em amostragem de runtime e medições da comunidade, e que llmfit info mostra as premissas por trás de cada estimativa. O projeto é licenciado sob MIT e aceita contribuições, especialmente novas entradas de modelos.