프로젝트 소개

llmfit은 여러분의 머신이 실제로 실행할 수 있는 오픈소스 대규모 언어 모델을 결정하도록 돕는 명령줄 도구입니다. CPU 코어, 시스템 RAM, 개별 또는 통합 GPU, VRAM 및 통합 메모리 구성(NVIDIA CUDA, Apple Silicon, AMD ROCm, Intel OneAPI)을 검사한 다음, 카탈로그의 모델을 네 가지 차원에서 점수화합니다: 메모리 적합성, 예상 속도, 품질, 컨텍스트 길이. README에 설명된 주요 기능: - macOS(Apple Silicon 및 Intel), Linux(x86_64 및 ARM64), Windows(x86_64) 전반의 하드웨어 자동 감지. - 파라미터 수, 컨텍스트 길이, 양자화 형식(GGUF, AWQ, GPTQ, EXL2)을 고려하여 메모리 사용량과 초당 토큰 성능을 예측하는 호환성 엔진. - 대화형 터미널 UI(기본)와 클래식 CLI 모드, 필터링, 도움말 키 바인딩 및 탐색 기능. - 웹 대시보드와 /api/v1/system, /api/v1/models 같은 JSON 엔드포인트를 노출하는 네이티브 HTTP API 서버로, 오케스트레이터, 대시보드 및 배포 파이프라인을 대상으로 합니다. - 다중 GPU 구성, MoE 아키텍처, 동적 양자화 선택, Ollama, llama.cpp, MLX, Docker Model Runner, LM Studio를 포함한 로컬 런타임 제공자 지원. - 벤치마킹: 모델을 다운로드하고 서빙하여 실제 tok/s와 TTFT를 측정하고, 결과를 로컬에 저장하며, 선택적으로 TUI에서 PR을 통해 프로젝트에 다시 공유할 수 있습니다. 커뮤니티 측정값은 적합성 표의 추정치를 대체할 수 있습니다. - 선택한 수의 실행 가능한 모델을 보관하기 위한 SSD 용량을 추정하는 스토리지 계획 명령. 설치 옵션에는 Windows의 Scoop, macOS/Linux의 Homebrew 및 MacPorts, curl 설치 스크립트, uv/pip 패키징, 사전 빌드된 릴리스 바이너리, 대화형 TUI 및 헤드리스 서버 모드를 지원하는 다중 아키텍처 Docker 이미지(ghcr.io/alexsjones/llmfit)가 포함됩니다. 소스에서 빌드하려면 Cargo를 사용합니다. 일반적인 명령에는 `llmfit recommend`(`--json` 포함), `llmfit fit`, `llmfit info "<model>"`, `llmfit bench`, `llmfit doctor`, `llmfit storage`, `llmfit serve`가 있습니다. README는 속도 추정치가 런타임 샘플링과 커뮤니티 측정에 기반한 메모리 대역폭 모델에서 나온다고 언급하며, `llmfit info`가 각 추정치의 가정을 보여준다고 설명합니다. 이 프로젝트는 MIT 라이선스이며, 특히 새로운 모델 항목에 대한 기여를 환영합니다.