À propos du projet

Magnitude est un moteur d'inférence local sous Apache-2.0 pour exécuter des modèles à poids ouverts et les connecter à des applications d'agents. Il est fourni sous forme d'application de bureau pour macOS, Windows et Linux, et l'application inclut la CLI magnitude sans installation séparée. Les utilisateurs peuvent découvrir et télécharger des modèles recommandés, puis connecter les agents pris en charge via l'écran Connections. L'approche technique principale du projet consiste à compiler et ajuster les kernels de calcul sur l'appareil réel avant d'exécuter un modèle, plutôt que de s'appuyer uniquement sur des kernels conçus pour de grandes classes de matériel. Il inclut également des kernels optimisés manuellement pour certaines familles populaires de modèles à poids ouverts. Le README rapporte des résultats de benchmark face à llama.cpp de 9 % plus rapide en prefill et 92 % plus rapide en decode sur Metal, et de 23 % plus rapide en prefill et 19 % plus rapide en decode sur CUDA, résumés comme jusqu'à 2x plus rapide au global. Parmi les autres fonctionnalités annoncées figurent une utilisation mémoire réduite par agent, la libération de la mémoire lorsque les agents s'arrêtent, et des caches de préfixe partagés pour les sessions concurrentes. Les intégrations en un clic listées incluent Pi, OpenCode, Hermes, OpenClaw, Codex, Claude Code, Oh My Pi et Cline. D'autres logiciels peuvent utiliser l'API compatible OpenAI. Magnitude prend en charge Apple Silicon, les GPU NVIDIA, les GPU AMD et les systèmes CPU uniquement. Selon la documentation, les prompts, les fichiers et les modèles restent sur la machine locale, et aucune connexion internet n'est requise après le téléchargement d'un modèle. La liste complète des modèles pris en charge est maintenue sur le site web du projet.