À propos du projet

Lemonade est un serveur d'IA local destiné à exécuter des modèles d'IA sur le matériel de l'utilisateur plutôt que via des API cloud. Il est distribué sous deux formes : Lemonade Server, qui installe un service exposant des API standard compatibles OpenAI, Anthropic et Ollama afin que les applications existantes puissent s'y connecter, et Embeddable Lemonade, un binaire portable destiné à être intégré dans d'autres applications pour fournir une IA locale multimodale qui s'adapte au PC de l'utilisateur. Le projet prend en charge la génération de texte, la reconnaissance vocale, la synthèse vocale, la génération audio, la génération d'images, la génération 3D et la classification de texte. Il fonctionne avec les formats de modèles GGUF, FLM et ONNX et inclut un catalogue de modèles ainsi qu'un Model Manager pour parcourir et télécharger des modèles. Des modèles GGUF ou ONNX personnalisés peuvent être récupérés depuis Hugging Face ou ModelScope. Une CLI fournit des commandes telles que `lemonade run` pour lancer un modèle et dialoguer avec lui, `lemonade launch claude` pour les workflows de codage, `lemonade list` et `lemonade pull` pour la gestion des modèles, `lemonade backends` pour inspecter les backends d'inférence disponibles sur la machine, et `lemonade alias` pour un nommage de modèles indépendant de l'environnement et un basculement actif-standby. Des configurations hybrides peuvent également router les requêtes vers des fournisseurs cloud compatibles OpenAI aux côtés des modèles locaux, décrites comme expérimentales. L'inférence est assurée par plusieurs moteurs aux exigences matérielles différentes. Pour la génération de texte, ceux-ci incluent llamacpp avec des backends système, Metal, CUDA, Vulkan, ROCm et CPU, plus llamacpp-hrx, flm et ryzenai-llm expérimentaux pour les NPU XDNA2, et vllm et ds4 expérimentaux pour AMD Strix Halo. La reconnaissance vocale utilise whispercpp et moonshine ; la synthèse vocale utilise kokoro et openmoss expérimental ; la génération audio utilise thinksound et acestep expérimentaux ; la génération d'images utilise sd-cpp et thenoise expérimental ; la génération 3D utilise trellis expérimental ; et la classification de texte utilise onnxruntime expérimental. Les systèmes d'exploitation pris en charge incluent Windows 11, plusieurs distributions Linux (Arch, Debian, Fedora, Ubuntu, Snap, Docker) et macOS, avec des paquets tels que .msi, .deb, .rpm, .pkg et des images de conteneur. L'intégration est simple pour les clients compatibles OpenAI : il suffit de pointer le client vers l'URL de base du serveur local. Le README liste des bibliothèques clientes pour Python, C++, Java, C#, Node.js, Go, Ruby, Rust et PHP, et montre un exemple en Python. Une marketplace liste des applications compatibles, notamment Claude Code, Open WebUI, AnythingLLM, Dify, n8n, OpenHands, GitHub Copilot et d'autres. Des applications mobiles pour iOS et Android sont également mentionnées. Le projet est construit par la communauté avec des optimisations réalisées par des ingénieurs AMD pour les PC Ryzen AI, Radeon et Strix Halo, et est sponsorisé par AMD. Il est sous licence Apache 2.0 et s'appuie sur des outils tels que llama.cpp, whisper.cpp, stable-diffusion.cpp, Kokoros, OnnxRuntime GenAI, Hugging Face Hub et ModelScope. Le README indique que le programme ne transfère pas d'informations vers des systèmes en réseau sauf si cela est demandé, et que les téléchargements de modèles ou les recherches dans le registre peuvent contacter Hugging Face Hub ou ModelScope selon la source sélectionnée.