Sobre el proyecto

Lemonade es un servidor de IA local cuyo objetivo es ejecutar modelos de IA en el hardware del propio usuario en lugar de API en la nube. Se distribuye en dos formas: Lemonade Server, que instala un servicio que expone API estándar compatibles con OpenAI, Anthropic y Ollama para que las aplicaciones existentes puedan conectarse, y Embeddable Lemonade, un binario portátil pensado para integrarse en otras aplicaciones y proporcionar IA local multimodal que se adapta al PC del usuario. El proyecto admite generación de texto, voz a texto, texto a voz, generación de audio, generación de imágenes, generación 3D y clasificación de texto. Funciona con los formatos de modelo GGUF, FLM y ONNX e incluye un catálogo de modelos y un Model Manager para explorar y descargar modelos. Se pueden obtener modelos personalizados GGUF u ONNX desde Hugging Face o ModelScope. Una CLI proporciona comandos como `lemonade run` para lanzar un modelo y chatear con él, `lemonade launch claude` para flujos de trabajo de programación, `lemonade list` y `lemonade pull` para la gestión de modelos, `lemonade backends` para inspeccionar los backends de inferencia disponibles en la máquina, y `lemonade alias` para nombrar modelos independientemente del entorno y para la conmutación por error activo-en espera. Las configuraciones híbridas también pueden enrutar solicitudes a proveedores en la nube compatibles con OpenAI junto con modelos locales, descrito como experimental. La inferencia la gestionan varios motores con distintos requisitos de hardware. Para la generación de texto, estos incluyen llamacpp con backends de sistema, Metal, CUDA, Vulkan, ROCm y CPU, además de llamacpp-hrx, flm y ryzenai-llm experimentales para NPU XDNA2, y vllm y ds4 experimentales para AMD Strix Halo. La voz a texto usa whispercpp y moonshine; el texto a voz usa kokoro y openmoss experimental; la generación de audio usa thinksound y acestep experimentales; la generación de imágenes usa sd-cpp y thenoise experimental; la generación 3D usa trellis experimental; y la clasificación de texto usa onnxruntime experimental. Los sistemas operativos compatibles incluyen Windows 11, varias distribuciones de Linux (Arch, Debian, Fedora, Ubuntu, Snap, Docker) y macOS, con paquetes como .msi, .deb, .rpm, .pkg e imágenes de contenedor. La integración es sencilla para clientes compatibles con OpenAI: apunta el cliente a la URL base del servidor local. El README enumera bibliotecas cliente para Python, C++, Java, C#, Node.js, Go, Ruby, Rust y PHP, y muestra un ejemplo en Python. Un marketplace enumera aplicaciones compatibles, como Claude Code, Open WebUI, AnythingLLM, Dify, n8n, OpenHands, GitHub Copilot y otras. También se hace referencia a aplicaciones móviles para iOS y Android. El proyecto está construido por la comunidad con optimizaciones de ingenieros de AMD para PC Ryzen AI, Radeon y Strix Halo, y está patrocinado por AMD. Tiene licencia Apache 2.0 y se basa en herramientas como llama.cpp, whisper.cpp, stable-diffusion.cpp, Kokoros, OnnxRuntime GenAI, Hugging Face Hub y ModelScope. El README indica que el programa no transfiere información a sistemas en red a menos que se solicite, y que las descargas de modelos o las consultas al registro pueden contactar con Hugging Face Hub o ModelScope según la fuente seleccionada.