Sobre o projeto
Lemonade é um servidor de IA local voltado para executar modelos de IA no próprio hardware do usuário em vez de APIs na nuvem. É distribuído em duas formas: Lemonade Server, que instala um serviço expondo APIs padrão compatíveis com OpenAI, Anthropic e Ollama para que aplicativos existentes possam se conectar, e Embeddable Lemonade, um binário portátil destinado a ser incorporado em outros aplicativos para fornecer IA local multimodal que se adapta ao PC do usuário.
O projeto suporta geração de texto, fala para texto, texto para fala, geração de áudio, geração de imagem, geração 3D e classificação de texto. Funciona com os formatos de modelo GGUF, FLM e ONNX e inclui um catálogo de modelos mais um Model Manager para navegar e baixar modelos. Modelos GGUF ou ONNX personalizados podem ser obtidos do Hugging Face ou do ModelScope.
Uma CLI fornece comandos como `lemonade run` para iniciar e conversar com um modelo, `lemonade launch claude` para fluxos de trabalho de programação, `lemonade list` e `lemonade pull` para gerenciamento de modelos, `lemonade backends` para inspecionar os backends de inferência disponíveis na máquina, e `lemonade alias` para nomenclatura de modelos independente de ambiente e failover ativo-standby. Configurações híbridas também podem rotear solicitações para provedores de nuvem compatíveis com OpenAI junto com modelos locais, descritas como experimentais.
A inferência é tratada por múltiplos mecanismos com diferentes requisitos de hardware. Para geração de texto, estes incluem llamacpp com backends de sistema, Metal, CUDA, Vulkan, ROCm e CPU, além de llamacpp-hrx, flm e ryzenai-llm experimentais para NPUs XDNA2, e vllm e ds4 experimentais para AMD Strix Halo. Fala para texto usa whispercpp e moonshine; texto para fala usa kokoro e openmoss experimental; geração de áudio usa thinksound e acestep experimentais; geração de imagem usa sd-cpp e thenoise experimental; geração 3D usa trellis experimental; e classificação de texto usa onnxruntime experimental. Os sistemas operacionais suportados incluem Windows 11, várias distribuições Linux (Arch, Debian, Fedora, Ubuntu, Snap, Docker) e macOS, com pacotes como .msi, .deb, .rpm, .pkg e imagens de contêiner.
A integração é simples para clientes compatíveis com OpenAI: aponte o cliente para a URL base do servidor local. O README lista bibliotecas de cliente para Python, C++, Java, C#, Node.js, Go, Ruby, Rust e PHP, e mostra um exemplo em Python. Um marketplace lista aplicativos compatíveis, incluindo Claude Code, Open WebUI, AnythingLLM, Dify, n8n, OpenHands, GitHub Copilot e outros. Aplicativos móveis para iOS e Android também são mencionados.
O projeto é construído pela comunidade com otimizações de engenheiros da AMD para PCs Ryzen AI, Radeon e Strix Halo, e é patrocinado pela AMD. É licenciado sob Apache 2.0 e baseia-se em ferramentas como llama.cpp, whisper.cpp, stable-diffusion.cpp, Kokoros, OnnxRuntime GenAI, Hugging Face Hub e ModelScope. O README afirma que o programa não transfere informações para sistemas em rede, a menos que solicitado, e que downloads de modelos ou consultas de registro podem contatar o Hugging Face Hub ou o ModelScope dependendo da fonte selecionada.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.