Sobre o projeto

Rapid-MLX é um motor de IA local de alto desempenho projetado especificamente para Apple Silicon (M1-M4). Ele fornece uma substituição direta para as APIs OpenAI e Anthropic, permitindo que clientes existentes como Claude Code, Cursor, Aider e LangChain se conectem sem adaptadores. Os principais recursos incluem: - **Desempenho**: Alega até 3x a taxa de transferência do Ollama com kernels MLX nativos, batching contínuo, cache de prompt e cache KV quantizado. - **Compatibilidade de API**: Suporta `/v1/chat/completions`, `/v1/responses`, `/v1/messages`, `/v1/embeddings`, `/v1/audio/*`, `/v1/videos` e `/v1/images/*`. - **Suporte a Modelos**: Texto, visão, áudio (TTS/STT/clonagem de voz), geração de vídeo, geração de imagem e embeddings. Inclui um catálogo de modelos com aliases para vários tamanhos e requisitos de memória. - **Integração com Agentes**: Compatibilidade verificada por fio com 12 CLIs de agentes (ex.: Claude Code, Codex CLI, Aider) e 3 frameworks Python (LangChain, PydanticAI, smolagents). Agentes Tier-1 são reverificados de ponta a ponta em pesos reais antes de cada lançamento. - **Instalação**: Disponível via Homebrew, pip ou um instalador guiado. Aplicativo de desktop para macOS. - **Casos de Uso**: Chat de terminal, servidor compatível com OpenAI para aplicativos, backends de agentes e benchmarking. - **Extras**: Pacotes opcionais para recursos de imagem, vídeo, áudio e system-one (decisões tipadas). Rapid-MLX é posicionado como uma alternativa local rápida para desenvolvedores e entusiastas de IA em hardware Apple, enfatizando desempenho, compatibilidade e facilidade de uso.