Sobre o projeto
LocalAI é um motor de inferência de IA open-source e auto-hospedado, projetado para executar uma ampla gama de modelos localmente sem exigir GPU. Apresenta-se como um núcleo pequeno, em vez de um pacote monolítico: cada backend envolve um motor upstream (como llama.cpp, vLLM, whisper.cpp, stable-diffusion ou MLX) em sua própria imagem de contêiner, puxada apenas quando um modelo é necessário. Isso significa que os usuários instalam somente os componentes requeridos pelos modelos escolhidos.
Principais características descritas no README:
- Arquitetura composta: backends são separados e buscados sob demanda.
- Aberto e extensível: usuários podem carregar qualquer modelo ou criar um backend personalizado em qualquer linguagem contra uma interface aberta.
- Compatibilidade com API plug-and-play: APIs OpenAI, Anthropic e ElevenLabs são suportadas entre backends.
- Multimodalidade: geração de texto, texto-para-áudio, áudio-para-texto, geração de imagens, visão, detecção de objetos, reranking e embeddings por trás de uma única API.
- Suporte a hardware: NVIDIA (CUDA 12/13), AMD (ROCm), Intel (oneAPI/SYCL), Apple Silicon (Metal), Vulkan, NVIDIA Jetson (L4T) e apenas CPU.
- Recursos multiusuário: autenticação por chave de API, cotas de usuário e acesso baseado em papéis.
- Agentes integrados: agentes autônomos com uso de ferramentas, RAG, MCP e skills, além de um Agent Hub.
- Posicionamento focado em privacidade: os dados permanecem na infraestrutura do usuário.
As opções de instalação incluem um DMG para macOS (não assinado, exigindo remoção de atributo de quarentena) e imagens de contêiner para Docker ou podman, com variantes para CPU, NVIDIA CUDA 12/13, Jetson ARM64, AMD ROCm, Intel oneAPI e Vulkan. Modelos podem ser carregados a partir de uma galeria de modelos, Hugging Face, registro OCI Ollama, configurações YAML ou registros OCI padrão. Um agente de terminal está disponível para interagir com um servidor em execução, suportando comandos como /models e /model.
O projeto relata mais de 60 backends suportados e mantém vários motores nativos C/C++/GGML, incluindo vllm.cpp, parakeet.cpp, moss-transcribe.cpp, moss-tts.cpp, magpie-tts.cpp, ced.cpp, voice-detect.cpp, voxtral-tts.c, vibevoice.cpp, rf-detr.cpp, locate-anything.cpp, depth-anything.cpp, face-detect.cpp, free-splatter.cpp, trellis2.cpp, privacy-filter.cpp, LocalVQE e um repositório vetorial local. Também mantém o apex-quant, uma receita de quantização para modelos Mixture-of-Experts.
Funcionalidades adicionais listadas incluem gramáticas restritas, inferência P2P, modo distribuído com PostgreSQL e NATS, detecção de atividade de voz (Silero-VAD), WebUI integrada, fluxos de fine-tuning e quantização, suporte a WebRTC e uma Realtime API para fala-para-fala. O projeto é licenciado sob MIT, criado por Ettore Di Giacinto e mantido por uma pequena equipe com contribuições da comunidade.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.