Sobre o projeto
ODS (Osmantic Deployment System) é uma pilha de servidor de IA auto-hospedada voltada para quem deseja IA privada em seu próprio hardware sem montar manualmente uma dúzia de serviços. O repositório está atualmente em estado de Pré-lançamento V3: testes públicos e refinamento antes do lançamento oficial do V3, com um snapshot de código fixo (v3.0.0) oferecido para reprodutibilidade. O README afirma que a qualificação completa da frota está incompleta e aponta para notas de versão e um registro de promoção para limitações conhecidas e portões restantes.
O que inclui
ODS instala e conecta componentes que, de outra forma, seriam configurados separadamente. Peças documentadas incluem:
- Inferência de modelo local via llama-server, com seleção de modelo baseada em hardware.
- Open WebUI como interface de chat no navegador estilo ChatGPT.
- Um painel de controle para modelos, serviços, configuração, status de GPU e extensões, além de uma API de painel.
- LiteLLM como gateway de API suportando modos local, nuvem e híbrido.
- Embeddings TEI para fluxos de trabalho de RAG e busca.
- Voz: Whisper para fala-para-texto e Kokoro para texto-para-fala.
- Agentes e automação: Portal (um assistente conversacional incluído em hosts macOS/Ubuntu/Debian systemd qualificados), Hermes Agent, o agente OpenClaw descontinuado, automação de fluxo de trabalho n8n, APE (Agent Policy Engine), OpenCode e Memory Shepherd.
- Conhecimento e busca: banco de dados vetorial Qdrant, busca auto-hospedada SearXNG, Perplexica e integração opcional com a API Brave Search.
- Criativo: ComfyUI para geração de imagens baseada em nós.
- Privacidade e operações: proxy de limpeza de PII Privacy Shield, monitoramento de uso Token Spy e observabilidade opcional Langfuse.
Instalação e plataformas
A instalação é um único comando em Linux/macOS via script hospedado, e um bloco PowerShell no Windows que baixa o ZIP do código-fonte e executa o instalador do Windows. Docker deve estar instalado e em execução; Windows requer Docker Desktop com backend WSL2 e uma sessão PowerShell não-Administrador. Após a instalação, a interface web está em localhost:3000. Comandos de desinstalação são fornecidos por plataforma.
Plataformas suportadas conforme o README: Linux (NVIDIA e AMD Strix Halo), Windows (NVIDIA e AMD) e macOS Apple Silicon. Linux com Intel Arc via SYCL é marcado como experimental/Nível C. Distribuições testadas incluem Ubuntu, Debian, Linux Mint, Fedora, Rocky Linux, Arch, Manjaro, CachyOS e openSUSE Tumbleweed. macOS requer Apple Silicon e executa llama-server nativamente com aceleração Metal, enquanto outros serviços rodam em Docker.
Detecção de hardware e modelos
O instalador detecta a GPU, atribui um nível de hardware e seleciona um modelo de um catálogo versionado (model-library.json) com base no envelope de memória. A escolha é gravada em .env como LLM_MODEL, GGUF_FILE, MAX_CONTEXT e variáveis MODEL_RECOMMENDATION_*. Perfis como MODEL_PROFILE=qwen, gemma4 ou auto influenciam a família escolhida, e a seleção de nível pode ser substituída no momento da instalação. O README lista exemplos de escolhas do catálogo para envelopes NVIDIA, AMD Strix Halo, Apple Silicon e Intel Arc, observando que instalações exatas podem diferir e que a taxa de transferência requer um benchmark local.
Modo bootstrap
Por padrão, ODS baixa primeiro um modelo pequeno de 1,5B para que os usuários possam conversar rapidamente, depois baixa o modelo completo em segundo plano e faz troca a quente para ele. O bootstrap pode ser ignorado com --no-bootstrap.
Gerenciamento de modelos e CLI
A CLI ods cobre status e verificações de saúde, listagem de serviços, logs, reinicializações, iniciar/parar, alternância entre modos local/nuvem/híbrido, trocas de nível de modelo, habilitação ou desabilitação de extensões, visualização de configuração mascarada e salvar ou carregar predefinições. A reversão de modelo é descrita como automática se um novo modelo falhar ao carregar.
Extensibilidade
Cada serviço é tratado como uma extensão: uma pasta contendo manifest.yaml e compose.yaml, descoberta automaticamente pelo painel, CLI, verificações de saúde e pilha compose. O instalador em si é descrito como modular, com módulos de biblioteca, um registro de serviços compartilhado e fases ordenadas.
Posicionamento
O README enquadra ODS como uma forma de evitar a montagem manual de Ollama/llama.cpp, Open WebUI, n8n e ferramentas de privacidade, comparando-se a esses projetos ao adicionar uma pilha de servidor circundante, instalador e plano de controle. Ele enfatiza operação local-first com modos opcionais de API em nuvem ou híbrida, e afirma que prompts e dados permanecem na máquina, a menos que o usuário escolha o contrário.
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.