Sobre o projeto

ODS (Osmantic Deployment System) é uma pilha de servidor de IA auto-hospedada voltada para quem deseja IA privada em seu próprio hardware sem montar manualmente uma dúzia de serviços. O repositório está atualmente em estado de Pré-lançamento V3: testes públicos e refinamento antes do lançamento oficial do V3, com um snapshot de código fixo (v3.0.0) oferecido para reprodutibilidade. O README afirma que a qualificação completa da frota está incompleta e aponta para notas de versão e um registro de promoção para limitações conhecidas e portões restantes. O que inclui ODS instala e conecta componentes que, de outra forma, seriam configurados separadamente. Peças documentadas incluem: - Inferência de modelo local via llama-server, com seleção de modelo baseada em hardware. - Open WebUI como interface de chat no navegador estilo ChatGPT. - Um painel de controle para modelos, serviços, configuração, status de GPU e extensões, além de uma API de painel. - LiteLLM como gateway de API suportando modos local, nuvem e híbrido. - Embeddings TEI para fluxos de trabalho de RAG e busca. - Voz: Whisper para fala-para-texto e Kokoro para texto-para-fala. - Agentes e automação: Portal (um assistente conversacional incluído em hosts macOS/Ubuntu/Debian systemd qualificados), Hermes Agent, o agente OpenClaw descontinuado, automação de fluxo de trabalho n8n, APE (Agent Policy Engine), OpenCode e Memory Shepherd. - Conhecimento e busca: banco de dados vetorial Qdrant, busca auto-hospedada SearXNG, Perplexica e integração opcional com a API Brave Search. - Criativo: ComfyUI para geração de imagens baseada em nós. - Privacidade e operações: proxy de limpeza de PII Privacy Shield, monitoramento de uso Token Spy e observabilidade opcional Langfuse. Instalação e plataformas A instalação é um único comando em Linux/macOS via script hospedado, e um bloco PowerShell no Windows que baixa o ZIP do código-fonte e executa o instalador do Windows. Docker deve estar instalado e em execução; Windows requer Docker Desktop com backend WSL2 e uma sessão PowerShell não-Administrador. Após a instalação, a interface web está em localhost:3000. Comandos de desinstalação são fornecidos por plataforma. Plataformas suportadas conforme o README: Linux (NVIDIA e AMD Strix Halo), Windows (NVIDIA e AMD) e macOS Apple Silicon. Linux com Intel Arc via SYCL é marcado como experimental/Nível C. Distribuições testadas incluem Ubuntu, Debian, Linux Mint, Fedora, Rocky Linux, Arch, Manjaro, CachyOS e openSUSE Tumbleweed. macOS requer Apple Silicon e executa llama-server nativamente com aceleração Metal, enquanto outros serviços rodam em Docker. Detecção de hardware e modelos O instalador detecta a GPU, atribui um nível de hardware e seleciona um modelo de um catálogo versionado (model-library.json) com base no envelope de memória. A escolha é gravada em .env como LLM_MODEL, GGUF_FILE, MAX_CONTEXT e variáveis MODEL_RECOMMENDATION_*. Perfis como MODEL_PROFILE=qwen, gemma4 ou auto influenciam a família escolhida, e a seleção de nível pode ser substituída no momento da instalação. O README lista exemplos de escolhas do catálogo para envelopes NVIDIA, AMD Strix Halo, Apple Silicon e Intel Arc, observando que instalações exatas podem diferir e que a taxa de transferência requer um benchmark local. Modo bootstrap Por padrão, ODS baixa primeiro um modelo pequeno de 1,5B para que os usuários possam conversar rapidamente, depois baixa o modelo completo em segundo plano e faz troca a quente para ele. O bootstrap pode ser ignorado com --no-bootstrap. Gerenciamento de modelos e CLI A CLI ods cobre status e verificações de saúde, listagem de serviços, logs, reinicializações, iniciar/parar, alternância entre modos local/nuvem/híbrido, trocas de nível de modelo, habilitação ou desabilitação de extensões, visualização de configuração mascarada e salvar ou carregar predefinições. A reversão de modelo é descrita como automática se um novo modelo falhar ao carregar. Extensibilidade Cada serviço é tratado como uma extensão: uma pasta contendo manifest.yaml e compose.yaml, descoberta automaticamente pelo painel, CLI, verificações de saúde e pilha compose. O instalador em si é descrito como modular, com módulos de biblioteca, um registro de serviços compartilhado e fases ordenadas. Posicionamento O README enquadra ODS como uma forma de evitar a montagem manual de Ollama/llama.cpp, Open WebUI, n8n e ferramentas de privacidade, comparando-se a esses projetos ao adicionar uma pilha de servidor circundante, instalador e plano de controle. Ele enfatiza operação local-first com modos opcionais de API em nuvem ou híbrida, e afirma que prompts e dados permanecem na máquina, a menos que o usuário escolha o contrário.