Sobre el proyecto

Ongrid es un agente de IA centrado en operaciones que pretende comprender la infraestructura, localizar causas raíz y actuar sobre ellas desde canales de chat como Slack, Telegram, Larksuite, DingTalk y WeCom. Se posiciona como una plataforma autoalojada que combina observabilidad, topología e investigación impulsada por agentes. Capacidades clave descritas en el README: - Agente coordinador más agentes especialistas: un coordinador distribuye el trabajo a subagentes de SRE, red y bases de datos. - Autoinvestigación impulsada por alertas: un investigador genera un trabajador de RCA y escribe los hallazgos de vuelta en el chat. - Análisis de causa raíz: recorre la topología, correlaciona métricas, logs y trazas, y vincula la causa con una línea de código fuente. - Cero puertos entrantes: los componentes de borde marcan hacia fuera, evitando puertos SSH/HTTP/HTTPS expuestos en los hosts. - SSH en navegador: acceso shell mediante túnel inverso a los hosts con auditoría, sin claves ni jumpbox. - Autoalojamiento con un solo comando mediante install.sh para todo el stack. - Stack de observabilidad integrado con Prometheus, Loki, Tempo y Grafana; el agente puede escribir consultas. - Soporte de modelo propio con enrutamiento en caliente entre Anthropic, OpenAI, GLM, DeepSeek, Gemini y Kimi. - Canales de mensajería bidireccionales con soporte de idioma por canal. - Herramientas de host de solo lectura: un sandbox de bash más de 26 herramientas de inspección, con cada llamada auditada. - Gestión del ciclo de vida de Kubernetes: inscribir clústeres, inspeccionar cargas de trabajo y eventos, gestionar actualizaciones y reflejar recursos de Kubernetes en la topología. - Gestión de dispositivos de red: descubrir vecinos desde hosts de borde, verificar con SNMP, sondear interfaces y mapear enlaces entre hosts y dispositivos de red. La instalación está documentada para Linux amd64 y arm64 mediante tarballs de release e install.sh, orientada a Ubuntu 22.04+, Debian 12+ y RHEL/Rocky 9, con una opción de espejo CDN para China continental. El recorrido del producto destaca informes de análisis de causa raíz, un constructor de flujos de trabajo, un catálogo de habilidades, el registro de servidores MCP, una bóveda de conocimiento para runbooks y repositorios, un centro de artefactos, vistas de monitorización, un mapa de topología y una puerta de aprobación/escritura para acciones de riesgo. La documentación está alojada en ongrid.cloud y cubre primeros pasos, instalación y operación, capacidades, agentes y material de referencia. Las integraciones abarcan herramientas de observabilidad (Prometheus, Grafana, Loki, Tempo, OpenTelemetry, Qdrant), canales de chat y proveedores de modelos. El proyecto está licenciado bajo AGPLv3, con activos de marca bajo una política de marcas separada.