À propos du projet
aiHelpDesk est une couche de responsabilité pour les équipes utilisant des agents IA sur des bases de données de production. Il diagnostique les incidents, propose des remédiations et exécute des correctifs sur des VM, du bare metal, des conteneurs Docker/Podman ou des clusters Kubernetes. Chaque action ayant des conséquences est approuvée, auditée et certifiée comme cohérente.
Capacités principales :
Tests d'injection de pannes — injecter 32 modes de défaillance connus (SQL-only, SSH, K8s) contre une base de données de staging pour évaluer le diagnostic de l'agent et vérifier la récupération après remédiation. L'outil faulttest fonctionne sans accès au cluster.
Opérations de flotte — coordonner les changements sur plusieurs bases de données avec des phases canari, des portes d'approbation, la détection de dérive de schéma et des pistes d'audit complètes. Un Planner en langage naturel convertit les demandes en texte libre en plans de flotte.
Playbooks — runbooks enregistrés combinant l'intention et les conseils d'experts. Les playbooks système sont fournis avec l'outil ; les playbooks personnalisés sont rédigés, importés ou générés automatiquement à partir des traces d'incident.
Gouvernance de l'IA — cadre à huit modules comprenant des journaux d'audit infalsifiables, l'application du rayon d'impact, des garde-fous hors heures ouvrées et l'évaluation des politiques en temps réel. L'approbation humaine est requise avant toute action destructrice.
Diagnostic d'incident — l'agent d'incident collecte les données de base de données, K8s, OS et de couche de stockage dans un ensemble de support horodaté. Lors de la résolution, il synthétise automatiquement un brouillon de playbook à partir de la trace d'audit.
Mémoire institutionnelle : Chaque incident résolu propose un brouillon de playbook ; chaque faulttest réussi sauvegarde automatiquement un brouillon. Les opérateurs humains les examinent et les activent. Les requêtes en texte libre sont mises en correspondance avec des symptômes encodés et routées automatiquement.
Certification de stabilité : Avant qu'un playbook n'entre en rotation en production, il est certifié selon trois dimensions : résultat (a-t-il réussi ?), conclusion (l'agent a-t-il atteint le même diagnostic à chaque exécution ?) et évaluation (le juge était-il d'accord avec lui-même ?). Des certificats comme STABLE(7) attr=oom-kill (7/7) fournissent une preuve auditable d'un raisonnement cohérent et correct.
Architecture : Construit sur Google ADK pour Go. Les agents experts (Database, Kubernetes, Sysadmin, Incident, Orchestrator) sont interchangeables ou extensibles via le protocole A2A. Le système est agnostique du modèle et testé avec les modèles Anthropic et Gemini.
Options de déploiement : Docker/Podman, installation directe sur l'hôte ou Kubernetes via Helm. Des binaires sont disponibles pour Linux x86-64, ARM (Graviton, Ampere) et macOS (Intel et Apple Silicon).
Agents en amont : Les agents aiHelpDesk peuvent être appelés par des humains via l'Orchestrator ou par des agents et programmes en amont via le protocole A2A et l'API REST Gateway. Les bots compagnons incluent SREBot (observateur d'observabilité), SecBot (répondeur de sécurité) et GovBot (rapporteur de conformité).
Comments
0 Rating appears after 10 ratings
Sign in to join the discussion.