À propos du projet

AutoAgent, développé par Third Layer, est un framework open-source pour l'ingénierie autonome d'agents : au lieu de modifier manuellement le code d'un agent IA, vous laissez un méta-agent (votre agent de codage) construire et itérer sur l'agent, en suivant la même boucle expérimentale de conservation ou rejet popularisée par l'auto-recherche. Fonctionnement : - L'agent testé réside dans un seul fichier, agent.py, contenant la configuration, les définitions d'outils, un registre d'agents, le routage/orchestration, et une interface Harbor. La section d'interface est marquée comme fixe ; le reste est la surface d'édition principale du méta-agent. - L'humain n'édite pas le Python. Vous modifiez plutôt program.md, un fichier Markdown fournissant les instructions du méta-agent ainsi que la directive décrivant le type d'agent à construire. - Les tâches d'évaluation se trouvent dans tasks/ au format Harbor : task.toml de configuration, instruction.md de prompt, tests (test.sh/test.py, déterministes ou LLM-as-judge) qui écrivent un score de 0.0 à 1.0, un Dockerfile par tâche basé sur l'image de base, et des fichiers de référence montés. Le dépôt est livré sans tâches ; vous ajoutez les vôtres, et les charges utiles de benchmark peuvent apparaître dans des branches spécifiques. - La boucle : le méta-agent lit la directive, inspecte l'agent actuel, exécute le benchmark, diagnostique les échecs, modifie agent.py, vérifie le score total produit par les suites de tests, et conserve ou rejette la modification - en optimisant le score. Les expériences sont enregistrées dans results.tsv, et les sorties des tâches Harbor vont dans jobs/. Prérequis et utilisation : Docker, Python 3.10+, uv, et les identifiants du fournisseur de modèle nécessaires à votre agent (par exemple, OPENAI_API_KEY dans .env). Vous construisez l'image de base avec Dockerfile.base, ajoutez des tâches, puis exécutez une seule tâche ou toutes les tâches en parallèle via l'interface Harbor avec le chemin d'import agent:AutoAgent. Pour lancer une expérience, vous pointez votre agent de codage vers le dépôt et lui demandez de lire program.md. Choix de conception énoncés dans le README : programmer le méta-agent plutôt que l'agent directement ; garder l'agent en un seul fichier mais piloté par registre pour qu'il puisse évoluer proprement ; exécuter l'agent dans un conteneur Docker pour qu'il ne puisse pas endommager l'hôte ; rendre chaque expérience pilotée par le score ; et utiliser des tâches compatibles Harbor pour que le même agent puisse être évalué sur différents ensembles de données. Le README suggère également d'équiper l'agent de compétences en ingénierie de contexte (comme Agent Skills for Context Engineering et context7) pour améliorer les performances, et fournit des commandes de nettoyage pour les images Docker, les conteneurs et le cache de tâches Harbor, qui s'accumulent au fil des exécutions. Sous licence MIT. Les mainteneurs notent un produit à venir autour des agents auto-configurables et qu'ils recrutent.