这个项目能做什么

AutoAgent 来自 Third Layer,是一个用于自主框架工程的开源框架:与其手动编辑 AI 代理的代码,不如让元代理(你的编码代理)构建并迭代代理框架,遵循由 autoresearch 推广的保留或丢弃实验循环。 工作原理: - 待测试的框架位于单个文件 agent.py 中,包含配置、工具定义、代理注册表、路由/编排以及 Harbor 适配器边界。适配器部分被明确标记为固定;其余部分是元代理的主要编辑区域。 - 人类不编辑 Python 代码。而是编辑 program.md,这是一个 Markdown 文件,提供元代理的指令以及描述要构建何种代理的指示。 - 评估任务位于 tasks/ 中,使用 Harbor 任务格式:task.toml 配置、instruction.md 提示、测试(test.sh/test.py,确定性或 LLM 作为评判者)写入 0.0-1.0 分数、基于基础镜像的每个任务 Dockerfile 以及挂载的参考文件。仓库不附带任务;你需要添加自己的任务,基准测试负载可能出现在特定基准测试分支中。 - 循环:元代理读取指示,检查当前框架,运行基准测试,诊断失败,修改 agent.py,检查任务测试套件产生的总分,并保留或丢弃更改——在分数上进行爬山优化。实验记录到 results.tsv,Harbor 作业输出到 jobs/。 要求和使用:Docker、Python 3.10+、uv 以及你的框架所需的任何模型提供商凭据(例如 .env 中的 OPENAI_API_KEY)。使用 Dockerfile.base 构建基础镜像,添加任务,然后通过 harbor CLI 使用代理导入路径 agent:AutoAgent 运行单个任务或并行运行所有任务。要启动实验,将你的编码代理指向仓库并提示它读取 program.md。 README 中陈述的设计选择:对元代理进行编程而不是直接对框架编程;保持框架为单文件但由注册表驱动,以便仍能干净地演进;在 Docker 隔离中运行代理以防止损坏主机;使每个实验由分数驱动;并使用 Harbor 兼容任务,以便同一框架可以在不同数据集上评估。 README 还建议为代理配备上下文工程技能(例如 Agent Skills for Context Engineering 和 context7)以提高性能,并提供清理 Docker 镜像、容器和 Harbor 任务缓存的命令,这些会随运行累积。采用 MIT 许可。维护者提到即将推出关于自配置代理的产品,并且他们正在招聘。