このプロジェクトについて

AutoAgentは、Third Layerによるオープンソースの自律ハーネスエンジニアリングフレームワークです。AIエージェントのコードを手動で編集する代わりに、メタエージェント(あなたのコーディングエージェント)がエージェントハーネスを構築し反復処理を行います。これは、autoresearchで普及した保持または破棄の実験ループに従います。 仕組み: - テスト対象のハーネスは、単一ファイルagent.pyに存在します。これには、設定、ツール定義、エージェントレジストリ、ルーティング/オーケストレーション、およびHarborアダプター境界が含まれます。アダプターセクションは固定として明示的にマークされており、残りはメタエージェントの主要な編集領域です。 - 人間はPythonを編集しません。代わりに、メタエージェントの指示と、構築するエージェントの種類を説明するディレクティブを提供するMarkdownファイルprogram.mdを編集します。 - 評価タスクは、Harborタスク形式を使用してtasks/に存在します:task.toml設定、instruction.mdプロンプト、0.0〜1.0のスコアを書き込むテスト(test.sh/test.py、決定論的またはLLM-as-judge)、ベースイメージに基づくタスクごとのDockerfile、およびマウントされた参照ファイル。リポジトリにはタスクは付属しておらず、自分で追加します。ベンチマークペイロードは、ベンチマーク固有のブランチに表示される場合があります。 - ループ:メタエージェントはディレクティブを読み取り、現在のハーネスを検査し、ベンチマークを実行し、障害を診断し、agent.pyを変更し、タスクテストスイートによって生成された合計スコアを確認し、変更を保持または破棄します。これはスコアの山登り法です。実験はresults.tsvに記録され、Harborジョブ出力はjobs/に送られます。 要件と使用法:Docker、Python 3.10+、uv、およびハーネスが必要とするモデルプロバイダーの認証情報(例:.env内のOPENAI_API_KEY)。Dockerfile.baseでベースイメージを構築し、タスクを追加してから、エージェントのインポートパスagent:AutoAgentを使用して、harbor CLIを介して単一のタスクまたはすべてのタスクを並行して実行します。実験を開始するには、コーディングエージェントをリポジトリに向け、program.mdを読み取るように促します。 READMEに記載されている設計上の選択:ハーネスを直接プログラムするのではなく、メタエージェントをプログラムする。ハーネスを単一ファイルのままにするが、レジストリ駆動型にして、それでもクリーンに進化できるようにする。エージェントをDocker分離環境で実行し、ホストに損害を与えないようにする。すべての実験をスコア駆動型にする。Harbor互換のタスクを使用して、同じハーネスを異なるデータセットで評価できるようにする。 READMEはまた、エージェントにコンテキストエンジニアリングスキル(Agent Skills for Context Engineeringやcontext7など)を装備してパフォーマンスを向上させることを提案し、実行ごとに蓄積されるDockerイメージ、コンテナ、およびHarborのタスクキャッシュのクリーンアップコマンドを提供しています。MITライセンスの下で提供されています。メンテナーは、自己設定エージェントに関する今後の製品と、採用中であることを述べています。