このプロジェクトについて

# PilotDeck · サブタスク検収と局所修復 これは [OpenBMB/PilotDeck](https://github.com/OpenBMB/PilotDeck) をベースにした改良プロジェクト(方向三の参赛プロジェクト)であり、AIエージェントのサブタスクの納品品質を高めることを目的としています。`agent.acceptance` モジュールを導入することで、サブタスクの「完了」状態に構造チェックと独立モデルによる再確認機構を追加します。 ## コア機能 - **納品を検査可能**:まずホストルールによる構造事前チェックを行い、その後、独立した読み取り専用モデルが元のタスク、納品宣言、実際のファイル内容を照合します。 - **修復に境界あり**:検収が失敗した場合、システムは同一サブタスク、セッション、権限範囲内で局所修復を実行し、総ラウンド上限を共有します。使い切った場合は明確に拒否し、合格済みの兄弟タスクは保持されます。 - **経験を審査可能**:成功および拒否された検収メタデータをネイティブのホワイトボックス記憶に書き込み、実際のモデルと契約ごとにグループ化し、サンプル分母を保持しますが、検収基準を自動的に変更することはありません。 - **プロセスを照合可能**:ネイティブのサブタスクカードに検収と修復の状態を表示します。問題の説明、修復回数、ツール軌跡、成果物を含みます。 ## インストールと起動 Node.js **22.13–22.x** と pnpm **10.32.1** が必要です。 ```bash corepack enable pnpm install --frozen-lockfile npm run build ``` 通常の起動は引き続き `npm run dev` です。ネイティブ設定で **Agent → 納品レビュー** を有効にすると第二層の再確認を開始でき、モデルを個別に選択し、レビューラウンドとタイムアウトを調整できます。 ### 隔離現場デモ OpenAI互換のツール呼び出しモデルをサポートします。ローカル環境変数でデモパラメータを設定します: ```bash node --import tsx scripts/verified-subtasks-native.ts ui --semantic-fault --acceptance-memory ``` 智譜 Coding Plan の認証情報も使用できます: ```bash node --import tsx scripts/verified-subtasks-native.ts ui # またはローカルの OpenCode 認証情報を再利用 node --import tsx scripts/verified-subtasks-native.ts ui --opencode-auth ``` ### 直接検収モード インターフェースを起動せず、同一のネイティブゲートウェイチェーンを直接検収します: ```bash node --import tsx scripts/verified-subtasks-native.ts live --opencode-auth ``` ### 決定論的機構検証 モデル認証情報が不要なベンチマークテスト: ```bash node --import tsx scripts/verified-subtasks-benchmark.ts artifacts/verified-benchmark ``` ## 技術実装 | モジュール | 改良 | |---|---| | `src/agent/sub/acceptance/` | 有限 schema 事前チェック、成果物チェック、問題正規化、ホストチェッカー登録 | | `SubAgentSession` / `AgentLoop` | 同一セッション修復、総ラウンド予算、中断とエラー伝播、累積使用量 | | `agent` / `ToolRuntime` | 契約透過、構造化検収結果、拒否を実際のツール失敗として扱う | | ゲートウェイとネイティブ UI ブリッジ | ホストルール読み込み、レビューモデル設定、検収と修復状態、最終判定の保持 | | `AcceptanceMemory.ts` | 終態メタデータブリッジ、重複排除、分母統計、ネイティブフィードバック項目、クリアと Dream ファイル整理の互換性 | | `modelReviewer.ts` | 独立した読み取り専用セッション、実際の読み取り証拠、モデル継承と上書き、レビュー結果と使用量 | 有効化は明示的です:`acceptance` パラメータがない場合は元の動作を保持します。ホストは業務チェッカーを登録でき、モデルは名前を参照することしかできません。ネイティブ起動は `PILOTDECK_ACCEPTANCE_CONFIG` を通じて承認された JSON 成果物ルールを読み込みます。 ## 検収経験記憶 ネイティブ設定 **Agent → 記憶** でホワイトボックス記憶を有効にした後、**Agent → 納品レビュー → 検収経験をプロジェクト記憶に保存** で記録を制御できます。設定項目は `memory.captureAcceptance` で、省略時は記憶が有効なプロジェクト内でデフォルトで記録されます。`false` に設定すると無効化できます。 オブザーバーは実際の検収終態のメタデータを記録し、タスク本文、納品内容、自由テキストの評語は保存しません。最近128件の重複排除された観察がプロジェクト SQLite に保存され、ネイティブフィードバック Markdown は派生サマリーです。記録自体はモデル呼び出しを増やしませんが、ネイティブ検索と Dream は依然としてモデルを呼び出す可能性があります。 ## 証拠と境界 本プロジェクトは自然なエラー率の統計ではなく、明確な障害注入検証証拠を提供します。例えば、GLM-5.3 ネイティブ実走では、4/4 の納品が合格し、1回のモデル拒否が局所修復をトリガーし、3件の成功レポートのハッシュと変更時刻は不変でした。バッチ全体の再実行と比較して、局所修復戦略はリクエスト量を40%削減しました。 **注意**:このシステムはグローバルロールバック、外部副作用のちょうど一度の実行、共有ファイル競合の調整、プロセス間復旧を提供しません。業務の信頼性はホストルールとレビュー品質に依存します。モデル再確認は依然として誤判定する可能性があります。ファイル納品が独立して正常に読み取られない場合、レビューアーは受け取りません。 主要なテストコマンド: ```bash node --import tsx --test tests/agent/sub/acceptance/*.spec.ts tests/agent/sub/VerifiedSubagent.spec.ts tests/agent/sub/AcceptanceInvariants.spec.ts tests/agent/sub/ModelReview.spec.ts tests/pilot/config/acceptanceReview.spec.ts tests/tool/VerifiedAgent.spec.ts tests/gateway/VerifiedSubtaskEvents.spec.ts ``` 詳細は [現場デモ説明](docs/verified-subtasks/DEMO.zh-CN.md)、[検証記録](docs/verified-subtasks/VALIDATION.zh-CN.md)、[技術詳細](docs/verified-subtasks/README.zh-CN.md) を参照してください。