このプロジェクトについて

SkillOptは、自然言語のスキル文書を、それ以外は凍結されたLLMエージェントの学習可能な状態として扱います。別のオプティマイザモデルが、スコア付けされたエージェントの軌跡をレビューし、単一のMarkdownスキルファイルに対する追加、削除、置換の限定された編集を提案します。デフォルトの論文スタイルのワークフローでは、候補はホールドアウト検証スコアを改善する場合にのみ受け入れられます。このフレームワークは、テキスト形式の学習率バジェット、拒否された編集のバッファ、および改訂をより安定させることを目的としたエポックレベルのスローまたはメタ更新も提供します。 出力は、再利用可能なbest_skill.mdアーティファクトであり、通常はコンパクトであると説明され、変更されていないターゲットモデルと共に、追加の推論時のオプティマイザ呼び出しなしでデプロイできます。学習ループは、ロールアウト、リフレクション、集約、選択、更新、評価をカバーします。 このパッケージは、OpenAI、Azure、Claude、Qwen、MiniMax、OpenAI互換サービス、Codex、Claude Code、Copilot、Cursorターゲットを含む複数のチャットおよび実行バックエンドをサポートしています。6つの組み込みベンチマークを含み、新しいバックエンドとベンチマーク環境を追加するためのアダプタパターンを定義しています。オプションのWebUIは監視ダッシュボードを提供し、主要なツールはPythonとCLIを通じて利用できます。 バージョン0.2.0では、SkillOpt-Sleepが導入されました。これは、過去のセッションを収集し、繰り返し発生するタスクをマイニングし、それらを再生し、ホールドアウトゲートの背後で検証済みスキルを統合する、夜間のオフライン自己進化フローです。リポジトリには、Claude Code、Codex、Copilot、Devin用の統合シェルと、OpenClawリファレンス適応も含まれています。これらの統合ファイルの一部はPyPIホイールの外部にあります。SkillOptはPython 3.10以降を必要とし、PyPIからインストールされます。ドキュメントでは、セットアップ、データ準備、学習と評価のコマンド、設定、バックエンド契約、ベンチマークアダプタ、フレームワーク内部について説明しています。