約 3 分で読めます

自律コーディングエージェントのハーネス設計——生成と評価を分離

数時間動かし続けた自律コーディングエージェントが、序盤に決めた実装方針を見失って崩れていく——コンテキストウィンドウが有限である以上、この問題は避けられません。Anthropicが長時間の自律アプリケーション開発で採った答えは、要約による延命ではなく「役割分離」と「コンテキストリセット」でした。ハーネスを設計する際の具体的な判断材料を整理します。

自律コーディングエージェントはなぜコンテキストで詰まるのか

長時間の自律実行は必ずコンテキストウィンドウの限界に突き当たり、単純な要約では状態を保てません。

単一のエージェントに計画・実装・評価をすべて担わせると、セッションが進むほど過去の判断根拠や試行錯誤の履歴がコンテキストを圧迫します。要約で圧縮する方法もありますが、要約には情報の欠落が伴い、後段で「なぜこの設計にしたか」を再現できなくなるリスクがあります。エージェントハーネス全体の設計原則はエージェントハーネスとは何かで扱っていますが、本記事は多時間の自律コーディングというワークロードに絞って掘り下げます。

プランナー・ジェネレーター・エバリュエーターはどう役割分担するか

計画・実装・評価を専任の3エージェントへ分離すると、各エージェントは軽量な文脈のまま動作を続けられます。

Anthropicの実装は3種のエージェントで構成されます。プランナーは短い要求を製品仕様へ展開し、実装の細部ではなくスコープと全体設計を担当します。ジェネレーターはReact・Vite・FastAPI・SQLite/PostgreSQLのスタックで機能を段階的に実装します。エバリュエーターはPlaywright MCPでライブページを直接操作し、成功基準に照らして機能を検証します。役割分離はサブエージェント・オーケストレーションの設計パターンで解説したプランナー/エグゼキューター分離の応用形ですが、ここではエバリュエーターが独立した第三者として品質を採点する点が異なります。

コンテキストリセットとスプリント契約はどう設計するか

ジェネレーターとエバリュエーターは実装前に成果物と成功基準を「スプリント契約」として明文化します。

Anthropicは要約の代わりに、セッション間で文脈を完全にリセットする設計を選びました。リセットは次のエージェントが作業を引き継げるだけの状態を持つ「ハンドオフ成果物」があって初めて成立します。Opus 4.5世代では、モデルが早期に作業を切り上げようとする「文脈不安」への対処として明示的なリセットが必須でした。Opus 4.6では自動コンパクションにより単一セッションでの継続動作が可能になっていますが、複数エージェントに責任を分けるハーネス自体の有効性は変わりません。コンテキスト管理の基本設計はClaude公式ドキュメントのContext windowsを合わせて確認してください。

エバリュエーターの採点基準と運用コストをどう設計するか

採点は4基準×5〜15回の反復で行われ、フル稼働では数時間・数百ドル規模のコストが発生します。

エバリュエーターはデザイン品質・独自性・仕上がりの精度・機能性の4基準で採点し、1回の生成につき5〜15回の反復、最大4時間の実行を許容します。実測値として、あるゲーム制作タスクは単独実行20分・9ドルに対し、フルハーネス実行は6時間・200ドルでした。別のDAW(音楽制作ツール)の生成でも3時間50分・124.70ドルを要しています。品質と引き換えにコストと時間を大きく消費するため、事業価値に直結する案件に絞って適用し、コスト上限とタイムアウトを設計に組み込むことが要点です。ハーネス設計の実装支援はエージェント運用(AI Ops)でも提供しています。

規模別の留意点(SMB / エンタープライズ)

中小企業がこのパターンを試す場合は、反復回数を2〜3回・採点基準を1〜2項目に絞った小規模検証から始め、予算上限を先に設定します。エンタープライズで複数チームが使う場合は、実行コストをプロジェクト単位で計装・配賦し、数百ドル規模の実行には承認ゲートを設けるなど既存の評価・可観測性基盤に統合します。大規模な実装支援はRDE(Reinvention Deployed Engineering)の対象領域です。

参考

まとめ

長時間の自律コーディングエージェントを安定させる鍵は、要約による延命ではなく役割分離とコンテキストリセットです。プランナー・ジェネレーター・エバリュエーターへの分割、スプリント契約による引き継ぎ、4基準での採点という3つの設計要素を押さえれば、数時間規模の自律実行でも一貫した品質を保てます。ただしコストは軽視できず、適用対象の見極めが不可欠です。自社のハーネス設計・評価基盤の構築はKuuまでお問い合わせください。

関連記事

Claude Fable 5.1のappend-only会話設計AIエージェントのループ実行制御——実行予算・最大反復数の設計AIエージェント耐久実行設計——Temporal・Restate活用パターンマルチエージェント移行設計——シングルから3フェーズで進める