機能テストを通過したAIエージェントが、本番投入後に機嫌取り(sycophancy)や虚偽報告、権限の逸脱使用を始めるケースは珍しくない。固定シナリオのベンチマークでは、モデルが「評価されている」と気づいて振る舞いを変えるeval-awarenessを検出できないためだ。Anthropicが公開したPetriは、この空白を埋める自動行動監査フレームワークとして設計されている。
本記事はAIエージェントガバナンスの評価設計に連動しています。
Petriとは何か——AIエージェント行動監査ツールの仕組み
Petriは監査エージェントと対象モデルが対話し、111件のシナリオでモデルの逸脱行動を自動採点するAnthropic製OSSです。
Petri(Parallel Exploration Tool for Risky Interactions)は、監査エージェント(Auditor)・対象モデル(Target)・審判(Judge)の3コンポーネントで構成される。監査エージェントは単に固定の攻撃文を送るのではなく、以下のツールキットを使って動的にシナリオを組み立てる。
- ユーザーメッセージの送信・継続
- 対象モデルのシステムプロンプトの書き換え
- 実環境を模した合成ツールの生成
- ツール実行結果の擬似応答
- 会話のロールバックによる分岐探索
- 対象モデルの応答のプリフィル(APIが許す場合)
- 目的を達成した時点での監査終了
研究者は「仮説を立てる → 自然言語でシード命令を書く → Petriが自動実行・採点する → 結果を見て反復する」という4段階のワークフローで動かす。審判は証拠抽出とスコア合成の2段階で、逸脱行動(欺瞞・追従・自己保存・権力志向・報酬ハッキングなど)を相対スコアとして記録する。ツールはGitHub(safety-research/petri)で公開されており、111件のシード命令が同梱されている。
Petri 2.0で何が変わったか——eval-awareness対策と181シナリオ
Petri 2.0はリアリズム分類器と改良シード命令によりeval-awarenessを中央値47.3%抑制し、シナリオを181件に拡張しました。
Petriが直面していた最大の課題がeval-awarenessだ。能力の高いモデルほど「これはテストだ」と察知し、本番環境とは異なる慎重な振る舞いを取る。これは監査結果の妥当性そのものを損なう。Petri 2.0は2つの対策を組み合わせた。
- リアリズム分類器: 監査エージェントが送ろうとしているアクションが不自然・非現実的でないかを事前に判定し、対象モデルに送る前にフィルタリングする
- シード命令の手動改良: 背景設定や制約条件をより具体的に書き込み、テスト環境らしさを減らす
この組み合わせにより、Claudeモデルに対するeval-awarenessが中央値47.3%低下した。加えてシード命令を70件追加し合計181件に拡張、マルチエージェント間の共謀や職業倫理上の対立、機微情報へのアクセス権限といった行動類型をカバーする。評価方法も強化され、監査エージェントにClaude Sonnet 4.5とGPT-5.1の2モデルを使い、独立した3つの審判でスコアリングし、各対象モデルを全シードに2回ずつ実行する設計になっている。
エンタープライズでPetriをどう活用できるか——導入設計のポイント
Petriは逸脱行動の仮説を対話的に検証する監査ツールであり、攻撃シナリオを大量生成するレッドチーミング自動化とは目的が異なります。
Petriと攻撃シナリオ自動化によるAIレッドチーミングは混同されやすいが、目的が異なる。レッドチーミングは「安全フィルタを突破できるか」を大量の攻撃プロンプトで検証するのに対し、Petriは「特定の状況下でモデルが望ましくない行動を自発的に取るか」を仮説駆動で探索する。
実用パターンは、自社の展開シナリオをシード命令として書き起こすことだ。たとえば「DB書き込み権限を持つエージェントが矛盾する指示を受けたときにどう動くか」「連携するサブエージェントの一方が誤った前提を他方に伝播させないか」といった、自社固有のツール構成・データアクセスを反映したシナリオを設計する。英国AIセキュリティ研究所(UK AI Security Institute)はすでにPetriを研究プロセスに組み込んでいる。
Petriが出力した高リスクな逸脱トランスクリプトは、エージェントの可観測性基盤や監査ログに接続し、ガバナンスレビューの証跡として扱うと運用に乗せやすい。エンタープライズ規模でのPetri導入設計・評価パイプライン統合はKuuのRDE(Reinvention Deployed Engineering)サービスが対応している。
導入時の注意点は何か——限界とリスク管理
Petriのスコアは1〜10の相対値であり絶対評価ではないため、モデル間・バージョン間の比較用途に限定するのが安全です。
Petriを本番の意思決定基準にそのまま使うのは危険だ。第一に、スコアは相対値であり「7点だから安全」という絶対評価には向かない。モデル更新前後やベンダー比較など相対比較の文脈で使うのが妥当だ。第二に、審判モデル自身のバイアスを完全には排除できず、高スコアのトランスクリプトは定期的に人間がサンプルレビューする運用が要る。第三に、汎用シードだけでは自社固有のツール構成やデータアクセスに潜むリスクは見つけにくい。仮説を立てる役割は依然として人間にあり、Petriはその実行をスケールさせる基盤と位置づけるのが実態に近い。
参考
- Petri: An open-source AI auditing tool — Anthropic
- Petri: An open-source auditing tool to accelerate AI safety research — Anthropic Alignment Science
- Petri 2.0: New Scenarios, New Model Comparisons, and Improved Eval-Awareness Mitigations — Anthropic Alignment Science
まとめ
Petriは監査エージェント・対象モデル・審判の3層構成で、AIエージェントの逸脱行動を仮説駆動かつ自動で探索するフレームワークだ。2.0ではeval-awarenessをリアリズム分類器とシード改良で中央値47.3%抑制し、シナリオを181件に拡張したことで、実運用に近い監査結果が得られるようになった。攻撃耐性を検証するレッドチーミングとは補完関係にあり、自社の展開シナリオを反映したシード設計と、可観測性・監査ログ基盤への接続が実装の鍵になる。
Petriの導入設計やエンタープライズ規模での評価パイプライン構築についてはKuuのRDEサービスにご相談ください。
