BlogPage 3 / 31
Petri 2.0——AIエージェント行動監査の自動化設計
Petri 2.0は181件のシナリオでエージェントの逸脱行動を自動監査するAnthropic製OSSで、eval-awarenessを47.3%抑制します。導入設計を解説。
ant applyでエージェントをコードとして管理する
ant CLI 1.30.0(2026年9月3日公開)の`ant apply`は、エージェント・スキル・デプロイをファイルで宣言しclaude-lock.jsonで差分管理する機能です。CI組み込みの手順を解説します。
Sonnet 5.5のbetween_tools移行ガイド
Claude Sonnet 5.5はthinking無効化の代わりにbetween_toolsを新設。強制ツール使用廃止など5点の移行対応をエンタープライズ視点で解説する。
Claude Codeのheadless実行でCI/CDを自動化する
Claude Codeは`-p`フラグで非対話実行しexit codeでCI分岐できる。`--bare`モードと権限設定でパイプラインに安全に組み込む手順を解説する。
Claude Codeプラグイン配布を自社基盤で統制する
Claude Codeのプラグインは自社の`marketplace.json`で配布でき、managed settingsの`enabledPlugins`とallowlistで組織全体への強制適用も設計できる。構築手順を解説する。
評価ベンチマーク汚染時代のプライベートeval設計
自社のエージェント評価は公開ベンチマークの汚染にどう対処すべきか。SWE-Bench-Verifiedで問題文のみでも76%の精度が出た事例を基に、プライベートevalの設計指針を解説する。
Prefill/Decode分離で推論基盤を設計する
自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。
自律コーディングエージェントのハーネス設計——生成と評価を分離
長時間稼働する自律コーディングエージェントは、生成役と評価役を分離しコンテキストリセットで引き継ぐハーネス設計が有効です。Anthropicの実装は1セッション最大4時間に及びます。
Managed Agentsのauto権限を安全に設計する
Managed Agentsの権限ポリシーautoは、2026年9月10日にサーバー側評価を追加し、ツール呼び出しを許可・拒否・承認待ちの3種に振り分けます。設計と限界を解説します。
AGENTS.mdとは何か——複数ツールの指示を統一する標準
AGENTS.mdは2025年8月策定、Agentic AI Foundationが管理する仕様で、Claude Codeもv2.1.277で対応済みです。CLAUDE.mdとの優先順位・併用設定を解説します。
