BlogPage 3 / 31

· Kuu株式会社 エンジニアリング · 約4分

Petri 2.0——AIエージェント行動監査の自動化設計

Petri 2.0は181件のシナリオでエージェントの逸脱行動を自動監査するAnthropic製OSSで、eval-awarenessを47.3%抑制します。導入設計を解説。

エージェント評価AI安全性評価設計エージェントガバナンス
· Kuu株式会社 エンジニアリング · 約4分

ant applyでエージェントをコードとして管理する

ant CLI 1.30.0(2026年9月3日公開)の`ant apply`は、エージェント・スキル・デプロイをファイルで宣言しclaude-lock.jsonで差分管理する機能です。CI組み込みの手順を解説します。

Managed Agentsプラットフォーム設計CI/CDエージェント基盤
· Kuu株式会社 エンジニアリング · 約5分

Sonnet 5.5のbetween_tools移行ガイド

Claude Sonnet 5.5はthinking無効化の代わりにbetween_toolsを新設。強制ツール使用廃止など5点の移行対応をエンタープライズ視点で解説する。

Claude Sonnet 5.5Claude APIエンタープライズモデル選定
· Kuu株式会社 エンジニアリング · 約4分

Claude Codeのheadless実行でCI/CDを自動化する

Claude Codeは`-p`フラグで非対話実行しexit codeでCI分岐できる。`--bare`モードと権限設定でパイプラインに安全に組み込む手順を解説する。

Claude CodeCI/CDプラットフォーム設計業務自動化
· Kuu株式会社 エンジニアリング · 約3分

Claude Codeプラグイン配布を自社基盤で統制する

Claude Codeのプラグインは自社の`marketplace.json`で配布でき、managed settingsの`enabledPlugins`とallowlistで組織全体への強制適用も設計できる。構築手順を解説する。

Claude Codeエージェントガバナンス利用ポリシープラットフォームエンジニアリング
· Kuu株式会社 エンジニアリング · 約3分

評価ベンチマーク汚染時代のプライベートeval設計

自社のエージェント評価は公開ベンチマークの汚染にどう対処すべきか。SWE-Bench-Verifiedで問題文のみでも76%の精度が出た事例を基に、プライベートevalの設計指針を解説する。

エージェント評価評価設計評価フレームワーク
· Kuu株式会社 エンジニアリング · 約4分

Prefill/Decode分離で推論基盤を設計する

自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。

セルフホストLLMvLLMSGLangプラットフォーム設計
· Kuu株式会社 エンジニアリング · 約3分

自律コーディングエージェントのハーネス設計——生成と評価を分離

長時間稼働する自律コーディングエージェントは、生成役と評価役を分離しコンテキストリセットで引き継ぐハーネス設計が有効です。Anthropicの実装は1セッション最大4時間に及びます。

マルチエージェントエージェントハーネスコンテキストエンジニアリング長期タスク設計
· Kuu株式会社 エンジニアリング · 約3分

Managed Agentsのauto権限を安全に設計する

Managed Agentsの権限ポリシーautoは、2026年9月10日にサーバー側評価を追加し、ツール呼び出しを許可・拒否・承認待ちの3種に振り分けます。設計と限界を解説します。

Managed Agents権限管理エージェントガバナンス
· Kuu株式会社 エンジニアリング · 約3分

AGENTS.mdとは何か——複数ツールの指示を統一する標準

AGENTS.mdは2025年8月策定、Agentic AI Foundationが管理する仕様で、Claude Codeもv2.1.277で対応済みです。CLAUDE.mdとの優先順位・併用設定を解説します。

AIエージェントプロトコルClaude Codeエージェント設計