#プラットフォーム設計
「プラットフォーム設計」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から プラットフォーム設計 に関連するノウハウを 11 件発信しています。
ant applyでエージェントをコードとして管理する
ant CLI 1.30.0(2026年9月3日公開)の`ant apply`は、エージェント・スキル・デプロイをファイルで宣言しclaude-lock.jsonで差分管理する機能です。CI組み込みの手順を解説します。
Claude Codeのheadless実行でCI/CDを自動化する
Claude Codeは`-p`フラグで非対話実行しexit codeでCI分岐できる。`--bare`モードと権限設定でパイプラインに安全に組み込む手順を解説する。
Prefill/Decode分離で推論基盤を設計する
自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。
Agent SDKのセッションをマルチホストで共有する設計
Claude Agent SDKはセッション履歴をローカルのJSONLファイルに保存するため、サーバーレスや複数インスタンス構成ではSessionStoreアダプタでS3やRedis等の外部ストレージにミラーする必要があります。
Managed Agentsのセルフホストサンドボックス実装
Claude Managed AgentsのEnvironmentWorkerは、ツール実行を自社インフラに保ちながらメモリストアを既定15秒間隔(最短5秒)でローカルに同期する仕組みを持つ。
投機的デコーディングで推論を高速化する設計
自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。
Managed Agentsのwebhook設計と配信保証
Claude Managed Agentsのwebhookは7カテゴリのイベントをHTTP POSTで通知する。最大3回の再送と自己署名検証の実装要点を一次情報から解説する。
セルフホストLLM推論スタック——vLLM/SGLang選定
自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。
エージェントのセマンティックキャッシュ——LLMコスト削減設計
クエリ埋め込みの類似検索でLLMコールをスキップするセマンティックキャッシュは、応答3〜8msとコスト30〜70%削減を実現する。プロンプトキャッシュとの違い・類似度閾値・TTL設計を解説する。
LLM APIレート制限の対処設計——中小企業向け実装パターン
AnthropicのAPIにはTier別のTPM/RPM上限があり、超過するとHTTP 429が返る。中小企業が本番環境でLLMレート制限に対処するための指数バックオフ・優先キュー・バッチの3実装パターンを解説する。
Claude APIワークスペース設計——チーム分離・コスト管理・鍵なし認証
Claude API WorkspacesでAPIキーをチーム・環境別に分離し、Workload Identity Federationで静的キーを不要にする。2026年6月GA対応の設計パターンと実装例を解説します。
