プラットフォーム・基盤
LLMゲートウェイ・VPC・SSO/SCIM・AI FinOps・Bedrock/Vertex など、エージェント運用基盤とインフラ構成を扱う技術記事の一覧です。
ハイブリッドLLM基盤——ローカル×Claude API設計
ローカルLLMとClaude APIを併用するハイブリッド構成は、データの機密度に応じて推論先を振り分ける設計です。Ollamaの認証機能の欠如を補う設計と、inference_geoによる地域制御の実装手順を示します。
ant applyでエージェントをコードとして管理する
ant CLI 1.30.0(2026年9月3日公開)の`ant apply`は、エージェント・スキル・デプロイをファイルで宣言しclaude-lock.jsonで差分管理する機能です。CI組み込みの手順を解説します。
Claude Codeのheadless実行でCI/CDを自動化する
Claude Codeは`-p`フラグで非対話実行しexit codeでCI分岐できる。`--bare`モードと権限設定でパイプラインに安全に組み込む手順を解説する。
Prefill/Decode分離で推論基盤を設計する
自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。
Agent SDKのセッションをマルチホストで共有する設計
Claude Agent SDKはセッション履歴をローカルのJSONLファイルに保存するため、サーバーレスや複数インスタンス構成ではSessionStoreアダプタでS3やRedis等の外部ストレージにミラーする必要があります。
Managed Agentsのセルフホストサンドボックス実装
Claude Managed AgentsのEnvironmentWorkerは、ツール実行を自社インフラに保ちながらメモリストアを既定15秒間隔(最短5秒)でローカルに同期する仕組みを持つ。
投機的デコーディングで推論を高速化する設計
自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。
GPU推論キャパシティ調達戦略——予約とスポットの使い分け
自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。
Managed Agentsのwebhook設計と配信保証
Claude Managed Agentsのwebhookは7カテゴリのイベントをHTTP POSTで通知する。最大3回の再送と自己署名検証の実装要点を一次情報から解説する。
AIエージェント基盤のオートスケーリング設計
AIエージェント基盤のオートスケーリングは、キュー深度・p90 TTFT・KVキャッシュ使用率の3シグナルで設計します。CPU使用率だけでは検知が遅れる理由と、Kubernetes HPAでの実装手順を解説します。
AIエージェントのサーバーレス/エッジ運用設計
AIエージェントはCloudflare WorkersやVercel Fluid Computeなどのサーバーレス/エッジ基盤で低コスト運用できます。コールドスタート対策とコスト設計の要点を整理します。
AIエージェントのサーバーレス実行基盤設計
AIエージェントをサーバーレスで動かす鍵は、コールドスタート対策と状態管理です。Cloudflare Workersは月5ドルからDurable Objectsで状態を保持できます。
セルフホストLLM推論スタック——vLLM/SGLang選定
自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。
AIエージェントのコスト可視化ダッシュボード設計
Anthropic Usage & Cost APIとLangfuseを組み合わせれば、中小企業でも低コストでAIエージェントの運用コストをワークスペース・モデル単位で可視化できる。利用データは5分以内に反映される。
エージェントのセマンティックキャッシュ——LLMコスト削減設計
クエリ埋め込みの類似検索でLLMコールをスキップするセマンティックキャッシュは、応答3〜8msとコスト30〜70%削減を実現する。プロンプトキャッシュとの違い・類似度閾値・TTL設計を解説する。
LangfuseでAIエージェントを可観測化——中小企業向け設定と実装
LangfuseはMITライセンスのOSS可観測化基盤。月5万件まで無料のクラウド版またはセルフホスト(月$150前後)を3軸で選択し、Claude Agent SDKとOpenTelemetry経由で3ステップ連携できる。
動的モデル選択の設計——3種のルーティングパターンと実装指針
エージェント基盤でタスク複雑度・レイテンシ・コストを実行時シグナルに最適LLMを自動選択するルーター設計。カスケード・分類器・多腕バンディットの3パターンと品質ゲートの組み込み方を示す。
AIエージェント開発環境をDocker Composeで構築する
Docker Composeを使うとAIエージェント開発環境全体をcompose.yaml1ファイルで管理できます。Model Runner・MCPゲートウェイ統合と4パターンの実践的な設計手順を解説します。
AIエージェント基盤のサービスメッシュ統合——Istio Ambient Mode・agentgateway設計指針
Istio Ambient Mode・agentgatewayを使い、AIエージェント基盤にL7トラフィック制御と観測性を確立する。KubeCon EU 2026発表の機能と設計指針を解説。
AIエージェントSDK比較2026——LangGraph・Strands・Mastraの設計思想と選定指針
LangGraph・AWS Strands・Mastra・OpenAI Agents SDKを設計思想・状態管理・デプロイ戦略で比較。言語選択・クラウド環境・ユースケース複雑度の3軸で技術選定の判断基準を整理する2026年版ガイド。
AIエージェントのカオスエンジニアリング——障害注入設計パターン
LLM APIは本番で1〜5%の確率で失敗する。10ステップのエージェントでは約18%のタスクが障害に遭遇する計算だ。カオスエンジニアリングの設計手順と実装パターンを解説する。
中小企業のエージェント基盤選定——マネージドかセルフホストか
月1億トークン未満の中小企業にはマネージドが有利。Bedrock AgentCore・Vertex AI・Dify(OSS)を5軸で比較し、最初に選ぶべきエージェント基盤を示します。
LLM APIレート制限の対処設計——中小企業向け実装パターン
AnthropicのAPIにはTier別のTPM/RPM上限があり、超過するとHTTP 429が返る。中小企業が本番環境でLLMレート制限に対処するための指数バックオフ・優先キュー・バッチの3実装パターンを解説する。
Claude APIワークスペース設計——チーム分離・コスト管理・鍵なし認証
Claude API WorkspacesでAPIキーをチーム・環境別に分離し、Workload Identity Federationで静的キーを不要にする。2026年6月GA対応の設計パターンと実装例を解説します。
RAGエージェント向けベクトルDB選定——pgvector・Weaviate・Qdrant・Pineconeの使い分け
AIエージェントRAG基盤のベクトルDB選定を解説。pgvectorは50M以下でコスト優位、Weaviateはハイブリッド検索特化、Qdrantは高速フィルタ、Pineconeは100M+自動スケールが強みです。
AIプラットフォームエンジニアリング——内製LLM基盤の設計原則
大企業のAI基盤は個別チームの乱立から共有プラットフォームへ移行する。LLMゲートウェイ・エージェント権限管理・コスト配賦・ガードレール・開発者セルフサービスの5構成と設計原則を解説します。
VPC内LLMデプロイとデータレジデンシー——規制業種向け推論基盤設計
AWSベースのVPCエンドポイント・PrivateLinkを用いたLLM推論基盤のデータレジデンシー設計。GDPR・HIPAA・SOC2対応に求められるネットワーク分離・監査ログ・モデルサービング構成をエンタープライズ向けに解説する。
SSO/SCIMでエージェント基盤のID管理を統合する
エージェントは非人間IDとしてSCIM 2.0でプロビジョニング・デプロビジョニングを自動化できる。OktaやEntra IDとのSSO統合、IETFドラフトの新リソースタイプ、グループ同期設計を解説する。
LLM推論コスト削減——バッチ・キャッシュ・ルーティングの設計
バッチAPIで50%・プロンプトキャッシュ読み取りで90%のコスト削減を実現するLLM推論コスト最適化の設計パターン。タスク分類によるモデルルーティングと組み合わせると最大95%のコスト削減が可能です。
マルチテナント・エージェント分離設計——4層でデータ越境を防ぐ
マルチテナント環境でAIエージェントを稼働させると、RAGの検索・ツール呼び出し・ログの3経路でテナント越えが起きる。データ層・実行環境・ID管理・可観測性の4層分離設計とPool/Bridge/Siloの選択基準を解説する。
LLMトークンコストの計装と配賦——AI FinOps入門
LLM/エージェントのトークンコストはOpenTelemetry GenAI規約でスパン計装し、cost_center・teamタグで部門配賦する。FinOps for AI初期設計から最適化施策まで実装の要点を整理。
LLMゲートウェイ設計——ルーティング・レート制限・配賦を一元管理
複数チームのLLM利用をゲートウェイ1点で統制する設計を解説。モデルルーティング・チーム別レート制限・コスト配賦の設計パターンとLiteLLM・Kong AIの実装例を示します。
Vertex AI Agent BuilderとBedrock AgentCore比較——中小企業向けAIエージェント基盤の選び方
Vertex AI Agent BuilderとBedrock AgentCoreを機能・コスト・運用の3軸で比較。エンジニアが少ない中小企業がクラウドAIエージェント基盤を選ぶための実践的な判断基準を解説します。
Vertex AI Agent Engineとは?セッション管理とメモリが実現する中小企業の業務自動化
Google CloudのVertex AI Agent Engineが持つセッション管理・メモリ機能を解説。中小企業がエンジニア不在でも業務自動化エージェントを構築・維持できる理由と実践パターンを紹介。
"APIラッパー"に乗っかる危険——OpenClaw締め出し事件から学ぶAIツール選定のガバナンス
サードパーティAIラッパーへの依存が招くプラットフォームリスクをOpenClaw事件で解説。AIツール選定のガバナンス基準を具体的に提示します。
