BlogPage 6 / 31
投機的デコーディングで推論を高速化する設計
自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。
インフラノイズを消すエージェント評価基盤設計
Terminal-Bench 2.0の実験ではリソース設定差だけでスコアが最大6ポイント動きました。エージェント評価のインフラノイズを見分け、抑える設計手順を解説します。
GPU推論キャパシティ調達戦略——予約とスポットの使い分け
自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。
GPU機密コンピューティングでAIエージェントの推論を守る
NVIDIA GPU-CCとGoogle Cloud Confidential SpaceのTEEアテステーションで、クラウド運用者からもモデル重みと推論データを隔離する設計を解説する。
バッチAPIでAIコストを半減する実装手順
Claude Message Batches APIは入力・出力トークンとも50%引きで非同期処理でき、1バッチ最大10万件をまとめられる。中小企業が導入すべき業務と実装手順を解説する。
サードパーティ製エージェントスキルの安全性審査手順
エージェントスキルの安全性は、公式のリスク階層評価と8項目のレビューチェックリストで審査できます。マーケットプレイス調査では3,984件中534件に重大な脆弱性が確認されました。
Agent Skillsをevalで品質保証する
Agent Skillsの品質はskill-creatorのEval/Benchmarkモードで自動検証できる。テスト作成からpass率・所要時間・トークン数の計測、A/B比較まで、中小企業のIT担当がすぐ使える手順を示す。
AIエージェントの完了判定設計——検証可能な終了条件の書き方
AIエージェントの完了判定は、検証可能な終了条件を軽量な専用モデルが都度判定する設計が有効です。Claude Codeの/goalは最大4,000字の条件と3種類の判定結果でこれを実装しています。
Managed Agentsのwebhook設計と配信保証
Claude Managed Agentsのwebhookは7カテゴリのイベントをHTTP POSTで通知する。最大3回の再送と自己署名検証の実装要点を一次情報から解説する。
AIエージェント基盤のDR設計とマルチリージョン切替
AWS Bedrockのクロスリージョン推論とVertex AIのマルチリージョンエンドポイントを組み合わせれば、単一リージョン障害時もRTO/RPOを満たすAIエージェント基盤のDR設計ができます。
