#セルフホストLLM

「セルフホストLLM」に関する記事一覧。Kuu株式会社のブログでは、AIエージェントガバナンスとDXの観点から セルフホストLLM に関連するノウハウを 5 件発信しています。

ハイブリッドLLM基盤——ローカル×Claude API設計

ローカルLLMとClaude APIを併用するハイブリッド構成は、データの機密度に応じて推論先を振り分ける設計です。Ollamaの認証機能の欠如を補う設計と、inference_geoによる地域制御の実装手順を示します。

Prefill/Decode分離で推論基盤を設計する

自社ホスティングLLM推論のPrefill/Decode分離アーキテクチャを解説。vLLM・SGLang・NVIDIA DynamoのKVキャッシュ転送方式とTTFT/ITL最適化のトレードオフを整理します。

投機的デコーディングで推論を高速化する設計

自社ホスティングLLM推論に投機的デコーディングを導入する設計を解説。vLLMのEAGLE・ドラフトモデル・N-gram方式の使い分けと、QPS帯域別のトレードオフを整理します。

GPU推論キャパシティ調達戦略——予約とスポットの使い分け

自社ホスティングのGPU推論基盤はオンデマンド・予約・スポットを組み合わせて調達する。AWS Capacity Blocksは最大8週間先まで予約でき、スポット中断通知は2分前に届く。使い分けの判断基準を解説する。

セルフホストLLM推論スタック——vLLM/SGLang選定

自社ホスティングのLLM推論エンジンはvLLMとSGLangが2026年の標準選択肢。RadixAttentionはプレフィックス再利用でキャッシュヒット率50〜99%を達成する。テンソル並列とKVキャッシュ設計の判断基準を解説する。