K8s 原生 AI 推理:Kthena、Grove 與 KAI Scheduler 生態

2026 年雲原生社區加速將 LLM 推理納入 Kubernetes 一等公民。CNCF Volcano 子項目 Kthena 提供 KV Cache 感知路由與 Prefill-Decode 分離調度;NVIDIA 開源 Grove 與 KAI Scheduler 支持多節點推理的拓撲感知 Gang 調度;CNCF Sandbox 項目 KAITO 則簡化 vLLM 模型部署。本文基於官方博客與 GitHub 交叉覈實,梳理三者在模型部署、流量路由、GPU 調度各層的職責邊界與協同方式,並給出 PD 分離最小 YAML 示例,供平臺工程團隊構建統一 K8s AI 基礎設施層時參考。

閱讀全文