K8s 原生 AI 推理:Kthena、Grove 与 KAI Scheduler 生态

2026 年云原生社区加速将 LLM 推理纳入 Kubernetes 一等公民。CNCF Volcano 子项目 Kthena 提供 KV Cache 感知路由与 Prefill-Decode 分离调度;NVIDIA 开源 Grove 与 KAI Scheduler 支持多节点推理的拓扑感知 Gang 调度;CNCF Sandbox 项目 KAITO 则简化 vLLM 模型部署。本文基于官方博客与 GitHub 交叉核实,梳理三者在模型部署、流量路由、GPU 调度各层的职责边界与协同方式,并给出 PD 分离最小 YAML 示例,供平台工程团队构建统一 K8s AI 基础设施层时参考。

阅读全文