前言¶
2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 上放出 Kimi K3 完整模型权重。总参数量 2.8T,每 token 激活约 104B,官方将其称为全球首个开放 3T 级模型。权重以 MXFP4 格式打包,约 1.56 TB,拆成 96 个 safetensors 分片——这是目前公开可下载的最大规模开放权重前沿模型。
Kimi K3 并非「小模型试玩版」,而是 Moonshot 当前最强的 Agentic 多模态模型:原生支持图文输入、100 万 token 上下文,面向长程编程、知识工作与推理任务。模型本身于 7 月 17 日前后已在 Kimi.com、Kimi API 等平台上线;7 月 27 日则是完整权重与 GitHub 仓库同步开放。开源社区与 Hacker News 随即围绕其 MoE 架构、MXFP4 量化方案,以及「普通人能否自托管」展开讨论。
本文基于 Moonshot 官方博客、GitHub 仓库与 Hugging Face 模型卡,梳理 Kimi K3 的核心规格、架构要点与接入方式。
Kimi K3 模型概览¶
Kimi K3 是一款原生多模态 Agent 模型,核心定位是「开放前沿智能」(Open Frontier Intelligence)。与仅开放部分层或蒸馏版本不同,Moonshot 此次放出的是完整权重,供研究与部署使用。
官方给出的关键规格如下:
| 项目 | 数值 |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数量 | 2.8T |
| 每 token 激活参数 | 104B |
| 层数 | 93(1 层 Dense + 69 层 KDA + 24 层 Gated MLA) |
| 专家总数 | 896 |
| 每 token 选中专家 | 16(另有 2 个共享专家) |
| 上下文长度 | 1,048,576(100 万 token) |
| 词表大小 | 160K |
| 视觉编码器 | MoonViT-V2(401M 参数) |
| 量化格式 | MXFP4 权重 / MXFP8 激活(量化感知训练) |
| 支持模态 | 文本、图像 |
Moonshot 称,相较 Kimi K2,K3 在整体 scaling 效率上约有 2.5× 提升。在官方评测中,K3 在多项 coding、agentic 与多模态基准上达到前沿水平,但整体体验仍略逊于 Claude Fable 5、GPT-5.6 Sol 等闭源旗舰——官方在博客中亦明确承认这一差距。
架构:KDA、AttnRes 与 Stable LatentMoE¶
Kimi K3 的架构更新是社区讨论的焦点。它并非简单堆参数,而是在注意力机制与 MoE 路由上做了多项改动。
Kimi Delta Attention 与 Attention Residuals¶
Kimi Delta Attention(KDA) 用于更高效地扩展注意力计算;Attention Residuals(AttnRes) 则允许模型在深度维度上有选择地检索表征,而非均匀累加。二者共同构成 K3 在万亿参数规模下的注意力骨干。
93 层中,69 层采用 KDA,24 层采用 Gated MLA(Multi-head Latent Attention)。隐藏维度 7168,注意力头数 96。激活函数为 SiTU-GLU。
Stable LatentMoE:896 选 16¶
MoE 部分采用 Stable LatentMoE 框架:896 个路由专家中,每个 token 激活 16 个,另有 2 个共享专家始终参与计算。MoE 隐藏维度为 3072,Latent MoE 维度 3584。
在如此大的稀疏度下,专家负载均衡成为训练与推理的关键。Moonshot 引入了 Quantile Balancing(基于 router 分数分位数分配专家)与 Per-Head Muon(按注意力头独立优化)等机制,以稳定 2.8T 规模训练。
原生 MXFP4 量化¶
Kimi K3 从 SFT 阶段起即采用量化感知训练,权重以 MXFP4 存储、激活以 MXFP8 计算。这意味着发布权重已是 4-bit 量级格式,无需额外 PTQ 即可在兼容硬件上推理。
MXFP4 采用块级共享 scale 的 4-bit 浮点表示。官方称此举是为了兼顾硬件兼容性与推理效率。实际下载的 checkpoint 约 1.56 TB(96 个 safetensors 分片),低于理论 BF16 全精度体积,但对存储与带宽仍是硬性门槛。
开放权重、代码与许可证¶
发布内容与时间线¶
- 2026 年 7 月 17 日前后:K3 在 Kimi.com、Kimi Work、Kimi Code、Kimi API 等平台可用。
- 2026 年 7 月 27 日:完整模型权重在 Hugging Face(
moonshotai/Kimi-K3)发布,GitHub 仓库MoonshotAI/Kimi-K3同步开放。
除权重外,Moonshot 还开放了部分训练基础设施代码,包括 FlashKDA(此前已开源)、MoonEP(专家并行训练)与 AgentEnv(Agent 训练沙箱,与 KVCache.ai 合作)。vLLM 社区亦将收到 KDA 前缀缓存相关实现,以改善长上下文 serving 效率。
Kimi K3 License¶
权重与代码均遵循 Kimi K3 License,而非 Apache、MIT 等标准开源许可证。Moonshot 在发布材料中使用「open weight」(开放权重)表述,社区亦提醒开发者部署前务必阅读许可条款——尤其涉及商业 MaaS 服务时,可能需要额外商业协议。
自托管门槛:1.56 TB 意味着什么¶
开放权重不等于「人人可跑」。K3 的体量决定了它面向的是具备多节点 GPU 集群的团队,而非个人开发者笔记本。
Moonshot 官方建议:为发挥推理效率,宜在 64 加速器以上的 supernode 配置部署;vLLM 官方部署指南则指向 NVIDIA Blackwell 平台(如 8× B300 节点、GB300 NVL72,或 16× B200)。第三方实测文章称,96 个注意力头与 7168 隐藏维度对张量并行切分有严格约束——常见配置需多卡协同,单卡 80 GB 无法完整载入。
若仅想体验能力,调用 API 是更现实的路径。官方 Kimi API 定价(2026 年 7 月数据):
- Cache 命中输入:$0.30 / MTok
- Cache 未命中输入:$3.00 / MTok
- 输出:$15.00 / MTok
OpenRouter 等平台亦已接入 Kimi K3,输入约 $3/M token。对多数开发团队,API 调用成本远低于自建 1.56 TB 权重集群的 CapEx。
如何接入 Kimi K3¶
1. 通过 Kimi API 调用¶
官方 API 兼容 OpenAI / Anthropic 格式,模型名选 kimi-k3。K3 默认开启 thinking(推理)模式,返回 reasoning_content 字段;多轮对话须将完整 assistant 消息(含 reasoning_content 与 tool_calls)原样传回,否则生成质量可能不稳定。
import openai
client = openai.OpenAI(
api_key="YOUR_API_KEY",
base_url="https://api.moonshot.ai/v1" # 以官方文档为准
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[
{"role": "user", "content": "用 Python 写一段快速排序"}
],
max_tokens=4096,
reasoning_effort="max", # 可选 low / high / max
)
print(response.choices[0].message.content)
reasoning_effort 控制推理深度:max 为默认,后续版本将支持 low 与 high 以权衡延迟与成本。
2. 通过 Kimi Code CLI 做 Agent 编程¶
官方推荐与 Kimi Code CLI 配合使用。终端安装后,用 /model 命令切换至 Kimi K3,即可在本地工程目录中进行长程代码编辑、终端工具调用等 Agent 任务。官方博客展示了 K3 在 GPU kernel 优化、编译器开发(MiniTriton)、芯片设计等长时任务上的案例。
3. 自托管推理¶
若已具备多节点 GPU 集群,可从 Hugging Face 拉取 moonshotai/Kimi-K3 权重,配合 vLLM、SGLang 等推理引擎部署。部署前需确认:
- 存储空间 ≥ 1.6 TB(含 vision tower 与索引开销);
- 推理框架版本支持 MXFP4 与 KDA 前缀缓存;
- 张量并行度能整除 96 头与 7168 隐藏维度。
具体启动参数以各引擎官方 Kimi K3 适配文档为准,Moonshot 表示正与推理伙伴对齐技术细节,生态支持仍在快速完善中。
能力边界与使用注意¶
官方在模型卡中列出若干限制,自托管或集成 Agent 框架时应留意:
- Thinking 历史必须完整回传:K3 在 preserved thinking history 模式下训练,Agent harness 若丢弃历史
reasoning_content,或中途从其他模型切换至 K3,输出可能严重劣化。建议使用 Kimi Code 等已验证兼容的框架。 - 主动性偏高:面对模糊指令时,K3 可能自行做超出预期的决策。若业务需要严格边界,应在 system prompt 或
AGENTS.md中明确约束。 - 闭源旗舰仍有体验差距:尽管多项 benchmark 接近前沿,日常交互体验与 Claude Fable 5、GPT-5.6 Sol 相比仍有可见差距,选型时需结合具体场景实测。
写在最后¶
Kimi K3 开源的意义,不在于让每个人下载 1.56 TB 权重回家跑,而在于首次把 3T 级前沿能力以开放权重形式放进公共领域。研究者可以审视 Stable LatentMoE、KDA、MXFP4 量化感知训练等设计;有算力的团队可以自托管 Agent 流水线;更多开发者则可通过 $3/M 量级的 API 以较低成本触达 frontier-class 模型。
对国内 AI 生态而言,K3 延续了 Kimi 系列「持续推高开放模型参数上限」的路线——过去 12 个月中有 9 个月,Kimi 模型占据开放模型规模的上界。当闭源模型价格持续下探、开放权重规模不断上探,「能力获取方式」本身正在重构:算力、许可与 Agent 框架,将成为与模型参数同样重要的变量。
参考来源