前言¶
2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 与 GitHub 同步发布了 Kimi K3 的完整模型权重,并上传 arXiv 技术报告(2607.24653)。这是当时规模最大的开源 3T 级模型:总参数量 2.8T,每次前向激活 104B,上下文窗口 100 万 token,且原生支持多模态输入。
对开发者而言,这次发布的意义不在于「又多了一个大模型」,而是开源社区第一次能拿到完整权重,在 Agent、长程编码、百万 token 上下文等场景里做自托管实验。GitHub 仓库 moonshotai/kimi-k3 在发布后迅速获得数千 Star,Hacker News 相关讨论帖累计超过 870 点,社区关注度很高。
本文基于官方 README、arXiv 摘要与公开评测数据,梳理 Kimi K3 的架构要点、能力边界与获取方式。
发布时间与获取渠道¶
根据 GitHub 仓库创建时间与 arXiv 提交记录,Kimi K3 于 2026 年 7 月 27 日 对外发布:
Moonshot 将其定位为「Open Frontier Intelligence」,即面向前沿智能任务的开源权重发布。权重采用 MXFP4 量化存储(激活为 MXFP8),官方在 SFT 阶段即引入量化感知训练,以兼顾部署时的硬件兼容性。
模型架构:KDA、Stable LatentMoE 与混合注意力¶
Kimi K3 的核心架构创新,可以概括为三层:
1. Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)
KDA 是一种改进的注意力机制,配合 AttnRes 改善信息在序列长度与模型深度上的传递效率。K3 共 93 层 Transformer,其中 69 层使用 KDA,24 层使用 Gated MLA(Multi-head Latent Attention),形成混合注意力结构。Hidden size 为 7168,注意力头数 96。
2. Stable LatentMoE
传统 MoE 在专家数量扩大时,路由稳定性与训练效率是瓶颈。K3 采用 Stable LatentMoE 框架:共 896 个路由专家,每个 token 激活 16 个,另有 2 个共享专家。Latent MoE 维度 3584,单专家 Hidden 3072。据 arXiv 摘要,相较 Kimi K2,整体 scaling 效率约提升 2.5 倍(此为 Moonshot 官方宣称,独立复现尚待社区验证)。
3. 原生多模态
视觉编码器为 MoonViT-V2(401M 参数),模型原生支持文本与图像输入,上下文长度 1,048,576 token(约 100 万)。词表规模 160K,激活函数为 SiTU-GLU。
核心参数一览¶
| 项目 | 数值 |
|---|---|
| 架构 | Mixture-of-Experts (MoE) |
| 总参数量 | 2.8T |
| 激活参数量 | 104B |
| 层数 | 93(含 1 层 Dense) |
| 注意力层 | 69 KDA + 24 Gated MLA |
| 路由专家数 | 896 |
| 每 token 激活专家 | 16 + 2 共享 |
| 上下文长度 | 1,048,576 token |
| 模态 | 文本、图像 |
| 量化 | MXFP4 权重 / MXFP8 激活 |
| 许可 | Kimi K3 License |
评测表现:Agent 与编码是主战场¶
Moonshot 在 README 中公布了大量 benchmark 结果(推理力度均为 max)。需要强调的是:Agent 类 benchmark 高度依赖 harness(代理框架),不同框架下的分数不能直接横比。以下数据均来自官方 README,第三方独立验证结果可能略有出入。
编码与终端任务
- Terminal-Bench 2.1:88.3(Kimi Code harness)。同 benchmark 下 GPT-5.6 Sol 为 88.8,Claude Fable 5 为 88.0。独立评测机构 Artificial Analysis 在自家 harness 上报告 K3 约为 85%,与官方 88.3 存在 harness 差异,阅读榜单时需注意对比条件。
- DeepSWE:67.5(Kimi Code);换用 mini-SWE-agent harness 为 67.3,差距很小。
- FrontierSWE:81.2(dominance 分数)
- ProgramBench:77.8
- SWE-Marathon:42.0(多小时级整项目工程任务)
推理与知识
- GPQA Diamond:93.5
- AA-LCR(长上下文推理):74.7
Agent 任务
- BrowseComp:91.2(300K token 触发 context compaction 策略)
- MCPMark-Verified:94.5
arXiv 摘要的结论是:K3 在长程编码、Agent、知识、推理与视觉任务上达到前沿水平;整体仍略逊于 Claude Fable 5 与 GPT-5.6 Sol,但在其评测套件中 consistently 优于其他开源与部分闭源模型。这一表述相对克制,与社区讨论中「接近 Fable、开源 SOTA」的观感基本一致。
后训练与基础设施¶
技术报告重点介绍了三类后训练与系统工程:
- 多域强化学习:覆盖通用、Agent、编码等场景,支持多种 reasoning effort 级别,强调组合泛化与长程执行能力。
- 百万 token Agentic RL:支持 persistent rollout 与 sandbox 状态保持,适合长工具调用链训练。
- 算法-系统协同设计:KDA 与专家并行训练的负载均衡、高效内存管理,以及部署侧创新。
这些工程细节解释了为何 K3 能在百万上下文与复杂 Agent 场景下保持可用性,而非仅靠堆参数。
如何部署与调用¶
API 调用
Moonshot 在 platform.kimi.ai 提供 OpenAI/Anthropic 兼容 API,模型名选择 kimi-k3 即可。K3 默认开启 thinking 模式,响应中包含 reasoning_content;多轮对话需将完整 assistant 消息(含 reasoning 与 tool_calls)原样回传。
import openai
client = openai.OpenAI(
base_url="https://api.moonshot.ai/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "解释 Stable LatentMoE 的路由机制"}],
max_tokens=4096,
reasoning_effort="max", # 可选 low / high / max
)
print(response.choices[0].message.content)
本地推理
官方推荐以下推理引擎,并提供了对应 recipe:
Agent 框架
官方建议使用 Kimi Code CLI 作为 Agent 框架,在终端通过 /model 命令选择 Kimi K3,以发挥 Terminal-Bench 等场景下的最佳表现。
自托管完整权重对 GPU 集群要求极高(MXFP4 量化后权重体积仍在数百 GB 量级),多数团队会先通过 API 或云托管服务验证效果,再评估是否值得投入本地部署。
许可与「开源」的边界¶
权重与代码均在 Kimi K3 License 下发布,允许研究、修改与分发,但对大规模 Model-as-a-Service 商业用途及超大规模商业产品有附加条款。因此社区常将其称为 open-weight(开放权重),而非传统意义上的完全开源(如 Apache 2.0)。使用前建议阅读 LICENSE 全文,确认是否符合你的场景。
小结¶
Kimi K3 是目前开源生态中参数规模最大、上下文最长、且明确面向 Agent 与长程编码的前沿模型之一。2.8T MoE、104B 激活、896 专家中路由 16 个、100 万 token 上下文、原生多模态——这些数字共同定义了 2026 年下半年开源大模型的新基准。
对普通开发者,优先通过 API 或 Kimi Code 体验;对研究机构与有足够算力的团队,完整权重已可在 Hugging Face 下载,配合 vLLM/SGLang 做二次开发与评测复现。benchmark 分数务必结合 harness 与评测条件解读,不宜简单等同于「模型裸能力排名」。
无论你是否计划自托管,K3 的发布都标志着中国团队在开源前沿模型赛道上的又一次重要落子——Agent 时代的大模型竞争,正在从「API 可用」走向「权重可拿、可改、可验」。