Moonshot 开源 Kimi K3:2.8T 参数 MoE、104B 激活、100 万上下文的开源前沿模型

前言

2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 与 GitHub 同步发布了 Kimi K3 的完整模型权重,并上传 arXiv 技术报告(2607.24653)。这是当时规模最大的开源 3T 级模型:总参数量 2.8T,每次前向激活 104B,上下文窗口 100 万 token,且原生支持多模态输入。

对开发者而言,这次发布的意义不在于「又多了一个大模型」,而是开源社区第一次能拿到完整权重,在 Agent、长程编码、百万 token 上下文等场景里做自托管实验。GitHub 仓库 moonshotai/kimi-k3 在发布后迅速获得数千 Star,Hacker News 相关讨论帖累计超过 870 点,社区关注度很高。

本文基于官方 README、arXiv 摘要与公开评测数据,梳理 Kimi K3 的架构要点、能力边界与获取方式。

发布时间与获取渠道

根据 GitHub 仓库创建时间与 arXiv 提交记录,Kimi K3 于 2026 年 7 月 27 日 对外发布:

Moonshot 将其定位为「Open Frontier Intelligence」,即面向前沿智能任务的开源权重发布。权重采用 MXFP4 量化存储(激活为 MXFP8),官方在 SFT 阶段即引入量化感知训练,以兼顾部署时的硬件兼容性。

模型架构:KDA、Stable LatentMoE 与混合注意力

Kimi K3 的核心架构创新,可以概括为三层:

1. Kimi Delta Attention(KDA)与 Attention Residuals(AttnRes)

KDA 是一种改进的注意力机制,配合 AttnRes 改善信息在序列长度与模型深度上的传递效率。K3 共 93 层 Transformer,其中 69 层使用 KDA,24 层使用 Gated MLA(Multi-head Latent Attention),形成混合注意力结构。Hidden size 为 7168,注意力头数 96。

2. Stable LatentMoE

传统 MoE 在专家数量扩大时,路由稳定性与训练效率是瓶颈。K3 采用 Stable LatentMoE 框架:共 896 个路由专家,每个 token 激活 16 个,另有 2 个共享专家。Latent MoE 维度 3584,单专家 Hidden 3072。据 arXiv 摘要,相较 Kimi K2,整体 scaling 效率约提升 2.5 倍(此为 Moonshot 官方宣称,独立复现尚待社区验证)。

3. 原生多模态

视觉编码器为 MoonViT-V2(401M 参数),模型原生支持文本与图像输入,上下文长度 1,048,576 token(约 100 万)。词表规模 160K,激活函数为 SiTU-GLU。

核心参数一览

项目 数值
架构 Mixture-of-Experts (MoE)
总参数量 2.8T
激活参数量 104B
层数 93(含 1 层 Dense)
注意力层 69 KDA + 24 Gated MLA
路由专家数 896
每 token 激活专家 16 + 2 共享
上下文长度 1,048,576 token
模态 文本、图像
量化 MXFP4 权重 / MXFP8 激活
许可 Kimi K3 License

评测表现:Agent 与编码是主战场

Moonshot 在 README 中公布了大量 benchmark 结果(推理力度均为 max)。需要强调的是:Agent 类 benchmark 高度依赖 harness(代理框架),不同框架下的分数不能直接横比。以下数据均来自官方 README,第三方独立验证结果可能略有出入。

编码与终端任务

  • Terminal-Bench 2.1:88.3(Kimi Code harness)。同 benchmark 下 GPT-5.6 Sol 为 88.8,Claude Fable 5 为 88.0。独立评测机构 Artificial Analysis 在自家 harness 上报告 K3 约为 85%,与官方 88.3 存在 harness 差异,阅读榜单时需注意对比条件。
  • DeepSWE:67.5(Kimi Code);换用 mini-SWE-agent harness 为 67.3,差距很小。
  • FrontierSWE:81.2(dominance 分数)
  • ProgramBench:77.8
  • SWE-Marathon:42.0(多小时级整项目工程任务)

推理与知识

  • GPQA Diamond:93.5
  • AA-LCR(长上下文推理):74.7

Agent 任务

  • BrowseComp:91.2(300K token 触发 context compaction 策略)
  • MCPMark-Verified:94.5

arXiv 摘要的结论是:K3 在长程编码、Agent、知识、推理与视觉任务上达到前沿水平;整体仍略逊于 Claude Fable 5 与 GPT-5.6 Sol,但在其评测套件中 consistently 优于其他开源与部分闭源模型。这一表述相对克制,与社区讨论中「接近 Fable、开源 SOTA」的观感基本一致。

后训练与基础设施

技术报告重点介绍了三类后训练与系统工程:

  1. 多域强化学习:覆盖通用、Agent、编码等场景,支持多种 reasoning effort 级别,强调组合泛化与长程执行能力。
  2. 百万 token Agentic RL:支持 persistent rollout 与 sandbox 状态保持,适合长工具调用链训练。
  3. 算法-系统协同设计:KDA 与专家并行训练的负载均衡、高效内存管理,以及部署侧创新。

这些工程细节解释了为何 K3 能在百万上下文与复杂 Agent 场景下保持可用性,而非仅靠堆参数。

如何部署与调用

API 调用

Moonshot 在 platform.kimi.ai 提供 OpenAI/Anthropic 兼容 API,模型名选择 kimi-k3 即可。K3 默认开启 thinking 模式,响应中包含 reasoning_content;多轮对话需将完整 assistant 消息(含 reasoning 与 tool_calls)原样回传。

import openai

client = openai.OpenAI(
    base_url="https://api.moonshot.ai/v1",
    api_key="YOUR_API_KEY",
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[{"role": "user", "content": "解释 Stable LatentMoE 的路由机制"}],
    max_tokens=4096,
    reasoning_effort="max",  # 可选 low / high / max
)
print(response.choices[0].message.content)

本地推理

官方推荐以下推理引擎,并提供了对应 recipe:

Agent 框架

官方建议使用 Kimi Code CLI 作为 Agent 框架,在终端通过 /model 命令选择 Kimi K3,以发挥 Terminal-Bench 等场景下的最佳表现。

自托管完整权重对 GPU 集群要求极高(MXFP4 量化后权重体积仍在数百 GB 量级),多数团队会先通过 API 或云托管服务验证效果,再评估是否值得投入本地部署。

许可与「开源」的边界

权重与代码均在 Kimi K3 License 下发布,允许研究、修改与分发,但对大规模 Model-as-a-Service 商业用途及超大规模商业产品有附加条款。因此社区常将其称为 open-weight(开放权重),而非传统意义上的完全开源(如 Apache 2.0)。使用前建议阅读 LICENSE 全文,确认是否符合你的场景。

小结

Kimi K3 是目前开源生态中参数规模最大、上下文最长、且明确面向 Agent 与长程编码的前沿模型之一。2.8T MoE、104B 激活、896 专家中路由 16 个、100 万 token 上下文、原生多模态——这些数字共同定义了 2026 年下半年开源大模型的新基准。

对普通开发者,优先通过 API 或 Kimi Code 体验;对研究机构与有足够算力的团队,完整权重已可在 Hugging Face 下载,配合 vLLM/SGLang 做二次开发与评测复现。benchmark 分数务必结合 harness 与评测条件解读,不宜简单等同于「模型裸能力排名」。

无论你是否计划自托管,K3 的发布都标志着中国团队在开源前沿模型赛道上的又一次重要落子——Agent 时代的大模型竞争,正在从「API 可用」走向「权重可拿、可改、可验」。

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜