前言¶
2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 與 GitHub 同步發佈了 Kimi K3 的完整模型權重,並上傳 arXiv 技術報告(2607.24653)。這是當時規模最大的開源 3T 級模型:總參數量 2.8T,每次前向激活 104B,上下文窗口 100 萬 token,且原生支持多模態輸入。
對開發者而言,這次發佈的意義不在於「又多了一個大模型」,而是開源社區第一次能拿到完整權重,在 Agent、長程編碼、百萬 token 上下文等場景裏做自託管實驗。GitHub 倉庫 moonshotai/kimi-k3 在發佈後迅速獲得數千 Star,Hacker News 相關討論帖累計超過 870 點,社區關注度很高。
本文基於官方 README、arXiv 摘要與公開評測數據,梳理 Kimi K3 的架構要點、能力邊界與獲取方式。
發佈時間與獲取渠道¶
根據 GitHub 倉庫創建時間與 arXiv 提交記錄,Kimi K3 於 2026 年 7 月 27 日 對外發布:
Moonshot 將其定位爲「Open Frontier Intelligence」,即面向前沿智能任務的開源權重發布。權重採用 MXFP4 量化存儲(激活爲 MXFP8),官方在 SFT 階段即引入量化感知訓練,以兼顧部署時的硬件兼容性。
模型架構:KDA、Stable LatentMoE 與混合注意力¶
Kimi K3 的核心架構創新,可以概括爲三層:
1. Kimi Delta Attention(KDA)與 Attention Residuals(AttnRes)
KDA 是一種改進的注意力機制,配合 AttnRes 改善信息在序列長度與模型深度上的傳遞效率。K3 共 93 層 Transformer,其中 69 層使用 KDA,24 層使用 Gated MLA(Multi-head Latent Attention),形成混合注意力結構。Hidden size 爲 7168,注意力頭數 96。
2. Stable LatentMoE
傳統 MoE 在專家數量擴大時,路由穩定性與訓練效率是瓶頸。K3 採用 Stable LatentMoE 框架:共 896 個路由專家,每個 token 激活 16 個,另有 2 個共享專家。Latent MoE 維度 3584,單專家 Hidden 3072。據 arXiv 摘要,相較 Kimi K2,整體 scaling 效率約提升 2.5 倍(此爲 Moonshot 官方宣稱,獨立復現尚待社區驗證)。
3. 原生多模態
視覺編碼器爲 MoonViT-V2(401M 參數),模型原生支持文本與圖像輸入,上下文長度 1,048,576 token(約 100 萬)。詞表規模 160K,激活函數爲 SiTU-GLU。
核心參數一覽¶
| 項目 | 數值 |
|---|---|
| 架構 | Mixture-of-Experts (MoE) |
| 總參數量 | 2.8T |
| 激活參數量 | 104B |
| 層數 | 93(含 1 層 Dense) |
| 注意力層 | 69 KDA + 24 Gated MLA |
| 路由專家數 | 896 |
| 每 token 激活專家 | 16 + 2 共享 |
| 上下文長度 | 1,048,576 token |
| 模態 | 文本、圖像 |
| 量化 | MXFP4 權重 / MXFP8 激活 |
| 許可 | Kimi K3 License |
評測表現:Agent 與編碼是主戰場¶
Moonshot 在 README 中公佈了大量 benchmark 結果(推理力度均爲 max)。需要強調的是:Agent 類 benchmark 高度依賴 harness(代理框架),不同框架下的分數不能直接橫比。以下數據均來自官方 README,第三方獨立驗證結果可能略有出入。
編碼與終端任務
- Terminal-Bench 2.1:88.3(Kimi Code harness)。同 benchmark 下 GPT-5.6 Sol 爲 88.8,Claude Fable 5 爲 88.0。獨立評測機構 Artificial Analysis 在自家 harness 上報告 K3 約爲 85%,與官方 88.3 存在 harness 差異,閱讀榜單時需注意對比條件。
- DeepSWE:67.5(Kimi Code);換用 mini-SWE-agent harness 爲 67.3,差距很小。
- FrontierSWE:81.2(dominance 分數)
- ProgramBench:77.8
- SWE-Marathon:42.0(多小時級整項目工程任務)
推理與知識
- GPQA Diamond:93.5
- AA-LCR(長上下文推理):74.7
Agent 任務
- BrowseComp:91.2(300K token 觸發 context compaction 策略)
- MCPMark-Verified:94.5
arXiv 摘要的結論是:K3 在長程編碼、Agent、知識、推理與視覺任務上達到前沿水平;整體仍略遜於 Claude Fable 5 與 GPT-5.6 Sol,但在其評測套件中 consistently 優於其他開源與部分閉源模型。這一表述相對剋制,與社區討論中「接近 Fable、開源 SOTA」的觀感基本一致。
後訓練與基礎設施¶
技術報告重點介紹了三類後訓練與系統工程:
- 多域強化學習:覆蓋通用、Agent、編碼等場景,支持多種 reasoning effort 級別,強調組合泛化與長程執行能力。
- 百萬 token Agentic RL:支持 persistent rollout 與 sandbox 狀態保持,適合長工具調用鏈訓練。
- 算法-系統協同設計:KDA 與專家並行訓練的負載均衡、高效內存管理,以及部署側創新。
這些工程細節解釋了爲何 K3 能在百萬上下文與複雜 Agent 場景下保持可用性,而非僅靠堆參數。
如何部署與調用¶
API 調用
Moonshot 在 platform.kimi.ai 提供 OpenAI/Anthropic 兼容 API,模型名選擇 kimi-k3 即可。K3 默認開啓 thinking 模式,響應中包含 reasoning_content;多輪對話需將完整 assistant 消息(含 reasoning 與 tool_calls)原樣回傳。
import openai
client = openai.OpenAI(
base_url="https://api.moonshot.ai/v1",
api_key="YOUR_API_KEY",
)
response = client.chat.completions.create(
model="kimi-k3",
messages=[{"role": "user", "content": "解釋 Stable LatentMoE 的路由機制"}],
max_tokens=4096,
reasoning_effort="max", # 可選 low / high / max
)
print(response.choices[0].message.content)
本地推理
官方推薦以下推理引擎,並提供了對應 recipe:
Agent 框架
官方建議使用 Kimi Code CLI 作爲 Agent 框架,在終端通過 /model 命令選擇 Kimi K3,以發揮 Terminal-Bench 等場景下的最佳表現。
自託管完整權重對 GPU 集羣要求極高(MXFP4 量化後權重體積仍在數百 GB 量級),多數團隊會先通過 API 或雲託管服務驗證效果,再評估是否值得投入本地部署。
許可與「開源」的邊界¶
權重與代碼均在 Kimi K3 License 下發布,允許研究、修改與分發,但對大規模 Model-as-a-Service 商業用途及超大規模商業產品有附加條款。因此社區常將其稱爲 open-weight(開放權重),而非傳統意義上的完全開源(如 Apache 2.0)。使用前建議閱讀 LICENSE 全文,確認是否符合你的場景。
小結¶
Kimi K3 是目前開源生態中參數規模最大、上下文最長、且明確面向 Agent 與長程編碼的前沿模型之一。2.8T MoE、104B 激活、896 專家中路由 16 個、100 萬 token 上下文、原生多模態——這些數字共同定義了 2026 年下半年開源大模型的新基準。
對普通開發者,優先通過 API 或 Kimi Code 體驗;對研究機構與有足夠算力的團隊,完整權重已可在 Hugging Face 下載,配合 vLLM/SGLang 做二次開發與評測復現。benchmark 分數務必結合 harness 與評測條件解讀,不宜簡單等同於「模型裸能力排名」。
無論你是否計劃自託管,K3 的發佈都標誌着中國團隊在開源前沿模型賽道上的又一次重要落子——Agent 時代的大模型競爭,正在從「API 可用」走向「權重可拿、可改、可驗」。