Moonshot 開源 2.8T 參數 Kimi K3:迄今最大規模開放權重前沿模型

前言

2026 年 7 月 27 日,月之暗面(Moonshot AI)在 Hugging Face 上放出 Kimi K3 完整模型權重。總參數量 2.8T,每 token 激活約 104B,官方將其稱爲全球首個開放 3T 級模型。權重以 MXFP4 格式打包,約 1.56 TB,拆成 96 個 safetensors 分片——這是目前公開可下載的最大規模開放權重前沿模型。

Kimi K3 並非「小模型試玩版」,而是 Moonshot 當前最強的 Agentic 多模態模型:原生支持圖文輸入、100 萬 token 上下文,面向長程編程、知識工作與推理任務。模型本身於 7 月 17 日前後已在 Kimi.com、Kimi API 等平臺上線;7 月 27 日則是完整權重與 GitHub 倉庫同步開放。開源社區與 Hacker News 隨即圍繞其 MoE 架構、MXFP4 量化方案,以及「普通人能否自託管」展開討論。

本文基於 Moonshot 官方博客、GitHub 倉庫與 Hugging Face 模型卡,梳理 Kimi K3 的核心規格、架構要點與接入方式。

Kimi K3 模型概覽

Kimi K3 是一款原生多模態 Agent 模型,核心定位是「開放前沿智能」(Open Frontier Intelligence)。與僅開放部分層或蒸餾版本不同,Moonshot 此次放出的是完整權重,供研究與部署使用。

官方給出的關鍵規格如下:

項目 數值
架構 Mixture-of-Experts (MoE)
總參數量 2.8T
每 token 激活參數 104B
層數 93(1 層 Dense + 69 層 KDA + 24 層 Gated MLA)
專家總數 896
每 token 選中專家 16(另有 2 個共享專家)
上下文長度 1,048,576(100 萬 token)
詞表大小 160K
視覺編碼器 MoonViT-V2(401M 參數)
量化格式 MXFP4 權重 / MXFP8 激活(量化感知訓練)
支持模態 文本、圖像

Moonshot 稱,相較 Kimi K2,K3 在整體 scaling 效率上約有 2.5× 提升。在官方評測中,K3 在多項 coding、agentic 與多模態基準上達到前沿水平,但整體體驗仍略遜於 Claude Fable 5、GPT-5.6 Sol 等閉源旗艦——官方在博客中亦明確承認這一差距。

架構:KDA、AttnRes 與 Stable LatentMoE

Kimi K3 的架構更新是社區討論的焦點。它並非簡單堆參數,而是在注意力機制與 MoE 路由上做了多項改動。

Kimi Delta Attention 與 Attention Residuals

Kimi Delta Attention(KDA) 用於更高效地擴展注意力計算;Attention Residuals(AttnRes) 則允許模型在深度維度上有選擇地檢索表徵,而非均勻累加。二者共同構成 K3 在萬億參數規模下的注意力骨幹。

93 層中,69 層採用 KDA,24 層採用 Gated MLA(Multi-head Latent Attention)。隱藏維度 7168,注意力頭數 96。激活函數爲 SiTU-GLU。

Stable LatentMoE:896 選 16

MoE 部分採用 Stable LatentMoE 框架:896 個路由專家中,每個 token 激活 16 個,另有 2 個共享專家始終參與計算。MoE 隱藏維度爲 3072,Latent MoE 維度 3584。

在如此大的稀疏度下,專家負載均衡成爲訓練與推理的關鍵。Moonshot 引入了 Quantile Balancing(基於 router 分數分位數分配專家)與 Per-Head Muon(按注意力頭獨立優化)等機制,以穩定 2.8T 規模訓練。

原生 MXFP4 量化

Kimi K3 從 SFT 階段起即採用量化感知訓練,權重以 MXFP4 存儲、激活以 MXFP8 計算。這意味着發佈權重已是 4-bit 量級格式,無需額外 PTQ 即可在兼容硬件上推理。

MXFP4 採用塊級共享 scale 的 4-bit 浮點表示。官方稱此舉是爲了兼顧硬件兼容性與推理效率。實際下載的 checkpoint 約 1.56 TB(96 個 safetensors 分片),低於理論 BF16 全精度體積,但對存儲與帶寬仍是硬性門檻。

開放權重、代碼與許可證

發佈內容與時間線

  • 2026 年 7 月 17 日前後:K3 在 Kimi.com、Kimi Work、Kimi Code、Kimi API 等平臺可用。
  • 2026 年 7 月 27 日:完整模型權重在 Hugging Face(moonshotai/Kimi-K3)發佈,GitHub 倉庫 MoonshotAI/Kimi-K3 同步開放。

除權重外,Moonshot 還開放了部分訓練基礎設施代碼,包括 FlashKDA(此前已開源)、MoonEP(專家並行訓練)與 AgentEnv(Agent 訓練沙箱,與 KVCache.ai 合作)。vLLM 社區亦將收到 KDA 前綴緩存相關實現,以改善長上下文 serving 效率。

Kimi K3 License

權重與代碼均遵循 Kimi K3 License,而非 Apache、MIT 等標準開源許可證。Moonshot 在發佈材料中使用「open weight」(開放權重)表述,社區亦提醒開發者部署前務必閱讀許可條款——尤其涉及商業 MaaS 服務時,可能需要額外商業協議。

自託管門檻:1.56 TB 意味着什麼

開放權重不等於「人人可跑」。K3 的體量決定了它面向的是具備多節點 GPU 集羣的團隊,而非個人開發者筆記本。

Moonshot 官方建議:爲發揮推理效率,宜在 64 加速器以上的 supernode 配置部署;vLLM 官方部署指南則指向 NVIDIA Blackwell 平臺(如 8× B300 節點、GB300 NVL72,或 16× B200)。第三方實測文章稱,96 個注意力頭與 7168 隱藏維度對張量並行切分有嚴格約束——常見配置需多卡協同,單卡 80 GB 無法完整載入。

若僅想體驗能力,調用 API 是更現實的路徑。官方 Kimi API 定價(2026 年 7 月數據):

  • Cache 命中輸入:$0.30 / MTok
  • Cache 未命中輸入:$3.00 / MTok
  • 輸出:$15.00 / MTok

OpenRouter 等平臺亦已接入 Kimi K3,輸入約 $3/M token。對多數開發團隊,API 調用成本遠低於自建 1.56 TB 權重集羣的 CapEx。

如何接入 Kimi K3

1. 通過 Kimi API 調用

官方 API 兼容 OpenAI / Anthropic 格式,模型名選 kimi-k3。K3 默認開啓 thinking(推理)模式,返回 reasoning_content 字段;多輪對話須將完整 assistant 消息(含 reasoning_contenttool_calls)原樣傳回,否則生成質量可能不穩定。

import openai

client = openai.OpenAI(
    api_key="YOUR_API_KEY",
    base_url="https://api.moonshot.ai/v1"  # 以官方文檔爲準
)

response = client.chat.completions.create(
    model="kimi-k3",
    messages=[
        {"role": "user", "content": "用 Python 寫一段快速排序"}
    ],
    max_tokens=4096,
    reasoning_effort="max",  # 可選 low / high / max
)

print(response.choices[0].message.content)

reasoning_effort 控制推理深度:max 爲默認,後續版本將支持 lowhigh 以權衡延遲與成本。

2. 通過 Kimi Code CLI 做 Agent 編程

官方推薦與 Kimi Code CLI 配合使用。終端安裝後,用 /model 命令切換至 Kimi K3,即可在本地工程目錄中進行長程代碼編輯、終端工具調用等 Agent 任務。官方博客展示了 K3 在 GPU kernel 優化、編譯器開發(MiniTriton)、芯片設計等長時任務上的案例。

3. 自託管推理

若已具備多節點 GPU 集羣,可從 Hugging Face 拉取 moonshotai/Kimi-K3 權重,配合 vLLMSGLang 等推理引擎部署。部署前需確認:

  1. 存儲空間 ≥ 1.6 TB(含 vision tower 與索引開銷);
  2. 推理框架版本支持 MXFP4 與 KDA 前綴緩存;
  3. 張量並行度能整除 96 頭與 7168 隱藏維度。

具體啓動參數以各引擎官方 Kimi K3 適配文檔爲準,Moonshot 表示正與推理夥伴對齊技術細節,生態支持仍在快速完善中。

能力邊界與使用注意

官方在模型卡中列出若干限制,自託管或集成 Agent 框架時應留意:

  1. Thinking 歷史必須完整回傳:K3 在 preserved thinking history 模式下訓練,Agent harness 若丟棄歷史 reasoning_content,或中途從其他模型切換至 K3,輸出可能嚴重劣化。建議使用 Kimi Code 等已驗證兼容的框架。
  2. 主動性偏高:面對模糊指令時,K3 可能自行做超出預期的決策。若業務需要嚴格邊界,應在 system prompt 或 AGENTS.md 中明確約束。
  3. 閉源旗艦仍有體驗差距:儘管多項 benchmark 接近前沿,日常交互體驗與 Claude Fable 5、GPT-5.6 Sol 相比仍有可見差距,選型時需結合具體場景實測。

寫在最後

Kimi K3 開源的意義,不在於讓每個人下載 1.56 TB 權重回家跑,而在於首次把 3T 級前沿能力以開放權重形式放進公共領域。研究者可以審視 Stable LatentMoE、KDA、MXFP4 量化感知訓練等設計;有算力的團隊可以自託管 Agent 流水線;更多開發者則可通過 $3/M 量級的 API 以較低成本觸達 frontier-class 模型。

對國內 AI 生態而言,K3 延續了 Kimi 系列「持續推高開放模型參數上限」的路線——過去 12 個月中有 9 個月,Kimi 模型佔據開放模型規模的上界。當閉源模型價格持續下探、開放權重規模不斷上探,「能力獲取方式」本身正在重構:算力、許可與 Agent 框架,將成爲與模型參數同樣重要的變量。

參考來源

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜