Mira Murati 的 Thinking Machines 發佈首個開源模型 Inkling

前言

2026 年 7 月 15 日,前 OpenAI CTO Mira Murati 創立的 Thinking Machines Lab 發佈了其首個從零訓練的開源權重模型 Inkling。這是 Murati 在 2023 年短暫擔任 OpenAI 臨時 CEO、2024 年離職後創立的新實驗室的首個正式模型產品。

與 DeepSeek、Kimi 等追求榜單第一的路線不同,Thinking Machines 在官方博客中直言:Inkling 並非當前最強模型,無論是閉源還是開源。團隊將其定位爲可微調的企業級基礎模型——975B 總參數、41B 激活的 MoE 架構,Apache 2.0 協議,原生支持文本、圖像、音頻輸入,並配套 Tinker 微調平臺。對需要私有化部署、領域定製的企業開發者來說,這條「開源 MoE + 可控 thinking effort」路線值得認真評估。

Inkling 是什麼

Inkling 是 Thinking Machines Lab 訓練的首個 Mixture-of-Experts(MoE)多模態大模型,核心規格如下:

項目 規格
總參數量 975B
激活參數量 41B
架構 66 層 decoder-only Transformer + 稀疏 MoE
上下文長度 最高 1M tokens(Tinker 上提供 64K / 256K 選項)
輸入模態 文本、圖像、音頻
輸出模態 文本(UTF-8)
許可證 Apache 2.0
預訓練數據量 45 萬億 tokens(文本、圖像、音頻、視頻)

Murati 在 X 上表示,Inkling 是從零訓練(trained from scratch)的模型,權重已在 Hugging Face 公開。同期還發布了預覽版 Inkling-Small(276B 總參數、12B 激活),體積約爲大版的四分之一,在多項 benchmark 上接近大模型表現。

MoE 架構與可控 Thinking Effort

稀疏 MoE 設計

Inkling 的 MoE 設計大體遵循 DeepSeek-V3 路線,但做了幾處針對長上下文與效率的改動:

  • 每層 MoE 含 256 個 routed experts + 2 個 shared experts,每個 token 激活 6 個 routed expert 及全部 shared expert
  • Router 採用 sigmoid + auxiliary-loss-free load balancing,避免傳統輔助損失帶來的訓練干擾
  • Attention 層以 5:1 比例交替 sliding-window 與 global attention,KV head 數爲 8
  • 位置編碼使用相對位置嵌入(非 RoPE),官方稱在長序列外推上表現更好

多模態方面,圖像經 hierarchical patch encoder(40×40 像素 patch)編碼,音頻經 dMel spectrogram 離散化後,與文本 token 投影到同一 hidden space,由 decoder 聯合處理。這是 encoder-free 的多模態方案,與團隊此前發佈的 interaction models 設計理念一致。

可控 Thinking Effort

Inkling 的一大差異化能力是 controllable thinking effort——開發者可在推理時調節模型的「思考深度」,在性能與 token 成本之間做權衡。

官方 benchmark 顯示:在 Terminal Bench 2.1 上,Inkling 用約 三分之一 token 即可達到 Nemotron 3 Ultra 同等分數;effort 參數從 0.2 掃到 0.99 時,性能與生成 token 數呈可調曲線。對需要大規模調用、或嵌入長工作流的 agent 場景,這意味着可按任務難度動態控費,而非一律拉滿推理預算。

能力概覽

Thinking Machines 將 Inkling 訓練爲廣度優先的 generalist 模型,覆蓋 agentic coding、推理、指令遵循、事實性、視覺、音頻與安全等方向,而非單點刷榜。官方公佈的若干參考數據(effort=0.99):

  • SWE-bench Verified:77.6%
  • Terminal Bench 2.1:63.8%
  • AIME 2026:97.1%
  • VoiceBench(音頻):91.4%
  • FORTRESS Adversarial(安全):78.0%,在對比的開源模型中最高

在 Design Arena 的 Agentic Web Dev 盲評 leaderboard 上,Inkling 得分 1257,位列開源模型前列。團隊強調,選 base model 做微調時,benchmark 數字只是一部分,「手感」同樣重要——爲此在 Tinker 控制檯新增了 Inkling Playground 供開發者直接對話體驗。

Tinker 微調平臺

Inkling 的商業閉環與 Tinker 深度綁定。Tinker 是 Thinking Machines 面向開發者的訓練與推理平臺,Inkling 發佈當天即上線微調能力。

基本用法

  1. 在 Tinker 控制檯選擇 Inkling,上下文可選 64K 或 256K
  2. 參考官方 Tinker Cookbook 編寫微調任務;多模態後訓練需安裝 tml-renderers
  3. 訓練過程中可隨時從 sampler checkpoint 採樣驗證,無需等任務全部結束
  4. 微調後的 checkpoint 可通過 Tinker API 或合作推理商部署

Tinker 還提供 Anthropic 兼容 API:將 ANTHROPIC_BASE_URL 指向 Tinker 端點、替換 API Key 後,Claude Code、Anthropic SDK 等現有工具可直接對接 Inkling 或自訓 checkpoint,降低遷移成本。

自微調演示

官方博客中有一個頗具象徵意義的 demo:Inkling 在 Tinker 上自己編寫微調任務、運行訓練、評估結果——用模型定製模型,展示了 Tinker 在 agentic 工作流中的潛力。

私有化部署與推理

Inkling 權重可在 Hugging Face 下載,提供 BF16NVFP4 兩種 checkpoint 格式。

硬件要求

BF16 全精度(至少 2 TB 聚合 VRAM):

  • 8× NVIDIA B300,或
  • 16× NVIDIA H200

NVFP4 量化版(至少 600 GB 聚合 VRAM):

  • W4A4 模式:4× B300(需 SM100+ 架構)
  • W4A16 模式:8× H200

對企業私有化部署而言,門檻不低,但 NVFP4 版本已將硬件需求壓到可管理的集羣規模。

支持的推理框架

Day-0 生態支持較完整,可選:

  • SGLang(與 RadixArk 合作,含 RL 支持)
  • vLLM(Inferact)
  • TokenSpeed(Lightseek)
  • Unsloth(含 llama.cpp 路徑)
  • Hugging Face transformers

若不想自建集羣,可通過第三方 API 調用:Together AI、Fireworks、Modal、Databricks、Baseten 均已接入 Inkling。

與開源 MoE 賽道的位置

2026 年開源大模型競爭白熱化:Kimi K3、DeepSeek-V4-Flash、騰訊 Hy3、Poolside Laguna 等密集發佈。Interconnects.ai 在其 open artifacts 綜述中指出,Thinking Machines 在 2025 年 2 月成立時,外界很少將其歸入「開源模型公司」;如今 Tinker 微調服務年化收入已達數億美元量級,Inkling 也被視爲美國本土訓練的最強開源權重模型之一

Inkling 的差異化不在單點 SOTA,而在三點組合:

  1. Apache 2.0 全權重開源,無商用限制
  2. 原生多模態 + 可控 effort,適合 agent 與企業定製
  3. Tinker 一站式微調 + 推理 + Anthropic 兼容 API,降低從試用到生產的鏈路摩擦

對國內開發者,需關注模型以英文爲主、多語言爲輔助;長上下文與多模態推理的算力成本;以及開源權重模型的安全合規與內容審覈責任——官方建議部署層疊加 Llama Guard 等 moderation 工具,而非僅依賴模型內置拒答。

小結

Mira Murati 帶領 Thinking Machines Lab 交出的第一份模型答卷,策略清晰:不做最強,做最好微調的基礎。975B-A41B MoE、1M 上下文、Apache 2.0、Tinker 生態——Inkling 瞄準的是「拿到權重、按領域改、私有化跑起來」這條企業 AI 落地路徑。

若你正在評估下一個 fine-tune base model,不妨先去 Tinker Playground 或 Hugging Face 權重頁面試用,結合自家任務的 latency 與 cost 約束,掃一遍 effort 曲線再決定是否投入微調——這比只看單一 benchmark 分數更接近真實選型。

參考來源:

羽毛球分组比赛记分
小程序二维码

欢迎使用《羽毛球分组比赛记分》微信小程序

小夜