前言¶
2026 年 7 月 15 日,前 OpenAI CTO Mira Murati 創立的 Thinking Machines Lab 發佈了其首個從零訓練的開源權重模型 Inkling。這是 Murati 在 2023 年短暫擔任 OpenAI 臨時 CEO、2024 年離職後創立的新實驗室的首個正式模型產品。
與 DeepSeek、Kimi 等追求榜單第一的路線不同,Thinking Machines 在官方博客中直言:Inkling 並非當前最強模型,無論是閉源還是開源。團隊將其定位爲可微調的企業級基礎模型——975B 總參數、41B 激活的 MoE 架構,Apache 2.0 協議,原生支持文本、圖像、音頻輸入,並配套 Tinker 微調平臺。對需要私有化部署、領域定製的企業開發者來說,這條「開源 MoE + 可控 thinking effort」路線值得認真評估。
Inkling 是什麼¶
Inkling 是 Thinking Machines Lab 訓練的首個 Mixture-of-Experts(MoE)多模態大模型,核心規格如下:
| 項目 | 規格 |
|---|---|
| 總參數量 | 975B |
| 激活參數量 | 41B |
| 架構 | 66 層 decoder-only Transformer + 稀疏 MoE |
| 上下文長度 | 最高 1M tokens(Tinker 上提供 64K / 256K 選項) |
| 輸入模態 | 文本、圖像、音頻 |
| 輸出模態 | 文本(UTF-8) |
| 許可證 | Apache 2.0 |
| 預訓練數據量 | 45 萬億 tokens(文本、圖像、音頻、視頻) |
Murati 在 X 上表示,Inkling 是從零訓練(trained from scratch)的模型,權重已在 Hugging Face 公開。同期還發布了預覽版 Inkling-Small(276B 總參數、12B 激活),體積約爲大版的四分之一,在多項 benchmark 上接近大模型表現。
MoE 架構與可控 Thinking Effort¶
稀疏 MoE 設計¶
Inkling 的 MoE 設計大體遵循 DeepSeek-V3 路線,但做了幾處針對長上下文與效率的改動:
- 每層 MoE 含 256 個 routed experts + 2 個 shared experts,每個 token 激活 6 個 routed expert 及全部 shared expert
- Router 採用 sigmoid + auxiliary-loss-free load balancing,避免傳統輔助損失帶來的訓練干擾
- Attention 層以 5:1 比例交替 sliding-window 與 global attention,KV head 數爲 8
- 位置編碼使用相對位置嵌入(非 RoPE),官方稱在長序列外推上表現更好
多模態方面,圖像經 hierarchical patch encoder(40×40 像素 patch)編碼,音頻經 dMel spectrogram 離散化後,與文本 token 投影到同一 hidden space,由 decoder 聯合處理。這是 encoder-free 的多模態方案,與團隊此前發佈的 interaction models 設計理念一致。
可控 Thinking Effort¶
Inkling 的一大差異化能力是 controllable thinking effort——開發者可在推理時調節模型的「思考深度」,在性能與 token 成本之間做權衡。
官方 benchmark 顯示:在 Terminal Bench 2.1 上,Inkling 用約 三分之一 token 即可達到 Nemotron 3 Ultra 同等分數;effort 參數從 0.2 掃到 0.99 時,性能與生成 token 數呈可調曲線。對需要大規模調用、或嵌入長工作流的 agent 場景,這意味着可按任務難度動態控費,而非一律拉滿推理預算。
能力概覽¶
Thinking Machines 將 Inkling 訓練爲廣度優先的 generalist 模型,覆蓋 agentic coding、推理、指令遵循、事實性、視覺、音頻與安全等方向,而非單點刷榜。官方公佈的若干參考數據(effort=0.99):
- SWE-bench Verified:77.6%
- Terminal Bench 2.1:63.8%
- AIME 2026:97.1%
- VoiceBench(音頻):91.4%
- FORTRESS Adversarial(安全):78.0%,在對比的開源模型中最高
在 Design Arena 的 Agentic Web Dev 盲評 leaderboard 上,Inkling 得分 1257,位列開源模型前列。團隊強調,選 base model 做微調時,benchmark 數字只是一部分,「手感」同樣重要——爲此在 Tinker 控制檯新增了 Inkling Playground 供開發者直接對話體驗。
Tinker 微調平臺¶
Inkling 的商業閉環與 Tinker 深度綁定。Tinker 是 Thinking Machines 面向開發者的訓練與推理平臺,Inkling 發佈當天即上線微調能力。
基本用法¶
- 在 Tinker 控制檯選擇 Inkling,上下文可選 64K 或 256K
- 參考官方 Tinker Cookbook 編寫微調任務;多模態後訓練需安裝
tml-renderers包 - 訓練過程中可隨時從 sampler checkpoint 採樣驗證,無需等任務全部結束
- 微調後的 checkpoint 可通過 Tinker API 或合作推理商部署
Tinker 還提供 Anthropic 兼容 API:將 ANTHROPIC_BASE_URL 指向 Tinker 端點、替換 API Key 後,Claude Code、Anthropic SDK 等現有工具可直接對接 Inkling 或自訓 checkpoint,降低遷移成本。
自微調演示¶
官方博客中有一個頗具象徵意義的 demo:Inkling 在 Tinker 上自己編寫微調任務、運行訓練、評估結果——用模型定製模型,展示了 Tinker 在 agentic 工作流中的潛力。
私有化部署與推理¶
Inkling 權重可在 Hugging Face 下載,提供 BF16 與 NVFP4 兩種 checkpoint 格式。
硬件要求¶
BF16 全精度(至少 2 TB 聚合 VRAM):
- 8× NVIDIA B300,或
- 16× NVIDIA H200
NVFP4 量化版(至少 600 GB 聚合 VRAM):
- W4A4 模式:4× B300(需 SM100+ 架構)
- W4A16 模式:8× H200
對企業私有化部署而言,門檻不低,但 NVFP4 版本已將硬件需求壓到可管理的集羣規模。
支持的推理框架¶
Day-0 生態支持較完整,可選:
- SGLang(與 RadixArk 合作,含 RL 支持)
- vLLM(Inferact)
- TokenSpeed(Lightseek)
- Unsloth(含 llama.cpp 路徑)
- Hugging Face transformers
若不想自建集羣,可通過第三方 API 調用:Together AI、Fireworks、Modal、Databricks、Baseten 均已接入 Inkling。
與開源 MoE 賽道的位置¶
2026 年開源大模型競爭白熱化:Kimi K3、DeepSeek-V4-Flash、騰訊 Hy3、Poolside Laguna 等密集發佈。Interconnects.ai 在其 open artifacts 綜述中指出,Thinking Machines 在 2025 年 2 月成立時,外界很少將其歸入「開源模型公司」;如今 Tinker 微調服務年化收入已達數億美元量級,Inkling 也被視爲美國本土訓練的最強開源權重模型之一。
Inkling 的差異化不在單點 SOTA,而在三點組合:
- Apache 2.0 全權重開源,無商用限制
- 原生多模態 + 可控 effort,適合 agent 與企業定製
- Tinker 一站式微調 + 推理 + Anthropic 兼容 API,降低從試用到生產的鏈路摩擦
對國內開發者,需關注模型以英文爲主、多語言爲輔助;長上下文與多模態推理的算力成本;以及開源權重模型的安全合規與內容審覈責任——官方建議部署層疊加 Llama Guard 等 moderation 工具,而非僅依賴模型內置拒答。
小結¶
Mira Murati 帶領 Thinking Machines Lab 交出的第一份模型答卷,策略清晰:不做最強,做最好微調的基礎。975B-A41B MoE、1M 上下文、Apache 2.0、Tinker 生態——Inkling 瞄準的是「拿到權重、按領域改、私有化跑起來」這條企業 AI 落地路徑。
若你正在評估下一個 fine-tune base model,不妨先去 Tinker Playground 或 Hugging Face 權重頁面試用,結合自家任務的 latency 與 cost 約束,掃一遍 effort 曲線再決定是否投入微調——這比只看單一 benchmark 分數更接近真實選型。
參考來源: