前言¶
2026 年 7 月 15 日,前 OpenAI CTO Mira Murati 创立的 Thinking Machines Lab 发布了其首个从零训练的开源权重模型 Inkling。这是 Murati 在 2023 年短暂担任 OpenAI 临时 CEO、2024 年离职后创立的新实验室的首个正式模型产品。
与 DeepSeek、Kimi 等追求榜单第一的路线不同,Thinking Machines 在官方博客中直言:Inkling 并非当前最强模型,无论是闭源还是开源。团队将其定位为可微调的企业级基础模型——975B 总参数、41B 激活的 MoE 架构,Apache 2.0 协议,原生支持文本、图像、音频输入,并配套 Tinker 微调平台。对需要私有化部署、领域定制的企业开发者来说,这条「开源 MoE + 可控 thinking effort」路线值得认真评估。
Inkling 是什么¶
Inkling 是 Thinking Machines Lab 训练的首个 Mixture-of-Experts(MoE)多模态大模型,核心规格如下:
| 项目 | 规格 |
|---|---|
| 总参数量 | 975B |
| 激活参数量 | 41B |
| 架构 | 66 层 decoder-only Transformer + 稀疏 MoE |
| 上下文长度 | 最高 1M tokens(Tinker 上提供 64K / 256K 选项) |
| 输入模态 | 文本、图像、音频 |
| 输出模态 | 文本(UTF-8) |
| 许可证 | Apache 2.0 |
| 预训练数据量 | 45 万亿 tokens(文本、图像、音频、视频) |
Murati 在 X 上表示,Inkling 是从零训练(trained from scratch)的模型,权重已在 Hugging Face 公开。同期还发布了预览版 Inkling-Small(276B 总参数、12B 激活),体积约为大版的四分之一,在多项 benchmark 上接近大模型表现。
MoE 架构与可控 Thinking Effort¶
稀疏 MoE 设计¶
Inkling 的 MoE 设计大体遵循 DeepSeek-V3 路线,但做了几处针对长上下文与效率的改动:
- 每层 MoE 含 256 个 routed experts + 2 个 shared experts,每个 token 激活 6 个 routed expert 及全部 shared expert
- Router 采用 sigmoid + auxiliary-loss-free load balancing,避免传统辅助损失带来的训练干扰
- Attention 层以 5:1 比例交替 sliding-window 与 global attention,KV head 数为 8
- 位置编码使用相对位置嵌入(非 RoPE),官方称在长序列外推上表现更好
多模态方面,图像经 hierarchical patch encoder(40×40 像素 patch)编码,音频经 dMel spectrogram 离散化后,与文本 token 投影到同一 hidden space,由 decoder 联合处理。这是 encoder-free 的多模态方案,与团队此前发布的 interaction models 设计理念一致。
可控 Thinking Effort¶
Inkling 的一大差异化能力是 controllable thinking effort——开发者可在推理时调节模型的「思考深度」,在性能与 token 成本之间做权衡。
官方 benchmark 显示:在 Terminal Bench 2.1 上,Inkling 用约 三分之一 token 即可达到 Nemotron 3 Ultra 同等分数;effort 参数从 0.2 扫到 0.99 时,性能与生成 token 数呈可调曲线。对需要大规模调用、或嵌入长工作流的 agent 场景,这意味着可按任务难度动态控费,而非一律拉满推理预算。
能力概览¶
Thinking Machines 将 Inkling 训练为广度优先的 generalist 模型,覆盖 agentic coding、推理、指令遵循、事实性、视觉、音频与安全等方向,而非单点刷榜。官方公布的若干参考数据(effort=0.99):
- SWE-bench Verified:77.6%
- Terminal Bench 2.1:63.8%
- AIME 2026:97.1%
- VoiceBench(音频):91.4%
- FORTRESS Adversarial(安全):78.0%,在对比的开源模型中最高
在 Design Arena 的 Agentic Web Dev 盲评 leaderboard 上,Inkling 得分 1257,位列开源模型前列。团队强调,选 base model 做微调时,benchmark 数字只是一部分,「手感」同样重要——为此在 Tinker 控制台新增了 Inkling Playground 供开发者直接对话体验。
Tinker 微调平台¶
Inkling 的商业闭环与 Tinker 深度绑定。Tinker 是 Thinking Machines 面向开发者的训练与推理平台,Inkling 发布当天即上线微调能力。
基本用法¶
- 在 Tinker 控制台选择 Inkling,上下文可选 64K 或 256K
- 参考官方 Tinker Cookbook 编写微调任务;多模态后训练需安装
tml-renderers包 - 训练过程中可随时从 sampler checkpoint 采样验证,无需等任务全部结束
- 微调后的 checkpoint 可通过 Tinker API 或合作推理商部署
Tinker 还提供 Anthropic 兼容 API:将 ANTHROPIC_BASE_URL 指向 Tinker 端点、替换 API Key 后,Claude Code、Anthropic SDK 等现有工具可直接对接 Inkling 或自训 checkpoint,降低迁移成本。
自微调演示¶
官方博客中有一个颇具象征意义的 demo:Inkling 在 Tinker 上自己编写微调任务、运行训练、评估结果——用模型定制模型,展示了 Tinker 在 agentic 工作流中的潜力。
私有化部署与推理¶
Inkling 权重可在 Hugging Face 下载,提供 BF16 与 NVFP4 两种 checkpoint 格式。
硬件要求¶
BF16 全精度(至少 2 TB 聚合 VRAM):
- 8× NVIDIA B300,或
- 16× NVIDIA H200
NVFP4 量化版(至少 600 GB 聚合 VRAM):
- W4A4 模式:4× B300(需 SM100+ 架构)
- W4A16 模式:8× H200
对企业私有化部署而言,门槛不低,但 NVFP4 版本已将硬件需求压到可管理的集群规模。
支持的推理框架¶
Day-0 生态支持较完整,可选:
- SGLang(与 RadixArk 合作,含 RL 支持)
- vLLM(Inferact)
- TokenSpeed(Lightseek)
- Unsloth(含 llama.cpp 路径)
- Hugging Face transformers
若不想自建集群,可通过第三方 API 调用:Together AI、Fireworks、Modal、Databricks、Baseten 均已接入 Inkling。
与开源 MoE 赛道的位置¶
2026 年开源大模型竞争白热化:Kimi K3、DeepSeek-V4-Flash、腾讯 Hy3、Poolside Laguna 等密集发布。Interconnects.ai 在其 open artifacts 综述中指出,Thinking Machines 在 2025 年 2 月成立时,外界很少将其归入「开源模型公司」;如今 Tinker 微调服务年化收入已达数亿美元量级,Inkling 也被视为美国本土训练的最强开源权重模型之一。
Inkling 的差异化不在单点 SOTA,而在三点组合:
- Apache 2.0 全权重开源,无商用限制
- 原生多模态 + 可控 effort,适合 agent 与企业定制
- Tinker 一站式微调 + 推理 + Anthropic 兼容 API,降低从试用到生产的链路摩擦
对国内开发者,需关注模型以英文为主、多语言为辅助;长上下文与多模态推理的算力成本;以及开源权重模型的安全合规与内容审核责任——官方建议部署层叠加 Llama Guard 等 moderation 工具,而非仅依赖模型内置拒答。
小结¶
Mira Murati 带领 Thinking Machines Lab 交出的第一份模型答卷,策略清晰:不做最强,做最好微调的基础。975B-A41B MoE、1M 上下文、Apache 2.0、Tinker 生态——Inkling 瞄准的是「拿到权重、按领域改、私有化跑起来」这条企业 AI 落地路径。
若你正在评估下一个 fine-tune base model,不妨先去 Tinker Playground 或 Hugging Face 权重页面试用,结合自家任务的 latency 与 cost 约束,扫一遍 effort 曲线再决定是否投入微调——这比只看单一 benchmark 分数更接近真实选型。
参考来源: