Luxsynthesis Blog
返回全部
模型

Thinking Machines 发布 Inkling:975B 开源权重多模态基础模型

Thinking Machines 发布从头训练的开源权重模型 Inkling:975B 总参数、41B 激活参数的 MoE 多模态基础模型,原生支持文本、图像、音频输入,最高 1M token 上下文,支持可控思考强度,完整权重已在 Hugging Face 放出,并同步预览 12B 激活参数的 Inkling-Small。

作者
Luxsynthesis
发布日期
阅读时长
10 分钟阅读
Thinking Machines 发布 Inkling:975B 开源权重多模态基础模型

Thinking Machines 发布了自家从头训练的开源权重模型 Inkling,并同步放出了完整权重。官方将其定位为一个“可定制的多模态基础模型”,而不是单纯追求单项 benchmark 第一。

与 Inkling 同时,团队还预览了更轻的 Inkling-Small(12B active 参数),作为同一模型家族的首个小尺寸版本。

核心规格

Inkling 家族核心规格

同一 MoE 架构的两个尺寸:环形图为每 token 激活参数占总参数的比例。

Inkling完整权重已放出
41B激活
每 token 激活41B
总参数975B

激活比例约 4.2%

架构
MoE Transformer
上下文窗口
最高 1M tokens
预训练数据
45 万亿 tokens(文本 / 图像 / 音频 / 视频)
权重
Hugging Face(含 NVFP4 checkpoint)
Inkling-Small预览 · 测试完成后放出
12B激活
每 token 激活12B
总参数276B

激活比例约 4.3%

架构
MoE Transformer
上下文窗口
官方未公布
预训练数据
类似配方,数据与 recipe 有优化
权重
测试完成后放出

核心能力

Inkling 强调的不是“单项最强”,而是广度可定制性。官方在 agentic、推理、编程、指令遵循、事实性、视觉、音频等多类任务上做了训练,希望它成为一个可以后续被 fine-tune 到各种工作流里的基础模型。各维度 benchmark 数据详见下文「Benchmark 表现」一节。

Agentic 编程与工具使用

Inkling 被设计成可以在多种 coding / agent harness 里运行,训练时随机化了工具集合与 schema,以降低对特定 harness 的敏感度。官方展示了几类案例:

  • 一次性生成完整 Web App:从提示词生成一个求职申请网页,并调用浏览器代理根据保存的简历自动填写表单。
  • Design Arena:在盲测人类评估的 Agentic Web Dev 排行榜上,Inkling 排在开源权重模型前列。
  • 统一风格的多页文档:从提示词生成一份 9 页的 PDF 美食旅行日志。
  • 长迭代优化游戏:Inkling 在 GPT Codex 作为 reviewer 的情况下,经过 40 轮反馈迭代,生成了一款多人在线贪吃蛇游戏。

可控思考强度(Controllable Thinking Effort)

Inkling 支持通过调整 effort 参数来平衡性能与 token 消耗。官方在 Terminal Bench 2.1、HLE(Humanity's Last Exam)、IFBench 上做了 effort sweep(effort 从 0.2 到 0.99)。整体趋势是:Inkling 在达到同等分数时生成的 token 数更少。例如,在 Terminal Bench 2.1 上,Inkling 达到与 Nemotron 3 Ultra 同等分数时,所需 token 大约只有后者的三分之一。

可控思考强度:性能与 token 消耗的权衡(示意)

拖动 effort 参数,观察两者的相对变化。曲线为示意,用于理解权衡方向,非官方逐点数据。

effort0.85
0.20.99
相对性能(示意)95%
Token 消耗(示意)72%

官方 effort sweep(0.2 → 0.99,Terminal Bench 2.1 / HLE / IFBench)显示:提高 effort 收益递增但 token 成本上升更快;Inkling 达到同等分数所需 token 更少。

Terminal Bench 2.1:达到 Nemotron 3 Ultra 同等分数所需 token(官方数据)
Nemotron 3 Ultra100%
Inkling约 33%

多模态能力

Inkling 原生支持文本、图像、音频输入。视觉和音频部分采用无 encoder 架构:音频用 dMel spectrogram,图像按 40×40 像素分块,通过轻量 embedding 层后与文本 token 联合处理。

官方给出的多模态 benchmark 对比如下(均为 effort=0.99):

多模态 benchmark 雷达图(effort=0.99)

切换视觉 / 音频;点击图例可隐藏对应模型,悬停顶点查看数值。

MMMU ProCharxiv RQCharxiv RQ + Py

认知校准(Epistemics)

Thinking Machines 把“校准(calibration)、指令遵循、抗审查”统称为模型的 epistemics。

  • 校准:Inkling 在 ForecastBench 和 Prophet Arena 上的结果与 GPT-5.5、Gemini 3.1 Pro 等模型处于同一区间。
校准(ForecastBench / Prophet Arena)

颜色按行内相对强弱归一化;Prophet Arena 为 Brier 分数,越低越好(颜色方向已反转);± 误差范围从略。

Inkling
GPT-5.5
Claude Opus 4.8
Gemini 3.1 Pro
Grok 4.3
Kimi K2.6
ForecastBench · 无搜索
61.1
59.1
54.6
61.1
61.7
58.1
ForecastBench · 含搜索
63.7
64.7
58.6
64.3
63.2
Prophet Arena Brier越低越好
0.1617
0.1598
0.1605
0.1594
0.1715
0.1675
行内偏弱行内最强
  • 指令遵循与事实性:后训练用了 rubric grader 和 claims grader 两种自动评分器,后者会调用搜索验证事实主张,以减少幻觉。
  • 抗审查:在 Cognition 的 Propaganda and Censorship Eval 中,Inkling 表现出较强的“审查不服从”模式。

安全性

安全性对比

颜色按行内相对强弱归一化。FORTRESS(对抗)衡量有害请求拒绝,(良性)衡量低误拒。

Inkling
Nemotron 3 Ultra
Kimi K2.5
Kimi K2.6
GLM 5.2
DeepSeek V4 Pro
FORTRESS(对抗)
78.0
77.6
54.1
65.6
71.3
36.0
FORTRESS(良性)
95.9
90.5
98.3
97.2
90.0
98.5
StrongREJECT
98.6
98.7
99.5
99.8
98.5
98.6
行内偏弱行内最强

官方表示,Inkling 在 FORTRESS 上对有害请求拒绝率较高,同时对良性请求的误拒率较低。

Benchmark 表现

以下成绩均在 effort=0.99、temperature=1.0 下测得,coding 评测 max-token trajectory limit 为 256K。

Benchmark 表现热力矩阵(effort=0.99,temperature=1.0)

颜色按行内相对强弱归一化,便于跨不同量纲比较;coding 评测 max-token trajectory 为 256K。

Inkling
Nemotron 3 Ultra
Kimi K2.5
Kimi K2.6
GLM 5.2
DeepSeek V4 Pro
Gemini 3.1 Pro
Claude Fable 5
GPT 5.6 Sol
HLE text only
29.7
26.6
29.4
35.9
40.1
35.9
44.7
53.3
47.2
HLE with tools
46.0
37.4
50.2
54.0
54.7
48.2
51.4
64.5
55.0
AIME 2026
97.1
94.2
95.8
96.4
99.2
96.7
98.3
99.9
99.9
GPQA Diamond
87.2
86.7
87.9
91.1
89.5
88.8
94.1
92.6
94.1
行内偏弱行内最强

Inkling 其余维度成绩

Inkling 在事实性、指令遵循、视觉、音频与安全维度的成绩(effort=0.99)

数值为百分比。SimpleQA Verified 对比:DeepSeek V4 Pro 57.0%、Gemini 3.1 Pro 77.3%、Claude Fable 5 68.3%、GPT 5.6 Sol 71.6%;AA Omniscience 得分 2.1(非百分比,未列入图中)。

020406080100StrongREJECT(安全)StrongREJECT(…FORTRESS Benign(安全)FORTRESS Beni…VoiceBench(音频)VoiceBench(音频)Global-MMLU-LiteGlobal-MMLU-L…Charxiv RQ + Python(视觉)Charxiv RQ + …IFBench(指令遵循)IFBench(指令遵循)Charxiv RQ(视觉)Charxiv RQ(视觉)FORTRESS Adversarial(安全)FORTRESS Adve…MMAU(音频)MMAU(音频)MMMU Pro(视觉)MMMU Pro(视觉)Audio MC(音频)Audio MC(音频)SimpleQA Verified(事实性)SimpleQA Veri…
未选择数据
  • StrongREJECT(安全):98.6
  • FORTRESS Benign(安全):95.9
  • VoiceBench(音频):91.4
  • Global-MMLU-Lite:88.7
  • Charxiv RQ + Python(视觉):82
  • IFBench(指令遵循):79.8
  • Charxiv RQ(视觉):78.1
  • FORTRESS Adversarial(安全):78
  • MMAU(音频):77.2
  • MMMU Pro(视觉):73.5
  • Audio MC(音频):56.6
  • SimpleQA Verified(事实性):43.9

训练与架构

架构

Inkling 的 MoE 设计主要参考 DeepSeek-V3:

  • 每层 256 个 routed experts + 2 个 shared experts,每 token 激活 6 个 routed expert
  • Sigmoid-based router + 无辅助损失的负载均衡 bias
  • Attention:5:1 的滑动窗口层与全局层交错,8 个 KV heads
  • 使用相对位置编码(relative positional embedding),而非 RoPE
  • 在 attention 的 key/value 投影后以及 residual branch 输出前加入短卷积
MoE 路由:每个 token 只激活一小部分专家

高亮方块为当前 token 激活的 routed expert,每隔约 2 秒切换一批,模拟新 token 进入。

Token
Router(sigmoid + 负载均衡 bias)
2 个 shared expert(始终激活)
加权求和输出
总参数975B
每 token 激活参数41B

激活比例约 4.2%。

  • routed expert(当前激活)
  • routed expert(未激活)
  • shared expert(始终激活)

结构以 Inkling 官方披露为例:每层 256 个 routed expert + 2 个 shared expert,每 token 激活 6 个 routed expert。

训练

  • 预训练:45 万亿 tokens,覆盖文本、图像、音频、视频
  • 优化器:大型矩阵权重用 Muon,其他参数用 Adam
  • 学习率与 weight decay 联动:weight decay 强度与学习率平方挂钩,以保持权重规模稳定
  • 后训练:覆盖数学、agentic 代码与工具使用、音频、图像、对话、安全等领域
  • 后训练以合成数据 SFT 启动(包括用 Kimi K2.5 生成的数据),随后是大规模 RL

大规模 RL

Inkling 的后训练依赖大规模异步 RL,累计超过 3000 万 rollouts。官方给出的 aggregate eval reward 从 SFT 初始化的 0.264 提升到发布 checkpoint(约 2650 万 rollouts)的 0.356;在 AIME、HLE、GPQA 等推理评测的聚合指标上,reward 随 rollouts 数量呈 log-linear 提升。

Inkling-Small

Inkling-Small 是同一模型家族的轻量预览版:276B 总参数、12B active 参数。由于预训练数据和 recipe 的优化,它在很多 benchmark 上接近甚至持平 Inkling。

Inkling vs Inkling-Small:21 项 benchmark 平价图

每个点是一项 benchmark:横轴 Inkling、纵轴 Inkling-Small。点在对角线上方 = Small 反超,下方 = Inkling 更强。悬停查看详情。

Small 持平或反超Inkling 更强
00252550507575100100Inkling(effort=0.99)→Inkling-Small →

多数点紧贴对角线——Small 与 Inkling 接近持平;SimpleQA、Tau 3 Banking、Terminal Bench 2.1 是少数明显落后的点。

官方表示,Inkling-Small 适合对成本和延迟敏感的场景,如编程、模型打分、合成数据生成等。完整权重将在测试完成后放出。

定制与可用性

Inkling 的一个重点方向是可定制

  • 已在 Tinker 平台上线,支持 fine-tuning
  • 上下文长度可选 64K 或 256K
  • 限时 50% 折扣(完整定价见官方文档)
  • Tinker console 新增 Inkling Playground,可免费试用一段时间
  • 官方更新了 cookbook,新增针对 Inkling 音频能力的 recipe
  • 发布了 tml-renderer,用于可靠地采样和处理 tool calls、reasoning content、多模态输入

官方还展示了 Inkling 自我 fine-tune 的 demo:模型自己写 fine-tuning job、运行并评估结果。

生态接入

  • API:TogetherAI、Fireworks、Modal、Databricks、Baseten
  • 推理框架:SGLang / Miles(RadixArk)、vLLM(Inferact)、TokenSpeed(Lightseek)、llama.cpp(Unsloth)、Hugging Face transformers
  • 权重:Hugging Face(原始 checkpoint + NVFP4 checkpoint,针对 NVIDIA Blackwell 优化)

参考链接

返回全部