Thinking Machines 发布了自家从头训练的开源权重模型 Inkling,并同步放出了完整权重。官方将其定位为一个“可定制的多模态基础模型”,而不是单纯追求单项 benchmark 第一。
与 Inkling 同时,团队还预览了更轻的 Inkling-Small(12B active 参数),作为同一模型家族的首个小尺寸版本。
核心规格
同一 MoE 架构的两个尺寸:环形图为每 token 激活参数占总参数的比例。
激活比例约 4.2%
- 架构
- MoE Transformer
- 上下文窗口
- 最高 1M tokens
- 预训练数据
- 45 万亿 tokens(文本 / 图像 / 音频 / 视频)
- 权重
- Hugging Face(含 NVFP4 checkpoint)
激活比例约 4.3%
- 架构
- MoE Transformer
- 上下文窗口
- 官方未公布
- 预训练数据
- 类似配方,数据与 recipe 有优化
- 权重
- 测试完成后放出
核心能力
Inkling 强调的不是“单项最强”,而是广度与可定制性。官方在 agentic、推理、编程、指令遵循、事实性、视觉、音频等多类任务上做了训练,希望它成为一个可以后续被 fine-tune 到各种工作流里的基础模型。各维度 benchmark 数据详见下文「Benchmark 表现」一节。
Agentic 编程与工具使用
Inkling 被设计成可以在多种 coding / agent harness 里运行,训练时随机化了工具集合与 schema,以降低对特定 harness 的敏感度。官方展示了几类案例:
- 一次性生成完整 Web App:从提示词生成一个求职申请网页,并调用浏览器代理根据保存的简历自动填写表单。
- Design Arena:在盲测人类评估的 Agentic Web Dev 排行榜上,Inkling 排在开源权重模型前列。
- 统一风格的多页文档:从提示词生成一份 9 页的 PDF 美食旅行日志。
- 长迭代优化游戏:Inkling 在 GPT Codex 作为 reviewer 的情况下,经过 40 轮反馈迭代,生成了一款多人在线贪吃蛇游戏。
可控思考强度(Controllable Thinking Effort)
Inkling 支持通过调整 effort 参数来平衡性能与 token 消耗。官方在 Terminal Bench 2.1、HLE(Humanity's Last Exam)、IFBench 上做了 effort sweep(effort 从 0.2 到 0.99)。整体趋势是:Inkling 在达到同等分数时生成的 token 数更少。例如,在 Terminal Bench 2.1 上,Inkling 达到与 Nemotron 3 Ultra 同等分数时,所需 token 大约只有后者的三分之一。
拖动 effort 参数,观察两者的相对变化。曲线为示意,用于理解权衡方向,非官方逐点数据。
官方 effort sweep(0.2 → 0.99,Terminal Bench 2.1 / HLE / IFBench)显示:提高 effort 收益递增但 token 成本上升更快;Inkling 达到同等分数所需 token 更少。
多模态能力
Inkling 原生支持文本、图像、音频输入。视觉和音频部分采用无 encoder 架构:音频用 dMel spectrogram,图像按 40×40 像素分块,通过轻量 embedding 层后与文本 token 联合处理。
官方给出的多模态 benchmark 对比如下(均为 effort=0.99):
切换视觉 / 音频;点击图例可隐藏对应模型,悬停顶点查看数值。
认知校准(Epistemics)
Thinking Machines 把“校准(calibration)、指令遵循、抗审查”统称为模型的 epistemics。
- 校准:Inkling 在 ForecastBench 和 Prophet Arena 上的结果与 GPT-5.5、Gemini 3.1 Pro 等模型处于同一区间。
颜色按行内相对强弱归一化;Prophet Arena 为 Brier 分数,越低越好(颜色方向已反转);± 误差范围从略。
- 指令遵循与事实性:后训练用了 rubric grader 和 claims grader 两种自动评分器,后者会调用搜索验证事实主张,以减少幻觉。
- 抗审查:在 Cognition 的 Propaganda and Censorship Eval 中,Inkling 表现出较强的“审查不服从”模式。
安全性
颜色按行内相对强弱归一化。FORTRESS(对抗)衡量有害请求拒绝,(良性)衡量低误拒。
官方表示,Inkling 在 FORTRESS 上对有害请求拒绝率较高,同时对良性请求的误拒率较低。
Benchmark 表现
以下成绩均在 effort=0.99、temperature=1.0 下测得,coding 评测 max-token trajectory limit 为 256K。
颜色按行内相对强弱归一化,便于跨不同量纲比较;coding 评测 max-token trajectory 为 256K。
Inkling 其余维度成绩
数值为百分比。SimpleQA Verified 对比:DeepSeek V4 Pro 57.0%、Gemini 3.1 Pro 77.3%、Claude Fable 5 68.3%、GPT 5.6 Sol 71.6%;AA Omniscience 得分 2.1(非百分比,未列入图中)。
- StrongREJECT(安全):98.6
- FORTRESS Benign(安全):95.9
- VoiceBench(音频):91.4
- Global-MMLU-Lite:88.7
- Charxiv RQ + Python(视觉):82
- IFBench(指令遵循):79.8
- Charxiv RQ(视觉):78.1
- FORTRESS Adversarial(安全):78
- MMAU(音频):77.2
- MMMU Pro(视觉):73.5
- Audio MC(音频):56.6
- SimpleQA Verified(事实性):43.9
训练与架构
架构
Inkling 的 MoE 设计主要参考 DeepSeek-V3:
- 每层 256 个 routed experts + 2 个 shared experts,每 token 激活 6 个 routed expert
- Sigmoid-based router + 无辅助损失的负载均衡 bias
- Attention:5:1 的滑动窗口层与全局层交错,8 个 KV heads
- 使用相对位置编码(relative positional embedding),而非 RoPE
- 在 attention 的 key/value 投影后以及 residual branch 输出前加入短卷积
高亮方块为当前 token 激活的 routed expert,每隔约 2 秒切换一批,模拟新 token 进入。
激活比例约 4.2%。
- routed expert(当前激活)
- routed expert(未激活)
- shared expert(始终激活)
结构以 Inkling 官方披露为例:每层 256 个 routed expert + 2 个 shared expert,每 token 激活 6 个 routed expert。
训练
- 预训练:45 万亿 tokens,覆盖文本、图像、音频、视频
- 优化器:大型矩阵权重用 Muon,其他参数用 Adam
- 学习率与 weight decay 联动:weight decay 强度与学习率平方挂钩,以保持权重规模稳定
- 后训练:覆盖数学、agentic 代码与工具使用、音频、图像、对话、安全等领域
- 后训练以合成数据 SFT 启动(包括用 Kimi K2.5 生成的数据),随后是大规模 RL
大规模 RL
Inkling 的后训练依赖大规模异步 RL,累计超过 3000 万 rollouts。官方给出的 aggregate eval reward 从 SFT 初始化的 0.264 提升到发布 checkpoint(约 2650 万 rollouts)的 0.356;在 AIME、HLE、GPQA 等推理评测的聚合指标上,reward 随 rollouts 数量呈 log-linear 提升。
RL 过程中模型的 chain-of-thought 变得更短、更电报式——去掉了冠词和连接词,但仍可理解且不影响最终答案。官方展示了一个数学物理问题的早期(完整语法)与晚期(压缩、电报式)CoT 对比。
Inkling-Small
Inkling-Small 是同一模型家族的轻量预览版:276B 总参数、12B active 参数。由于预训练数据和 recipe 的优化,它在很多 benchmark 上接近甚至持平 Inkling。
每个点是一项 benchmark:横轴 Inkling、纵轴 Inkling-Small。点在对角线上方 = Small 反超,下方 = Inkling 更强。悬停查看详情。
多数点紧贴对角线——Small 与 Inkling 接近持平;SimpleQA、Tau 3 Banking、Terminal Bench 2.1 是少数明显落后的点。
官方表示,Inkling-Small 适合对成本和延迟敏感的场景,如编程、模型打分、合成数据生成等。完整权重将在测试完成后放出。
定制与可用性
Inkling 的一个重点方向是可定制:
- 已在 Tinker 平台上线,支持 fine-tuning
- 上下文长度可选 64K 或 256K
- 限时 50% 折扣(完整定价见官方文档)
- Tinker console 新增 Inkling Playground,可免费试用一段时间
- 官方更新了 cookbook,新增针对 Inkling 音频能力的 recipe
- 发布了
tml-renderer,用于可靠地采样和处理 tool calls、reasoning content、多模态输入
官方还展示了 Inkling 自我 fine-tune 的 demo:模型自己写 fine-tuning job、运行并评估结果。
生态接入
- API:TogetherAI、Fireworks、Modal、Databricks、Baseten
- 推理框架:SGLang / Miles(RadixArk)、vLLM(Inferact)、TokenSpeed(Lightseek)、llama.cpp(Unsloth)、Hugging Face transformers
- 权重:Hugging Face(原始 checkpoint + NVFP4 checkpoint,针对 NVIDIA Blackwell 优化)
参考链接
- 官方发布博客(2026-07-15):https://thinkingmachines.ai/news/introducing-inkling/
- 模型卡:https://thinkingmachines.ai/inkling
- Hugging Face 权重:https://huggingface.co/thinkingmachines
- Tinker 平台:https://tinker.thinkingmachines.ai
