月之暗面正式推出 Kimi K3,官方定位为其迄今能力最强的模型。
Kimi K3 是一个 2.8 万亿参数模型,基于 KDA 混合线性注意力机制(Kimi Delta Attention)和注意力残差(Attention Residuals)技术构建,原生支持视觉理解,拥有 100 万 token 上下文窗口。它是全球首个开源的 3 万亿级别模型,面向长程编程、知识工作和推理等前沿智能场景。
官方表示,Kimi K3 的整体表现仍落后于最强的闭源模型 Claude Fable 5 和 GPT-5.6 Sol,但在其整套评测中展现出前沿水平的能力,并稳定超过其他所有模型。
即日(2026-07-17)起,可通过 kimi.com、最新版 Kimi 手机 App、最新版 Kimi Work 桌面客户端、Kimi Code 和 Kimi API 使用 Kimi K3。当前默认思考强度为 max(极致),后续更新会增加 low 和 high 两种模式。完整模型权重将于 2026 年 7 月 27 日前发布,架构、训练和评测的更多细节将随技术报告一同公布。
月之暗面迄今最强模型:2.8 万亿参数、100 万 token 上下文,2026-07-17 起全渠道可用。
一、Benchmark 表现
官方公布的评测覆盖 Coding、General Agents、Visual Agents 三类,所有模型均以最大思考强度(max 或 xhigh)运行。官网图表底部注明:所有 Fable 5 成绩均含潜在回退(potential fallbacks),所有 GPT-5.6 Sol 成绩均含潜在 cyberguards。
Coding

| 编码基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| DeepSWE | 67.5 | 70.0 | 73.0 | 59.0 | 67.0 | 46.2 |
| Terminal Bench 2.1 | 88.3 | 84.6 | 88.8 | 84.6 | 83.4 | 82.7 |
| FrontierSWE | 81.2 | 86.6 | 71.3 | 66.7 | 64.9 | 67.3 |
| Program Bench | 77.8 | 76.8 | 77.6 | 71.9 | 70.8 | 63.7 |
| Kimi Code Bench 2.0(内部) | 72.9 | 76.9 | 64.8 | 71.7 | 69.0 | 64.2 |
| SWE Marathon | 42.0 | 35.0 | 39.0 | 40.0 | 14.0 | 13.0 |
General Agents 与 Visual Agents

| 通用智能体基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 | GLM-5.2 |
|---|---|---|---|---|---|---|
| GDPval-AA v2 Elo | 1668.0 | 1760.0 | 1748.0 | 1600.0 | 1494.0 | 1514.0 |
| JobBench | 52.9 | 57.4 | 46.5 | 48.4 | 38.3 | 43.4 |
| AA-Briefcase Elo | 1548.0 | 1583.0 | 1495.0 | 1354.0 | 1158.0 | 1260.0 |
| SpreadsheetBench 2 | 34.8 | 34.7 | 32.4 | 31.6 | 29.1 | 28.1 |
| Automation Bench | 30.8 | 29.1 | 29.7 | 27.2 | 22.7 | 12.9 |
| BrowseComp | 91.2 | 88.0 | 90.4 | 84.3 | 84.4 | — |
| 视觉智能体基准 | Kimi K3 | Claude Fable 5 | GPT-5.6 Sol | Claude Opus 4.8 | GPT-5.5 |
|---|---|---|---|---|---|
| CharXiv(RQ)含工具 | 91.3 | 93.5 | 89.1 | 89.9 | 89.0 |
| Zerobench 含工具(Pass@5) | 41.0 | 46.0 | 35.0 | 34.0 | 41.0 |
分数与成本
官方同时给出了 Kimi Code Bench V2 和 BrowseComp 两项任务的"分数—单任务成本"对比:Kimi K3(max)以明显更低的单任务成本达到接近顶级闭源模型的分数。从图中可读出的近似值:
- Kimi Code Bench V2:K3(max)约 4 美元/任务(72.9%),约为 Claude Fable 5(max,约 10.6 美元,76.9%)的四成;Claude Opus 4.8(max)约 6.8 美元(71.7%)。K3 的 low / high 档分别约 1.3 / 2.5 美元(66.5% / 70.8%)。
- BrowseComp:K3(max)约 4.3 美元(91.2%);同图中 GPT-5.6 Sol(max)约 6.3 美元,Claude Sonnet 5(max)约 20.7 美元,Claude Opus 4.8(max)约 25 美元,Claude Mythos 5(max,10M tokens)约 26 美元。
官方公布的「分数—单任务成本」对比。数值为从官网图表读出的近似值。
纵轴为分数(%),横轴为单任务成本。K3 max 的成本约为 Fable 5 max 的四成。
K3 max 单任务约 $4.3,其余模型最高超过 $25。


完整 Benchmark 表
官方的完整 benchmark 总表还包含 PostTrain Bench、MLS Bench、Toolathlon、MCP Atlas、GPQA、HLE、MMMU 等更多基准:
37 项基准 × 6 个模型。图表模式按行归一化展示相对强弱;数据模式可查看并复制原始表格。
不同基准量纲不同(含 Elo 与百分制),横向位置按行内最小—最大值归一化,仅用于比较行内相对强弱;带光圈的点为本行最高成绩,右侧为 K3 成绩及行内排名。
* 为官网原表中的标记(官网脚注未展开其含义)。"—" 表示官网原表未给出成绩。
评测方法学(官网脚注要点):
- Kimi K3 的全部成绩在 max 思考强度下取得,temperature = 1.0、top-p = 1.0。各模型按基准分别使用 KimiCode、Claude Code 或 Codex 三种 agentic harness 评测。
- Claude Fable 5 由第三方评测;在 Claude Code harness 下,因使用策略被 Fable 5 拒绝的请求会自动回退到 Claude Opus 4.8。
- DeepSWE:K3 的 67.5 分使用 KimiCode harness;在官方排行榜上使用 mini-SWE-agent harness 的成绩为 67.3。
- BrowseComp:采用 Claude 模型卡片中的上下文压缩策略(300K token 触发);K3 在 1M 上下文、无上下文管理条件下成绩为 90.4。
- MCP Atlas:500 个任务的公开子集、100 轮上限,由 Gemini 3.1 Pro 担任评委。AutomationBench:600 个任务的公开子集。
- GDPval-AA v2 与 AA-Briefcase 成绩引用自 artificialanalysis.ai;FrontierSWE 的 dominance 分数按官方脚本重算,数据截至 2026-07-16。
- 多模态基准除 ZeroBench(官方设置,运行 5 次)外均取 3 次运行平均。PerceptionBench 为官方内部基准,聚焦原子视觉感知能力。
二、3 万亿级开源模型
Kimi K3 是首个达到 2.8 万亿参数规模的开源模型。官方称,在过去 12 个月中的 9 个月里,Kimi 模型都保持着开源模型的规模上限。

Kimi K3 基于 **Kimi Delta Attention(KDA)**和 **Attention Residuals(AttnRes)**构建,这两项架构更新都是为了让信息在更长序列和更深模型中流动得更顺畅。MoE 稀疏度进一步扩大:结合 Stable LatentMoE 框架后,模型在 896 个专家中高效激活 16 个。配合训练方法和数据配方的优化,这些结构性改进让 Kimi K3 相比 K2 的整体扩展效率提升约 2.5 倍。
高亮方块为当前 token 激活的专家,每隔约 2 秒切换一批,模拟新 token 进入时的路由过程。
这一稀疏度下,路由与优化成为关键挑战——官方以 Quantile Balancing 直接按路由分数分位数分配专家。
三、长程编程能力
官方称 Kimi K3 具备很强的长程编码能力:在极少人工监督的情况下,可以持续完成长时间工程任务,理解和处理大型代码库,并协调使用终端工具。它也擅长结合软件工程与视觉推理的任务,能利用截图和视觉反馈优化游戏开发、前端和 CAD 等场景。
Kernel 优化竞技场
官方搭建了一个内核优化竞技场:每个模型在独立的 GPU 沙箱中运行,任务、测试框架和生产负载完全一致,最多 24 小时内分析现有实现、重写内核并反复跑分验证。竞技场包含两种硬件平台、三类内核、四个任务:NVIDIA H200 上的 Attention Residuals、KDA 线性注意力,一个从零实现的 512 头维度 MLA 内核,以及一个在某国产 GPU 上的 KDA 任务。
在最大思考强度下,Kimi K3 的表现接近 Fable 5(含回退机制),并明显领先 Opus 4.8、GPT-5.6 Sol 和 GPT 5.5。以 AttnRes 任务为例,相对 FLA Triton Baseline 的加速比为:Kimi K3 +59.7%、Claude Fable 5 +57.1%、GPT 5.5 +30.8%、GPT 5.6 Sol +17.3%。

官方进一步披露了 AttnRes 任务的细节:
- 任务给定 FLA Triton 实现的 AttnRes 内核及其生产形状(96 层、模型维度 8192、8192 tokens),要求在不改变数值结果的前提下把训练侧算子优化到尽可能快。
- 在连续 15 小时的迭代中,K3 设计了一种新的两阶段(two-phase)内核算法,在保持数值一致的前提下融合内核,把前向 + 反向耗时从 283.6 ms 降至 114.4 ms。K3 与 Fable 5(含潜在回退)最终性能接近,且 K3 每轮迭代的优化速度更快。
- 官方还提到,在 Kimi K3 开发的后期,一个早期版本的 K3 已经承担了团队大部分的内核优化工作。
- 评测说明:Claude Fable 5 由第三方评测,成绩可能包含回退行为;多数模型的部分轨迹包含数值容差范围内的小幅精度捷径。
相对 FLA Triton Baseline 的加速比(最大思考强度)。每个模型在独立 GPU 沙箱中运行,最多 24 小时重写并验证内核。
在保持数值一致的前提下融合内核,耗时降至原来的 40.3%。
* Fable 5 由第三方评测,成绩可能包含回退行为。
GPU 编译器开发:MiniTriton
官方进一步评估了 Kimi K3 能否搭建一个完整的 GPU 编程系统。Kimi K3 从零开发了 MiniTriton:一个轻量级、类似 Triton 的编译器,在 MLIR 之上定义自己的 tile 级中间表示(不依赖 Triton IR),实现了从优化 pass 到 PTX 代码生成的完整流程。
在 roofline 基准测试中,MiniTriton 在当前支持的算子上性能与 Triton 和 torch.compile 持平或更优,在部分负载上超过 Triton。目前支持 FP32 和 FP64 计算,TF32 和 BF16 还在开发中。官方表示,在没有针对 benchmark 走捷径、也没有明显硬编码优化的情况下,MiniTriton 已经能生成有竞争力的 GPU 代码;其从零实现的 Tensor Core 路径已可比肩经过深度优化的 Triton 栈。

作为端到端验证,官方用 TensorLite 训练了 nanoGPT 并观察到稳定收敛,loss 曲线紧贴参考实现、仅有微小偏离——说明 K3 搭起的是一套真正可用的编译器栈:从 DSL 前端、IR pass 到 PTX 代码生成和运行时,以及接入真实训练负载的能力。
创作数字作品
Kimi K3 融合 3D 推理、编程与视觉能力,可将概念、图像和视频转化为可玩的交互体验,并在代码与实时截图之间迭代,实现视觉闭环(vision in the loop)。
官方给出了 4 个演示视频:3D 模拟长征十号火箭发射与回收、3D 开放世界游戏、3D GBA 模拟器、黑洞卡冈图雅复刻。
此外还有 9 个可交互的游戏/创作案例:3D 开放世界、GBA 模拟器、赛博朋克绳索摆荡、打字机、体素斗兽场、格斗游戏、武侠 RPG、FPS 竞技场、黑洞卡冈图雅。
其中重点案例 3D Open World:K3 用 Three.js WebGPU 和 GPU compute 构建了一个完全程序化的浏览器 3D 探索游戏——环境由程序化生成,骑手和马匹模型借助 3D 资产生成工具创建,世界包含森林、木屋村庄、雪山和动态天气(外部素材:带动画的牛仔与马匹模型、地形数据)。




芯片设计
作为早期概念验证,Kimi K3 设计了一款用于运行基于自身架构构建的 nano 模型的芯片。在一次连续 48 小时的自主 Agent 运行中,K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成芯片的构建、优化与验证:
- 面积 4 mm²,集成 146 万个标准单元
- 0.277 MB SRAM,带融合反量化的 INT4 MAC 阵列
- 100 MHz 下完成时序收敛
- 仿真解码吞吐持续超过每秒 8,700 个 token
(该案例演示视频时长 00:22,由接入 Blender MCP 的 Kimi K3 模型生成。)
K3 基于开源 EDA 工具和 Nangate 45nm 工艺库,独立完成芯片的构建、优化与验证——用于运行基于自身架构的 nano 模型。
科研编程
在一个复现计算天体物理中 I-Love-Q 普适关系的案例中,Kimi K3 用约两小时完成了通常需要一名资深研究人员一到两周的工作:阅读并交叉验证 20 多篇论文,实现完整的数值流程,评估 300 多种状态方程,发现已发表公式中的不一致之处,生成 3,000 多行 Python 代码,并产出一个用于探索结果的交互式 HTML 仪表盘(可交互版本:https://coding-science.ok.kimi.link/)。

四、知识工作
除公开基准外,Kimi K3(max)在官方内部评测中也展现出稳定提升。这些评测来自真实用户与智能体协作流程中反复出现的任务模式和挑战。

| 内部知识工作基准 | Kimi K3 | GPT 5.5 | Claude Opus 4.8 |
|---|---|---|---|
| Online Exp Bench | 75.5 | 70.6 | 65.9 |
| DECK-Bench | 73.5 | 68.2 | 66.9 |
| Finance-Bench | 62.6 | 58.4 | 60.7 |
研究及其可视化
官方展示了 Kimi Work 中 K3 在金融咨询和科研场景的三个案例:
推理芯片行业研究:覆盖 ASIC 行业 42 年历史,由 K3 经过 120 多轮递归自我改进生成。过程中完成 2,800 多次网页搜索与抓取、1,100 多次终端数据拉取,处理了 87 份季报和 99 份原始 PDF,合计超过 11,000 页资料。K3 将证据转化为定制图表、动画示意图和交互式视觉叙事。完整交互式报告:https://asic42cn.ok.kimi.link/(中文)、https://asic42.ok.kimi.link/(英文)

可控核聚变产业研究:一份咨询报告风格的行业研究,包含时间线、树状图、瀑布图、甘特图,以及达到发布质量的演示文稿。

GWTC-5 引力波分析:对 391 个引力波事件的分析,使用 20 多个并发 subagents,产出 7 张科学可视化图、2 张表格,并综合了 10 多篇论文的文献内容。

官方还提到,Kimi K3 尤其擅长制作信息图风格的演示材料(infographic-style presentations),并展示了完全可编辑的热力图(heatmap)和年报(annual report)两个示例。
小组件和看板
Kimi Work 推出两个新功能:
- 小组件(Widgets):在对话中直接生成交互式组件,连接本地数据或外部插件,实现持续更新
- 看板(Dashboard):把最关心的小组件汇总到一个长期保留的个性化视图中,围绕某个主题、项目或目标组织
视频剪辑
官方称 Kimi K3 擅长动效设计、动画和视频剪辑,因为它原生的多模态架构可以在同一个模型中理解文字、图像和视频。两个案例:
- K3 制作了一支介绍自己架构的「3Blue1Brown」风格动态图形讲解视频,把技术概念转化为动画图示和转场,时长 4 分半
- K3 用 56 段原始素材剪出了自己的品牌视频,完成选片、动作匹配剪辑、逐帧卡点、音频处理及多轮修改。官方称这类信息密度高的短视频通常需要有经验的剪辑师花 1 到 2 个工作日完成,新手可能需要 3 到 5 天
五、架构与基础设施
Kimi K3 的架构骨架由 KDA 和 AttnRes 构成:KDA 为注意力扩展提供高效基础;AttnRes 不是简单地在各层均匀累积表示,而是有选择地跨深度检索表示。二者共同支持模型扩展到万亿参数以上的规模。

具体技术要点:
- Stable LatentMoE:在 896 个专家中实际激活 16 个。在这一稀疏度下,路由和优化成为关键挑战
- Quantile Balancing:直接根据路由分数的分位数分配专家,避免启发式更新和敏感的平衡超参数
- Per-Head Muon:将 Muon 扩展到按注意力头独立优化,让大规模训练中的学习过程更自适应
- **Sigmoid Tanh Unit(SiTU)**与 Gated MLA:分别增强激活控制和注意力选择性
- 量化感知训练:从 SFT 阶段开始,使用 MXFP4 权重和 MXFP8 激活,以适配更广泛的硬件
- 完全均衡的专家并行训练:避免大规模专家并行中因专家负载不均影响吞吐,使用静态形状,关键路径上不需要主机同步
- 部署建议:推理效率受益于更大的高带宽通信域,官方建议在 64 个或更多加速器组成的 supernode 配置上部署
- vLLM 贡献:KDA 给传统 prefix caching 带来新挑战,官方已向 vLLM 社区贡献对应实现,将随模型一同发布。借助带 prefill cache 的 KDA,即使在大模型规模和长上下文条件下,也能以有竞争力的 token 价格提供服务
更多技术细节将随后续技术报告公布。
六、接入方式与定价
使用渠道:
- Kimi Agents:手机应用商店下载或升级到最新版 Kimi App(支持 iOS、Android、鸿蒙),或直接访问 kimi.com
- Kimi Work:下载最新版桌面客户端(3.1.0 及以上),支持 Windows 和 Apple 芯片 Mac
- Kimi Code:在电脑终端运行,通过
/model命令选择 K3 模型 - Kimi API:开放平台模型选择
kimi-k3
API 定价(每百万 token):
| 项目 | 人民币 | 美元 |
|---|---|---|
| 输入(命中缓存) | 2 元 | $0.30 |
| 输入(未命中缓存) | 20 元 | $3.00 |
| 输出 | 100 元 | $15.00 |
官方称,借助 Mooncake 分离式推理架构,Kimi 官方 API 编程场景的缓存率超过 90%,实际输入价格仅为标准输入价格的 1/4。最高 30% 的充赠活动同步进行中。
开放平台模型名 kimi-k3;高缓存率让实际输入成本显著低于标价。
编程场景缓存率超 90%(Mooncake 分离式推理架构)
借助高缓存率,编程场景实际输入价格仅为标准输入价格的 1/4。
企业与团队:
- Kimi 企业版:支持企业级数据隐私保护、成员管理,个人账号与企业账号数据完全隔离
- Kimi Hosted Agent(即将推出):面向企业的托管 Agent 平台,提供 Agent harness、隔离沙箱和长任务运行环境,目前可加入 Waitlist
开源安排: 官方正与推理合作伙伴和开源维护者协作对齐技术细节,完整模型权重将于 2026 年 7 月 27 日前发布。
七、官方公布的局限性
- 对历史思考内容敏感:Kimi K3 在后训练过程中全程使用思考历史保留模式。如果 agent 框架未按要求回传全部历史思考内容,或从其他模型正在进行的会话中切换到 Kimi K3,可能引发上下文干扰,导致生成质量不稳定。建议使用 Kimi Code 等经过兼容性验证的 Agent 框架,并避免在会话中途切换到 Kimi K3。
- 过于主动:Kimi K3 的训练重点优化了长程、高难任务,在任务执行中遇到小问题或用户意图模糊时,可能会替用户做出非预期的决定。如果希望 agent 更有边界感,需在 system prompt 或 AGENTS.md 中施加更明确的行为约束。
- 与顶级闭源模型仍有差距:尽管 Kimi K3 总体上是一个非常有竞争力的模型,但与 Claude Fable 5 和 GPT-5.6 Sol 相比,在用户体验上仍有一定差距。
参考链接
- 官方发布文章(微信公众号):https://mp.weixin.qq.com/s/V4xhEIy8xDXSMDPrPkmUAQ
- 官方技术博客(英文站):https://www.kimi.com/blog/kimi-k3
- Kimi 官网:https://kimi.com
- Kimi API 开放平台:https://platform.moonshot.ai
- 3D 开放世界游戏(可试玩):https://horseback-open-world.ok.kimi.link
- 黑洞卡冈图雅交互演示:https://blackhole-visualizer.ok.kimi.link/
- I-Love-Q 科研编程交互仪表盘:https://coding-science.ok.kimi.link/
- ASIC 行业研究交互报告:https://asic42cn.ok.kimi.link/(中文)、https://asic42.ok.kimi.link/(英文)
