同一个模型,为什么换个供应商价格差一倍:拆解大模型推理的定价黑盒
在 OpenRouter 上搜 Kimi K2.7 Code,会出来 14 家供应商。同为第三方标准档,DeepInfra 标价 $0.74/$3.50(input/output per 1M tokens),Together 标价 $0.95/$4.00,input 价格差出 28%。模型是同一个,权重是同一份,跑出来的 token 质量在 benchmark 上几乎没有差异,为什么价格会有如此的不同。
这不是 Kimi 独有的现象。DeepSeek V4 Pro、GLM 5.2、Kimi K2.6 全都这样:同一个模型,十几家到三十几家供应商在卖,标牌价能差一倍以上。
我们调研了OpenRouter 75 家供应商的公开定价和性能数据,试图去拆解这个价差从哪来。
先分清两个价格:标牌价 vs 实际成交价
OpenRouter 上每个模型每个供应商都有两个价。
标牌价(list price) 是供应商挂出来的 input/output 单价,就是你打开模型详情页看到的那张表。比如 GLM 5.2 上 DeepInfra 的标牌价是 $0.93/$3.00,Wafer Fast 是 $3.00/$10.25。
实际成交价(effective pricing) 是 OpenRouter 统计的过去 30 天加权均价,已经扣除 prompt caching 折扣后的真实付款。这个数字才是用户实际掏的钱。
两者的差距可以非常大。DeepSeek V4 Pro 的标牌均价是 $0.435/$0.87,实际成交均价是 $0.225/$1.87。input 便宜了 48%,output 反而贵了 115%。这个反差背后是 prompt caching 的命中率:DeepSeek 官方端点的 cache hit rate 达到 86.2%,把 input 实际付款压到 $0.063,但 output 不享受缓存折扣,而大量流量流向了 output 报价更高的第三方供应商,拉高了加权 output 均价。
所以理解价差,要同时看标牌价和实际成交价。标牌价反映供应商的"报价策略",实际成交价反映用户真正的成本体验。

价差的四个来源
把 75 家供应商的数据摊开看,价格差异主要来自四个变量。
1. GPU 成本:硬件采购决定地板价
推理成本的大头是 GPU。同一个模型跑在不同 GPU 上,单 token 成本可以差几倍。供应商公开的 GPU 实例价格能直接看出这个差距:
| GPU 型号 | DeepInfra | Together | Fireworks |
|---|---|---|---|
| H100 80GB | $2.20/hr | $3.99/hr | $7.00/hr |
| B200 | $3.69/hr | $8.19/hr | $10.00/hr |
同样是 H100,Fireworks 的单价是 DeepInfra 的 3.2 倍。这直接决定了 Fireworks 上 DeepSeek V4 Pro 的标牌价($1.74/$3.48)是 DeepInfra($1.30/$2.60)的 1.3 倍。GPU 成本的差异大部分转嫁到了 token 价格上。

NovitaAI 走的是另一条路:用消费级 GPU(RTX 4090/5090)替代数据中心卡。它的 RTX 4090 按需只要 $0.33/hr,竞价实例 $0.17/hr,是 H100 价格的 1/10。这是 NovitaAI 能成为 OpenRouter 流量第一供应商(日 1.3T tokens)的成本基础:消费级显卡堆出来的低价推理。代价是稳定性和吞吐上限:RTX 4090 只有 24GB 显存,跑千亿参数模型需要更多卡做张量并行,延迟和故障率都会上升。
底层基础设施的类型也会影响成本结构:
- 自建集群(DeepSeek、Z.ai、Moonshot、阿里云):前期 capex 重,但边际成本可控,能定到全网最低。DeepSeek V4 Pro 官方 output $0.87,比第三方最低的 StreamLake($1.496)还便宜 40%。
- 第三方推理云(Together、Fireworks、DeepInfra):三家都不造模型、只卖推理,但底层硬件的持有方式差别很大。DeepInfra 走最重资产路线,自购 B300/H100 并在自有美国数据中心运营,官网明确写 "Our Hardware. Our Data Centers",所以它的 H100 能压到 $2.20/hr。Together 是混合模式,部分容量从 Crusoe 这类第三方数据中心租赁,$3.99/hr 反映的是中档批发价。Fireworks 更接近跨云编排层,通过 AWS/GCP 及合作伙伴调度算力,单价最高(H100 $7.00/hr)。
- 聚合消费级算力(NovitaAI、io.net):把分散的消费级 GPU 池化,单价最低但一致性差。NovitaAI 还允许用户供应自己的 GPU 赚奖励,供给侧也做了众包。
- 优化栈转售(Decart、ModelRun):不自研模型也不卖 GPU,靠自研推理优化引擎压低单位成本,再以 API 形式转售。Decart 拿了 NVIDIA 的投资,优化栈跨 NVIDIA/Trainium/TPU 三平台。
2. 推理引擎:软件优化拉开吞吐差距
同样的 GPU,跑同样的模型,吞吐可以差 5-10 倍。这是供应商真正比技术的地方:来自推理引擎的差距。
主流推理引擎有四五个:vLLM(开源,最普及)、SGLang(开源,长序列和多轮对话优化)、TensorRT-LLM(NVIDIA 官方,闭源但性能强)、TGI(HuggingFace,易用但性能一般),以及各家自研引擎。这些引擎的核心优化技术决定了单位时间能产出多少 token:
- Continuous batching(连续批处理):把不同请求的 token 动态拼成 batch,GPU 利用率从 30% 提到 80%+。几乎所有现代引擎都支持,但实现质量有差异。
- PagedAttention / KV cache 管理:把显存当虚拟内存管理,减少碎片。vLLM 的核心贡献就是这项,直接把可服务的并发请求数翻倍。
- 量化(quantization):把模型权重从 FP16 压到 INT8 或更低,显存占用减半,吞吐提升但精度有损。供应商通常不公开量化策略,但 benchmark 分数能侧面反映:量化激进的供应商 GPQA 分数会低 1-3 个点。
- Speculative decoding(投机解码):用一个小模型先猜,大模型只验证,吞吐能提升 2-3 倍。对延迟敏感的场景效果显著。
ModelRun 是软件优化拉开差距的典型案例。它在 Kimi K2.7 Code 上做到了 211 tok/s 的吞吐、0.28s 的延迟,第二名 Together 是 137 tok/s。同样是跑 Kimi K2.7 Code,ModelRun 的单位 token GPU 成本大约只有 Together 的 1/3。它的标牌价($0.92/$4.00)不是最低,但性能/价格比极高。ModelRun 的官网无法访问,技术栈完全不公开,从性能数据反推,大概率用了自研推理引擎加激进的 batching 策略。
Fireworks 官方宣称自己的推理引擎比开源引擎吞吐高 250%、速度快 50%,定价上直接对标。它提供 "Fast" 高速档(Fireworks Fast),GLM 5.2 的 Fast 版卖 $2.10/$6.60,是标准档的 1.5 倍。Wafer 也有类似的 Fast 档,卖到 $3.00/$10.25。这是"用加价换性能"的明牌策略。
Together 的路径是自研引擎 + 全栈产品线。它的 Dedicated Inference 宣称在 coding agent 工作负载上 TPS 比开源引擎高 31%,并且提供从 Serverless 到 PTU(预留吞吐量)到 Dedicated GPU 到训练集群的完整产品线,覆盖从尝鲜到大规模生产的全场景。产品线完整度是它能在多个模型上稳定出现在中高档定价的原因。

3. Prompt caching:实际成本的核心变量
同一个供应商、同一个模型,实际付款可以比标牌价低 60-80%,这个价格差全靠 prompt caching。
Prompt caching 的机制是:如果多个请求的 prompt 前缀相同(比如都带同一段 system prompt 或相同的上下文),供应商把这段前缀的 KV cache 存下来,后续请求只付一个极低的 "cache read" 价,不用重新计算。DeepSeek 官方的 cache read 价是 $0.003625/M tokens,比 cache miss($0.435)便宜 120 倍。
各家供应商的 cache hit rate 差异巨大,直接决定了实际成交价:
| 供应商(DeepSeek V4 Pro) | Cache hit rate | 实际成交 input | 标牌 input |
|---|---|---|---|
| DeepSeek 官方 | 86.2% | $0.063 | $0.435 |
| StreamLake | 80.7% | $0.194 | $0.748 |
| NovitaAI | 84.8% | $0.351 | $1.568 |
| Baidu Qianfan | 9.7% | $0.693 | $0.761 |
| DeepInfra | 16.3% | $1.10 | $1.30 |

DeepSeek 官方靠 86% 的缓存命中率,把实际 input 成本压到了标牌价的 14%。Baidu Qianfan 的 cache hit 只有 9.7%。它的标牌价($0.76)看起来比 NovitaAI($1.57)便宜一半,但实际成交价($0.693 vs $0.351)反而是 NovitaAI 的两倍。
Cache hit rate 的高低取决于两个因素:一是供应商是否实现了 caching(技术能力),二是用户的请求模式是否有利于缓存(业务特征)。Coding agent 场景天然适合 caching,每轮对话都带着完整的代码上下文,前缀高度重复。这也是为什么 Kimi K2.7 Code 上各供应商的 cache hit 普遍在 80%+,而通用对话场景的 hit rate 更低。
一个最直接的案例:Moonshot AI Highspeed 标牌价 $1.90/$8.00,是 K2.7 Code 最贵的供应商。但它的 cache hit rate 高达 95.9%,实际成交 input 只有 $0.443,比标牌价便宜了 77%,甚至比不少“便宜”供应商的实际成交价还低。它走的是“高标价 + 高缓存命中率”路线,赚的是高频重复请求用户的钱。
4. 定价策略:低价走量 vs 高价高利润
同样成本结构的供应商,定价策略不同,价格也会不同。供应商的定价选择大致分三类。
低价走量型:把价格压到成本线附近,靠规模效应摊薄固定成本。DeepSeek 官方是典型。它背靠幻方量化的资金,不以 API 收入为主要盈利目标,V4 Pro 的官方 output $0.87 是全网最低,直接拿走了 43.5% 的 token 份额。DeepInfra 走类似路线,85 个模型全行业最多,H100 价格全网最低档,靠薄利多销吃下跨模型的流量。这两家赚的是周转率,不是单价。
高价服务型:卖的不只是 token,还有稳定性、合规、延迟保证、企业级支持。Together(SOC 2/HIPAA 合规)、Fireworks(ZDR/Audit Logs/SSO)、Weights & Biases(MLOps 集成 + CoreWeave 底层)的定价都比 DeepInfra 高 30-50%,但它们的客户是企业,愿意为合规背书和 SLA 买单。这类供应商的定价锚点不在 GPU 成本,在“自建同等能力的总成本”。
高速档溢价型:把同一个模型拆成标准版和高速版,高速版加价 50-100%。Fireworks Fast、Wafer Fast、Moonshot Highspeed 都是这种。加价的理由是更低的延迟和更高的吞吐,但从数据看溢价往往高于性能提升幅度。GLM 5.2 的 Fireworks Fast($2.10/$6.60)比标准版贵 50%,但吞吐只从 38 tps 提到 60 tps(+58%),延迟反而从 1.72s 升到 1.02s。除非业务对延迟极度敏感,否则高速档的性价比存疑。
官方端点 vs 第三方:一场流量博弈
理解了价差来源,再来看一个结构性现象:除了 DeepSeek,几乎所有模型的官方端点都不是流量第一。
| 模型 | 官方端点 | 官方份额 | 流量第一供应商 | 其份额 |
|---|---|---|---|---|
| DeepSeek V4 Pro | DeepSeek | 43.5% | DeepSeek | 43.5% |
| GLM 5.2 | Z.ai | 6.8% | NovitaAI | 36.6% |
| Kimi K2.6 | Moonshot AI | 16.2% | Decart | 32.4% |
| Kimi K2.7 Code | Moonshot AI | 2.9% | Ambient | 50.0% |

DeepSeek 是唯一一个官方端点稳坐流量第一的模型。原因前面说了:它的标牌价全网最低,cache hit rate 最高,实际成交价没有第三方能打。官方端点在“价格屠夫”策略下直接吃掉了 43.5% 的份额,加上 StreamLake(25.8%)和 NovitaAI(19.3%),前三家占 89%。
GLM 5.2 是另一个极端。Z.ai 官方端点只拿了 6.8%,流量被 NovitaAI(36.6%)和 Alibaba Cloud Int.(35.1%)两家几乎平分。Z.ai 的标牌价($1.40/$4.40)在 GLM 5.2 的供应商里只排中游,延迟偏高(5.64s),吞吐中等(23 tps),cache hit rate 虽然有 89.2%,但总性价比拼不过 NovitaAI(30% off 后 $0.98/$3.08,cache hit 81.7%)。官方端点在性能和价格上都没有绝对优势,流量自然流向第三方。
Kimi 两代模型的对比也很有趣。K2.6 的 Moonshot 官方拿了 16.2%(流量第二),K2.7 Code 只拿了 2.9%(流量第六)。K2.7 Code 是 2026-06-12 发布的新模型,官方产能还在爬坡,流量被 Ambient(50%)和 Together(10.2%)抢走。新模型上线初期,官方端点产能跟不上,第三方趁虚而入,这个模式在 Kimi 两代产品上重复上演。

五类供应商的商业模式
把 75 家供应商按商业模式分类,能看出几条清晰的路线。

模型开发商(官方端点):DeepSeek、Z.ai、Moonshot、Anthropic、OpenAI。只卖自研模型,定价权在自己手里。优势是价格可以定到全网最低(DeepSeek),劣势是产能爬坡慢,新模型初期流量容易被抢。
跨生态聚合平台:NovitaAI、DeepInfra、SiliconFlow、Parasail。托管几十到上百个模型,覆盖 DeepSeek + Qwen + GLM + Kimi + Llama + Gemini,靠“什么都有 + 便宜”吃流量。NovitaAI 是流量王者(日 1.3T tokens,OpenRouter 第一),DeepInfra 模型数最多(85 个)。这类供应商的壁垒是规模:模型越多、流量越大,单位 GPU 成本越低。
高性能推理专精:ModelRun、Decart、Fireworks。模型少(2-7 个),但靠推理引擎优化把吞吐拉到极致。ModelRun 在 Kimi K2.7 Code 上做到 211 t/s 断崖领先,Decart 拿走 Kimi K2.6 的 32.4% 流量。它们的壁垒是技术:自研引擎的吞吐优势直接转化为价格优势。
大厂云:Alibaba Cloud、Amazon Bedrock、Google Vertex、Azure。产品线最全(IaaS + PaaS + AI),合规和企业客户关系最深,但定价不是最低档。
MLOps 延伸:Weights & Biases。主业是实验追踪,Inference 是新增业务,底层用 CoreWeave 的 GPU。卖点不在价格(和 Together/Fireworks 同档),在推理自带追踪和评估,适合需要可观测性的团队。
怎么选供应商
根据调研的结果数据,在选型可以做这样几个判断:
追求最低成本:看 cache hit rate,而不是标牌价。DeepSeek V4 Pro 选 DeepSeek 官方(实际成交 $0.063/$0.87,cache hit 86%),Kimi K2.6 选 Decart($0.272/$3.41,cache hit 75%),Kimi K2.7 Code 选 DeepInfra($0.223/$3.50,cache hit 87.7%),GLM 5.2 选 NovitaAI($0.331/$3.20,cache hit 81.7%)。
追求极致速度:Kimi 系列选 ModelRun(K2.7 Code 211 t/s,K2.6 也排前三)。通用模型选 Together 或 Weights & Biases(吞吐稳定,延迟低)。但要注意,高速供应商的标牌价通常高 20-30%,只有当延迟直接影响业务(比如实时编程助手、对话机器人)时才值得。
追求稳定可靠:看 uptime。避开 Fireworks(DeepSeek V4 Pro 上 uptime 31.71%,明显异常)、Cloudflare(GLM 5.2 延迟 13.63s)、DigitalOcean(K2.6 uptime 76%)。DeepInfra 在多个模型上 uptime 接近 100%,是“稳定 + 便宜”的少数组合。
避开陷阱:标牌价最低的供应商不一定是实际最便宜的。Baidu Qianfan 的 DeepSeek V4 Pro 标牌 $0.76 看起来便宜,但 cache hit 只有 9.7%,实际成交 $0.693,比 NovitaAI(标牌 $1.57,实际 $0.351)贵一倍。选之前看 effective pricing,别看 list price。
做几个判断
从以上的数据中可以整理出一些判断:
第一,价格差异不是随机的,是成本结构和策略选择叠加出来的。GPU 采购价决定了地板价,推理引擎优化决定了天花板,prompt caching 决定了实际成交价和标牌价的偏离度,定价策略决定了供应商在“低价走量”和“高价服务”之间的站位。同一个模型在不同供应商价格不同,本质上是这四个变量的组合不同。
第二,prompt caching 是降本的最大杠杆。实际成交价比标牌价低 50%+ 全靠它。cache hit rate 高的供应商(85%+),实际付款远低于标牌;cache hit 低的供应商,标牌价便宜也省不了多少。选供应商时,cache hit rate 比标牌价更值得关注,而大多数用户在选型时根本不看这个数字。
第三,官方端点的优势在弱化。除了 DeepSeek 靠极致低价守住 43.5% 份额,其他模型的官方端点都不是流量第一。第三方供应商靠更低的 GPU 成本、更好的推理引擎、更高的 cache hit rate,在多数场景下能提供比官方端点更好的性价比。这个趋势在 GLM 5.2 上最明显:Z.ai 官方只拿 6.8%,前两名第三方拿了 71%。
第四,供应商生态在快速轮换。Kimi K2.6 的流量第一是 Decart(32.4%),K2.7 Code 换成了 Ambient(50%),两家完全不同。新模型上线初期,谁先拿到产能、谁先优化好引擎,谁就吃下早期流量。“最佳供应商”的答案不是固定的,它随模型版本、上线时间和供应商的优化进度而变化。
总结
把 75 家供应商、四个热门模型的数据展开看:这个市场价格走低,靠的是结构性因素,不是促销手段。prompt caching 把实际 input 成本压到标牌价的一半,推理引擎优化让同一张 GPU 挤出更多 token——这两件事背后是真实的技术效率提升,不是烧钱补贴,所以不会明天反弹。
与此同时,竞争也在激烈地展开:除了 DeepSeek,官方端点都不是流量第一,供应商排名几个月就能整个洗牌(Kimi K2.6 的 Decart 换成 K2.7 Code 的 Ambient),没有谁靠先发优势锁死市场。
对使用者来说,这意味着选供应商不必追求一个“永远正确”的答案。每隔一个月回头看一眼 effective pricing 和 cache hit rate,我们只需要看数据,选择那个对我们成本最佳的方案。

