从 Kimi K3 的 vLLM 配置说起——那些参数到底在控制什么2026年7月28日以 Kimi K3(2.8T MoE 模型)的 vLLM 部署 recipe 为例,逐一拆解 Hardware、Strategy、KV Offload、P/D 分离等参数的实际作用、适用场景和常见误解。
为什么 AI 不只吃算力,还吃内存:训练、推理和缓存讲明白2026年7月14日同一个大模型,训练时可能需要上百 GB 显存,推理时却能在一张 24GB 显存的 GPU 上运行。差别不只在算力,更在内存里要放什么、数据能多快送到 GPU。这篇从 HBM、主机内存和 SSD 讲起,解释训练、推理和缓存价格背后的机制。