摘要:英伟达研究团队提出KV缓存跨模型迁移方法,让目标模型直接复用源模型缓存、跳过预填充。Qwen3 14B32B实测中,转换仅需0.28秒(原7秒),提速25倍。适用同一家族密集全注意力架构,为LLM服务缓存复用打开新空间。

每次切换模型都要重新处理一遍上下文,这种“重复造轮子”的算力浪费,正在被英伟达的一项新技术终结。

8月初,英伟达研究团队在arXiv上提交了一篇论文(arXiv:2608.03893v1),提出了一种让KV缓存在不同模型之间迁移的方法。目标模型可以直接跳过预填充阶段,转换速度比重新处理上下文快2.7到25倍。

KV缓存是什么?为什么它“一次一模型”?

用过ChatGPT或Claude的人都有这个体感:第一个词的生成总是明显更慢,后面的内容几乎是瞬间涌出。

这不是偶然。模型在生成第一个词之前,需要处理整个输入上下文,把中间结果存储为KV缓存。之后的每个词都可以复用这些缓存,所以速度快得多。

问题在于,KV缓存一直是“一次一模型”的。如果你切换到另一个模型,或者升级了模型版本,之前计算好的缓存就全废了。新模型必须从头开始处理整个上下文。对于长文本场景——比如几十万token的对话或文档——这意味着大量的重复计算和时间浪费。

随着AI应用从单次问答走向长程Agent和复杂工作流,模型切换越来越频繁。小模型处理日常任务、大模型处理复杂推理,这种“级联”架构正在成为主流。但每次切换都要重新预填充,成本和延迟都在叠加。

英伟达的解法:闭式线性映射

英伟达团队发现,同一家族中不同规模的模型,其KV缓存之间存在明显的线性结构。

在Qwen3 14B到32B的测试中,单个源层就能解释目标层keys方差的56%和values方差的32%;组合多个源层后,这个比例分别上升到79%和65%。

基于这个发现,团队设计了一个闭式岭回归映射器,分三步工作:

第一步,为每个目标层选择最具预测性的源层,拼接它们的KV作为输入。第二步,在映射前剥离RoPE旋转位置编码,确保映射与位置无关、可跨上下文长度复用。第三步,仅用500段各1024 token的校准序列拟合映射。

整个过程无需梯度下降、无需反向传播,是一个闭式解。

实测数据:0.28秒 vs 7秒

最直观的数据来自Qwen3系列的实测。在3.2万token的上下文长度下,从Qwen3-14B切换到Qwen3-32B时:

重新预填充:约7秒

KV缓存转换:约0.28秒

速度提升了25倍。在六个模型对(涵盖Qwen3、Llama 3.1和Ministral三个家族)的测试中,转换速度提升在2.7倍到25倍之间。

精度方面,在四个测试对上保留了目标模型73%到98%的基准准确率。

更深层的变化:缓存从“模型专属”变成“可移植资产”

这项技术的影响不止于提速。

对成本的影响。当前LLM API的使用成本中,相当一部分来自上下文处理,尤其是长对话和长文档场景。如果KV缓存可以在模型之间迁移,用户在切换模型时就不必承担重复计算的成本,模型升级时也不必丢弃已有的对话上下文。提示缓存带来的高达90%的输入成本降低,现在可以扩展到异构模型集群。

对架构的影响。未来可以先用小模型处理长上下文、计算KV缓存;当真正需要更强能力时,将缓存转移给大模型,大模型直接开始生成。Agent可以用低成本模型长期维护上下文,只在面对真正挑战时才唤醒大模型,无需每次都从头开始。

对路由的影响。LLM服务商可以实施动态模型路由,而无需丢弃累积的KV缓存。企业在成本优化模型和能力优化模型之间切换工作负载时,可以保留大部分预填充的计算投资。

边界与局限

当然,这项技术并非万能。当前结果仅适用于同一模型家族内、KV头数和维度匹配的密集全注意力架构。跨家族转移、不匹配KV头配置、滑动窗口和循环混合架构,仍在当前范围之外。

但即便如此,这项研究已经足够改变AI推理基础设施的设计逻辑。缓存不再是绑定在某个模型上的“一次性用品”,而是一种可以在模型之间流动的资产。

当DeepSeek、Kimi们在“砍缓存”上做到极致时,英伟达选择了一条不同的路——让缓存学会“串门”。前者解决的是“缓存太大”的问题,后者解决的是“缓存只能用一次”的问题。两条路并行,AI推理的效率天花板正在被重新定义。