跨模型复用 KV Cache:如何复用 Prefill 结果

简介: NVIDIA提出跨模型KV Cache映射技术,通过线性转换复用小模型生成的缓存,使大模型跳过重复Prefill,加速2.7–25倍;实验证明误差在注意力敏感方向的影响远大于整体重建精度,为高效低成本模型切换提供新范式。

现在,越来越多的 Coding Agent 开始采用大模型搭配小模型的方式:先让小模型处理普通问题,再把复杂问题交给大模型。或者是在任务变简单后切回小模型,以便节省成本。

模型虽然能切换,但是对话历史不能丢。模型切换时,新模型通常要把完整上下文重新跑一遍 Prefill,重新生成自己的 KV Cache。上下文越长、接收模型越大,这笔重复计算就越贵。

NVIDIA 在论文提出了一个思路:不要让目标模型重新读取全部历史,而是把源模型已有的 KV Cache 转换成目标模型能使用的格式。在 NVIDIA 设计的实验中,一套闭式求解的线性映射,在表现最好的四组模型上保留了目标模型 73%~98% 的平均任务准确率,同时比重新 Prefill 快 2.7~25 倍。

但这项工作的真正价值不只是“线性回归也能做 KV 转换”。论文的核心结论是 KV 的整体重建误差并不能决定模型切换后是否好用,误差落在注意力真正敏感的方向上,才是关键。

为什么模型切换会重复付费

大模型生成分为 Prefill 和 Decode(解码)两个阶段。Prefill 阶段,模型会并行处理输入上下文,并在每一层保存 Key 和 Value,形成后续解码阶段所需反复读取的 KV Cache;进入 Decode 阶段,模型开始逐 token 生成内容,并持续更新 Cache。

对于同一个模型,已有的 KV Cache 可以通过前缀缓存继续复用,但不同模型的内部表示并不一致。即使 Qwen3 14B 和 Qwen3 32B 使用相同的 tokenizer,它们的层数、隐藏维度和表示空间也存在差异,因此 14B 生成的 KV Cache 无法直接交给 32B 使用。

所以,先前的模型切换流程中,源模型虽然为历史上下文执行过一次 Prefill,但目标模型接手后还是要对同一段上下文重新执行一次 Prefill。论文将这个问题转化为一个表示映射问题:如果能够学习一组映射关系,把源模型生成的 Cache 转换成目标模型期望的 Cache,目标模型就可以跳过这次重复的 Prefill,直接进入 Decode。

图 1:“源模型 Prefill → KV 映射 → 目标模型直接 Decode”的整体流程

这种转换具有方向性。小模型切换到大模型,可以提升处理复杂任务的能力;大模型切回小模型,则有助于降低推理成本。由于两个方向对应的表示转换关系不同,因此需要分别拟合各自的映射器。

同家族模型间的 KV 线性对应关系

在设计映射器之前,要先验证一个基础问题:源模型某一层的 KV**,是否能通过线性回归预测目标模型某一层的 KV?**如果这种线性关系本身就足够稳定,跨模型 KV 转换就没有必要一开始就依赖复杂的神经网络。

以 Qwen3 14B→32B 为例,只使用一个源层时,Key 的平均 R² 可以达到 56%,Value 为 32%;组合多个源层后,两者分别提升到 79% 和 65%。进一步观察源层与目标层两两拟合的热力图,还能看到明显的对角结构:目标模型的浅层通常更容易由源模型的浅层预测,深层之间也表现出更强的对应关系。

图 2:三组热力图分别展示原始 Key、移除 RoPE 后的 Key 和 Value 在源层—目标层之间的线性拟合 R²

这些结果说明,同一家族模型的 KV 表示之间确实存在可利用的线性关系,但这种对应并不等同于简单的逐层对齐。一个目标层往往需要综合多个源层的信息。在 Qwen3 14B→32B 上,源层数量从 1 个增加到 4 个时提升最明显,增加到 6 个后,效果已经接近使用全部源层。这也为后续的 Top-k 源层选择 提供了依据:相比固定绑定单一源层,从多个相关源层中提取信息更有效。

另一个明显现象是,Key 通常比 Value 更容易进行线性预测,两者的 R² 往往相差约 0.2。这说明 Key 和 Value 的跨模型可迁移程度并不一致,仅凭 Key 的高拟合度,还不足以判断整套 KV Cache 是否能够稳定迁移。

图 3:源层数量 k 增加时 Key 和 Value 的 R² 变化

跨模型 KV 映射器的核心设计

在确认同一家族模型的 KV 之间存在可利用的线性关系后,论文进一步设计了一套跨模型映射器。整个方法可以拆成三个关键步骤:跨层选择源信息、逐头**拟合 KV 映射,以及将 RoPE 从映射过程中解耦。**

目标层的 Top-k 源层选择

对于目标模型的每一层,作者会先评估各个源层的预测能力,从中选出 Top-k 个最相关的源层,再将这些源层中所有 KV Head 的特征拼接起来,作为当前目标层的映射输入。

这里的 k 并不是全局固定值,而是针对不同模型组合分别选择。候选值包括 1、2、4、6、8、10、12、16、20、24,以及全部源层。例如,Qwen3 14B→32B 最终选择 k=8,Llama 3.1 8B→70B 则选择 k=20。

这一设计与前面的实验结果一致:不同规模模型之间并不存在严格的一一逐层对应关系,一个目标层所需的信息往往分散在多个源层中。因此,相比固定绑定某一个源层,从多个相关源层中共同提取信息更有效。

KV Head 的独立岭回归

确定源层之后,论文会针对目标模型的每一层、每一个 KV Head,分别为 Key 和 Value 拟合独立的线性映射。设拼接后的源特征为 X,目标模型对应的 KV 为 Y,映射权重通过岭回归直接求解:

$$W^* = (X^T X + \lambda I)^{-1} X^T Y$$

其中,论文将正则化系数设为 λ=0.01。

引入正则项主要是为了提高求解的稳定性。由于多个源层的特征高度相关,$$X^T$$ 可能接近奇异矩阵,加入岭回归正则后,可以让矩阵求逆更加稳定。

论文将这种方法称为 “training-free”。它不需要反向传播,也不需要经过多轮梯度更新来训练参数,但仍然需要校准和拟合。每组模型都要先准备一套校准数据,收集源模型和目标模型的 KV,再完成矩阵统计和闭式求解。

图 4:展示了 Top-k 源层拼接,以及 Key、Value 逐头岭回归的映射架构

RoPE 与内容表示的解耦

Key 的映射还需要单独处理位置编码。经过 RoPE 后,Key 中同时包含内容表示和位置信息。如果直接对已经施加 RoPE 的 Key 进行拟合,映射器就容易与校准数据中的位置分布绑定,进而影响更长上下文下的泛化能力。

因此,需要将 RoPE 从映射过程中解耦。先对源模型的 Key 施加逆旋转,移除源模型的 RoPE;再在与位置无关的内容空间中完成线性映射;最后为映射结果施加目标模型自己的 RoPE。由于 RoPE 本质上是正交旋转,可以精确求逆,额外计算成本也比较低。Value 不包含这类位置编码,因此可以直接映射。

短上下文实验中,训练和推理阶段都保留 RoPE 的“耦合版本”,效果与完整方案较为接近。将 RoPE 单独拆开后,主要收益体现在长度和位置泛化上:映射器不再与 1024 token 的校准长度强绑定,因此更容易扩展到 32K 上下文,而不是单纯提升短上下文下的任务表现。

实验设置与主要结果

论文在三个模型家族上测试了六组从小模型到大模型的 KV Cache 迁移,包括 Qwen3 14B→32B、8B→32B,Llama 3.1 8B→70B,以及 Ministral 3 3B→8B、3B→14B、8B→14B。

这些模型组合有一个共同前提:源模型和目标模型都使用 8 个 KV Head,每个 Head 的维度均为 128,论文将其称为 matched-KV。模型之间可以拥有不同的层数和参数规模,但实验还没有覆盖 KV Head 数量或单个 Head 维度不同的情况。

映射器使用 500 条 FineWeb-Edu 序列进行校准,每条长度为 1024 token,并以 stride=4 下采样,最终每个目标 Head 获得约 12.8 万个 token 级观测。前向计算采用 bfloat16,协方差统计使用 float32;所有拟合和评测均运行在单台 8×H100 节点上,每组映射器的拟合时间约为 47~87 分钟。

下游评测覆盖 ARC-Challenge、HellaSwag、WinoGrande、MMLU 5-shot、GSM8K 8-shot,以及 WikiText-2 条件困惑度,多轮模型切换则使用 CoQA。这里主要使用 retention(保留率) 衡量迁移效果,即“迁移后的任务准确率 ÷ 目标模型独立运行时的准确率”。同时还报告了扣除随机猜测下限后的 floor-normalized retention,用来避免模型接近随机水平时,仍得到看起来偏高的保留率。

图 5:跨模型 KV Cache 迁移的模型组合与评测基准

最终六组模型的表现差异明显,平均准确率保留率从 41.6% 到 97.6% 不等。其中四组模型保持了较好的迁移效果,两组 Ministral 组合则出现明显下降。

图 6:六组跨模型 KV Cache 迁移的平均保留率

表现最好的 Qwen3 14B→32B,在五项准确率任务上的保留率分别达到 101.0%、97.6%、98.5%、95.0% 和 95.6%。其中 ARC-C 略高于 100%,主要是由于有限样本评测带来的波动,并不代表 KV 映射进一步提升了模型本身的能力。

Llama 3.1 8B→70B 则展示了另一种情况。两个模型的参数规模相差约 8.8 倍,HellaSwag 仍能保留 94.4% 的表现,但 GSM8K 只剩 18.2%。这说明 KV 迁移对不同能力的影响并不均匀:常识补全任务仍能保持稳定,多步数学推理却可能出现明显退化。

为了验证这种“成功组和失败组”的分层是否来自 k 的选择,论文还加入了 PIQA、BoolQ 和 ARC-Easy 三个没有参与 k 选择的任务。四组表现较好的模型在这三个任务上的平均保留率依然超过 96%,两组表现较差的 Ministral 组合仍低于 64%。这说明前面的分层现象具有一定稳定性,并非单纯来自对报告任务选择 k 带来的偏差。

消融实验

消融实验首先验证了跨层选源的重要性。在 Qwen3 14B→32B 上,将 k 从 8 降到 1 后,Key 的 R² 从 0.79 降到 0.56。完整方案在 HellaSwag 上得到 80.70,同时去掉 RoPE 分离和跨层选择后只剩 44.81;MMLU 从 78.09 降到 26.07,GSM8K 更是从 90.98 降到 0.38。

不过,RoPE 消融需要区分具体情况。如果训练和推理阶段都保留 RoPE,短上下文结果与完整方案基本接近。真正让 MMLU 和 GSM8K 接近随机水平的,是在内容空间完成拟合后,推理时没有重新施加目标模型的 RoPE,导致训练和推理使用了不同的位置空间。因此,RoPE 解耦的主要作用仍然是保证位置和长度泛化。

校准数据的规模则相对不敏感。FineWeb-Edu 序列从 500 条减少到 50 条时,HellaSwag 仅下降约 1.64 个百分点,增加到 200 条后收益已经趋于平缓。相比数量,校准数据的领域影响更明显:换成 CodeAlpaca 后,HellaSwag 下降 5.24 个百分点,而 Wikipedia 只下降 1.05 个百分点。

图 7:消融数据表

这些实验解释了映射器的设计选择,却还不能回答一个更关键的问题:为什么有些模型的 KV 明明拟合得很好,迁移后的模型表现仍然很差?

直觉上,映射后的 KV 与目标模型真实 KV 越接近,迁移效果应该越好,因此 R² 很容易被用来衡量映射质量。但实验并没有表现出这样的关系。Llama 3.1 8B→70B 和 Ministral 3B→8B 在校准集上的 Key R² 都达到 0.84,前者小模型切换到大模型时 HellaSwag 保留率约为 94%,反向切换后却只有约 37%;Ministral 3B 与 8B 两个方向则都保持在约 93%。相同的重建分数,对应了完全不同的下游表现。

原因在于 Attention 并不会同等使用 KV 中的所有信息。Query 会选择性读取 Key,再根据得到的权重聚合 Value。因此,一个数值上很小的误差,如果恰好落在 Query 最敏感的方向上,可能造成明显影响;大量落在低敏感方向的误差,对最终行为的影响反而有限。

基于这一发现,作者直接比较了“映射 KV 产生的 Attention Output”和“真实 KV 产生的 Attention Output”的余弦相似度。在 12 个双向迁移组合上,这一指标与 HellaSwag 保留率的 Pearson 相关系数达到 +0.57,而校准集 Key R² 的相关系数只有 -0.20。

论文还定义了“误差集中度”:如果 Key 的误差集中在目标 Query 矩阵的高奇异值方向,或者 Value 的误差集中在注意力权重较高的位置,这些误差就更容易影响最终输出。衡量映射效果时,除了“错了多少”,还需要关注“错在了哪里”。

图 8:R²、HellaSwag 保留率、误差集中度和注意力输出余弦的变化

MLP 实验进一步验证了这一点。作者使用两层、每层 1024 个 ReLU 单元的 MLP 替换逐头岭回归。在表现较好的 Qwen3 14B→32B 和 Ministral 3B→8B 上,HellaSwag 分别下降 0.3 和 1.5 个百分点;但在两组线性映射失败的 Ministral 组合上,保留率分别提高 24.3 和 36.8 个百分点,最终都超过 90%。

这说明,当跨模型关系接近线性时,岭回归就足够;在更困难的模型组合上,MLP 可以调整误差在表示空间中的分布,从而改善下游表现。不过,目前 MLP 的恢复结果主要在 HellaSwag 上验证,还没有像主实验一样完整覆盖五项准确率任务,因此暂时还不能推断它能够普遍解决困难模型对。

多轮切换、延迟与部署边界

对于 Agent 场景,一次模型切换能够保持效果还不够,连续切换后是否会积累误差同样重要。

论文在 CoQA 的 100 段对话上测试了 Qwen3 14B↔32B 的双向多轮切换,每段对话约 15 轮,并报告前 10 轮的结果。小模型切换到大模型时,第 1 轮到第 10 轮的差距只扩大约 1.7 个百分点,而且主要来自 32B 独立运行上限的提高;大模型切回小模型时,误差大约以每轮 0.33 个百分点增加。十轮内没有出现明显的级联崩溃,但如果这一趋势持续到更长的 Agent 会话中,误差仍然可能逐步累积。

图 9:多轮实验

此外,延迟上的收益更直接。以 Qwen3 14B→32B 为例:

图 10:Qwen3 14B↔32B 跨模型 KV Cache 映射的延迟与加速效果

可以看到,上下文越长,复用 KV Cache 的收益越明显。Qwen3 32B→14B 在相同三个长度上分别获得 3×、5× 和 7× 加速;扩展到三个模型家族的七组迁移组合和十种上下文长度后,映射器在全部 70 个测量点上都比重新 Prefill 更快。

不过,这些数据还不能直接等同于线上服务的端到端延迟。实验使用合成输入,映射耗时虽然包含源 Cache 在映射计算阶段所需的跨 GPU 传输,但没有计入最终 Cache 发送到目标服务进程的开销。短序列下还有约 14 ms 的 Python 调度和跨 GPU 固定成本,而且映射器没有使用 torch.compile 或 CUDA Graph,仍有进一步优化空间。

部署范围同样存在限制。目前实验只覆盖了同一家族、matched-KV 和全注意力模型,不同 KV Head 数量、不同单 Head 维度、跨模型家族,以及滑动窗口注意力或 SSM 混合架构都还没有验证。

映射器本身也有额外成本。六组线性映射器包含约 10.1 亿~33.6 亿参数,占用 4~12 GB 存储空间,而且不同转换方向需要独立映射。一个包含 P 个模型的路由系统最多需要 P(P−1) 套有向映射器,随着模型数量增加,存储和管理成本也会快速增长。

此外,“training-free”依然需要预先准备校准数据,同时运行源模型和目标模型收集 KV。论文中的单组映射器在 8×H100 上约需 47~87 分钟完成拟合。实验覆盖范围也还有限:多轮切换只测试了 Qwen3 14B↔32B,MLP 对困难模型组合的恢复主要集中在 HellaSwag,长期 Agent 会话和更多模型组合仍需要进一步验证。

从 KV 相似到注意力一致

这项工作的工程价值是证明了同一家族模型之间的 KV Cache 可以通过相对简单的线性映射完成迁移。在部分模型组合上,一次 KV 转换就可以省去目标模型重新执行 Prefill 的成本,长上下文下最高获得 25 倍加速。

需要留意的是,KV 的整体重建误差并不能很好预测迁移效果。相比单纯追求更高的 R²,误差是否落在 Attention 敏感的方向上,对最终模型行为影响更大。因此,后续跨模型 KV 映射的优化目标,可以进一步从“让 KV 更接近”转向“让 Attention 的输出更接近”。

目前,这套方法比较适合同家族、长上下文和频繁模型切换的场景,距离通用的跨模型 Cache 复用还有不少限制。但它已经证明,模型切换时重新计算完整历史上下文,并非唯一选择。

相关文章
|
7天前
|
存储 弹性计算 缓存
阿里云服务器租赁费用:新版租赁收费标准及活动报价参考
本文更新了2026年阿里云全系列云服务器租赁活动报价,所有特惠资源均可前往阿里云活动中心选购,整体覆盖从个人入门到企业级高性能场景的全梯度需求。其中轻量应用服务器主打极致性价比,2核2G峰值200M带宽配置每日10点、15点限时抢购价仅38元/年,2核4G配置379元/年起;高性价比的经济型e实例、通用算力型u2i实例覆盖2核4G至4核32G全档位,适配开发测试与中小型企业业务;搭载英特尔至强6处理器的第九代c9i企业级实例算力较上代提升20%,支撑高并发生产环境,不同实例规格价差清晰,用户可根据自身业务负载与预算灵活选型。
1746 117
|
8天前
|
人工智能 程序员 API
Codex 接入 DeepSeek-V4-Flash:还能补上识图,提供两套方案
Codex 接入 DeepSeek-V4-Flash 怎么配?本文覆盖 CLI 与桌面端,再用 qwen3-vl-flash 补识图,两套方案可直接照做
1251 9
|
14天前
|
云安全 人工智能 运维
阿里云联动百位企业安全专家,共识Agent防御最佳实践
当Agent成为新员工,你的安全边界在哪里?
1956 9
阿里云联动百位企业安全专家,共识Agent防御最佳实践
|
8天前
|
编解码 人工智能 安全
2核4G/4核8G/8核16G阿里云服务器如何选择实例?经济型e、通用算力型u2i与计算型c9i选哪个?
本文介绍了阿里云2核4G、4核8G、8核16G三档主流配置下经济型e、通用算力型u2i和计算型c9i三种实例的最新活动价格与适用场景。同配置下三者价差显著,以2核4G为例,经济型e低至599.93元/年,计算型c9i则高达1742.08元/年。文章详细解析了各实例的性能定位:经济型e适合轻负载入门场景,u2i兼顾稳定算力与性价比,c9i凭借第9代至强处理器与芯片级安全能力支撑高性能业务。同时提示用户可叠加满减优惠券享受折上折,建议根据业务负载与预算综合决策。
543 112
缓存 安全 IDE
961 2
|
20天前
|
人工智能 前端开发 Linux
Codex 桌面版安装 + CC Switch 接入第三方 API 完整教程(2026 最新)
2026最新教程:手把手教你安装Codex桌面版,通过CC Switch v3.17.0一键接入Fenno等国产API(兼容OpenAI Responses格式),跳过账号登录,完整启用代码审查、多步任务与上下文感知功能。零基础友好,全程图文实操。(239字)
2942 4
|
8天前
|
人工智能 JSON Shell
2026AI漫剧本地全开源方案(附各个软件模型链接),8G显卡也能流畅运行
这是一套完全本地化部署的AI漫剧生成技术链路:涵盖LLM剧本分镜生成、FLUX文生图(IP-Adapter人脸锁定)、StoryDiffusion时序连贯控制、LTX-2.3唇形同步视频生成,及ComfyUI全流程调度。零云端费用,仅耗硬件算力,单集2–4小时可产出竖屏短视频,适配抖音/B站分发。
|
5天前
|
编解码 弹性计算 云计算
MiniMax-H3 视频生成模型 — 一键部署与使用指南
MiniMax-H3是MiniMax开源的33B全模态视频生成模型,支持文生视频、图生视频、参考生视频三种模式,原生输出2K/15秒带立体声音频视频,已原生适配ComfyUI,并可通过阿里云计算巢一键部署。(239字)
|
12天前
|
存储 人工智能 关系型数据库
阿里云AI产品与云产品最新组合套餐:Token Plan、AI coding及云服务器和建站等组合优惠价
阿里云推出全新“算力+模型+应用”一站式云与AI组合套餐活动,覆盖从个人开发者到中大型企业的全场景需求。核心亮点为分三档定价的Token Plan订阅服务,支持Qwen3.8-Max-Preview大模型调用,错峰时段最低可享0.2折优惠。活动同步推出AI Coding、智能体部署、云电脑托管、0代码建站等十余类场景化组合,搭配99元/年的普惠云服务器、88元/年的入门数据库等经典特惠产品,还为企业提供1V1定制化AI转型方案,大幅降低了不同用户群体拥抱AI的技术门槛与采购成本。
748 111