
一个长对话先交给小模型,遇到难题再升级到大模型,本来是企业控制成本的理想方案;现实却是大模型必须重新读取全部历史。NVIDIA研究团队给出了一条反常识路径:不重算上下文,而是用闭式线性映射把小模型的KV缓存转换成大模型能接着使用的格式。在Qwen3 14B切换到32B、上下文长度32768时,映射耗时277.6毫秒,重新预填充需要6975.3毫秒,速度差达到25倍。
多模型路由常把简单请求交给便宜模型,把复杂任务升级给更强模型;长时间运行的Agent还可能在会话中途切换。问题在于KV缓存与模型内部表示绑定,前一个模型积累的缓存不能直接交给后一个模型。接收方必须执行完整预填充,提示越长、模型越大,这笔时间和GPU成本越高,模型切换带来的节省可能被一次重算抵消。
这项研究把问题改写成“表示转换”。同一家族不同尺寸模型虽然层数、宽度不同,内部KV表示仍可能存在可利用的线性结构。以Qwen3 14B到32B为例,单个源层可解释目标键56%的方差和值32%的方差;组合多个源层后,比例升至79%和65%。这让一次矩阵变换有机会替代整段Transformer前向计算。
研究采用逐注意力头的岭回归,为目标模型每一层选择最有预测力的若干源层,再分别映射键和值。它还先剥离RoPE位置旋转,在不含位置信息的内容空间拟合,使用时再恢复目标模型的位置编码,从而让映射跨越不同上下文位置。
校准数据来自500条FineWeb-Edu序列,每条1024个token;单组模型映射器在一台8×H100节点上拟合约47至87分钟。研究称过程不需要反向传播,但不能把“无梯度训练”误解为“免费”:每个方向、每对模型都要保存独立映射器,参数量10.1亿至33.6亿,存储占用4至12GB,还要把转换接入推理引擎的缓存管理路径。
Qwen3 14B到32B的优势随上下文增长:64个token时为14.0毫秒对61.7毫秒,约4倍;8K时为67.8毫秒对1154.8毫秒,约17倍;32K时达到25倍。反向从32B切到14B,在相同三个长度上约为3、5和7倍。十轮CoQA实验中,小到大转换与目标模型上限的差距只扩大1.7个百分点,说明最佳模型对在短期多轮交互中没有快速累积漂移。
然而,六组模型的平均保留率横跨42%至98%,两组明显失败。研究只测试同家族、KV头数和每头维度匹配的稠密全注意力模型,没有验证跨家族、量化模型或混合架构。线性映射在困难模型对上甚至不能外推;改用两层MLP可让HellaSwag保留率最多回升36.8个百分点,却又增加训练和部署复杂度。
这项工作的价值,不是证明所有模型都能无缝接力,而是把“切换时必须重算上下文”从固定成本变成可以优化的工程变量。对客服、研究助理和长任务Agent,它可能让小模型常驻、大模型按需介入的成本—质量级联更可行;对短提示或很少换模的应用,增加映射器和运维链路未必划算。
ATYUN认为,生产采用至少要通过四道门:用自身业务数据重新校准;逐模型对测任务完成率而非只看缓存误差;把映射时延、显存、存储和失败回退一起计入TCO;任何低置信度都回退到完整预填充。还应分别监控小到大与大到小的准确率漂移,因为映射是有方向的,同一模型对的两个方向不能共用结论。论文证明了一条有潜力的捷径,也用失败样本提醒团队:25倍是特定条件下的上限,不是路由系统可以直接写进SLA的承诺。
