新闻

英伟达让AI学会"抄作业":KV缓存可跨模型迁移,推理速度暴增25倍 英伟达的研究团队取得了一项突破:他们找到了让KV缓存在不同模型之间迁移的方法

1 分钟阅读
英伟达让AI学会"抄作业":KV缓存可跨模型迁移,推理速度暴增25倍 英伟达的研究团队取得了一项突破:他们找到了让KV缓存在不同模型之间迁移的方法。目标模型可以直接跳过预填充阶段,转换速度比重新处理上下文快2. 7 到 25 倍。 要理解这个突破的意义,需要先了解KV缓存的作用。在使用ChatGPT或Claude时,你会发现第一个词的生成总是明显更慢,然后后面的内容几乎是瞬间涌出。这背后是一个刻意设计的机制——模型在生成第一个词之前,需要处理整个输入上下文,把中间结果存储为KV缓存。之后的每个词都可以复用这些缓存,所以速度快得多。 问题在于,KV缓存一直是"一次一模型"的。如果你切换到另一个模型,或者升级了模型版本,之前计算好的缓存就全废了,新模型必须从头开始处理整个上下文。对于长文本场景,这意味着大量的重复计算和时间浪费。 英伟达的方案让KV缓存变得可迁移。一个模型计算出的缓存,经过转换后可以被另一个模型直接使用,目标模型完全跳过预填充阶段。转换过程本身也比重新处理上下文快得多——速度提升在2. 7 倍到 25 倍之间,具体取决于模型和上下文的复杂度。 这对AI行业的影响是深远的。当前LLM API的使用成本中有相当一部分来自上下文处理,尤其是长对话和长文档场景。如果KV缓存可以在模型之间迁移,意味着用户在切换模型时不必承担重复计算的成本,模型升级时也不必丢弃已有的对话上下文。这项研究可能会改变AI推理基础设施的设计方式,让模型之间的切换变得更加流畅和经济。 via AI新闻资讯 (author: AI Base)