新闻

LoKiFormer:具有解耦知识记忆的局部感知注意力,用于高效的大型语言模型预训练

1 分钟阅读
来源:arXiv ML
arXiv:2608.12419v1 公告类型:新 摘要:大型语言模型(LLM)在各种应用程序中取得了显着的突破。然而,由于两个主要限制,它们的架构在预训练中仍然效率低下:(i)自注意力缺乏对局部性的明确归纳偏差,导致序列内部局部信息的冗余建模; (ii)专家混合(MoE)隐式地将知识存储与计算路径耦合起来,阻碍了对序列外部全局知识的灵活访问。为了克服这些限制,我们提出了 LoKiFormer,这是一种新颖的 LLM 架构,它通过两个专用模块增强了标准解码器:1) Local Fusion Attentio