新闻
00后硕士揭开AI推理“黑科技”:两个Token,基模追平强化学习版本
1 分钟阅读
来源:zhidx.com
智东西 作者 | 杨京丽 编辑 | 李水青 智东西10月10日报道,一项来自麻省理工学院(MIT)等机构的研究发现, 只要固定基础模型回答开头的两个Token,就能让模型的数学推理成绩接近对应的强化学习版本 。 以艾伦人工智能研究所(Ai2)的基础模型Olmo-3-7B为例, 将回答固定为“.\n\nOkay”开头 后,模型在MATH-500上的 准确率从42%升至78% , 超过其强化学习版本的75% 。 这个过程没有修改模型参数,也没有给模型增加新的解题示例。模型只是换了一个回答起点,原本没有稳定表现出来的解题能力,似乎就更容易被调用出来。 换句话说,基础模型答错题,有时不一定是完全不会做,而是没有进入能够解题的状态。 强化学习的一部分作用,可能正是让模型更容易选择这种有效的回答开头。 这一发现来自论文《 基础模型可以借助训练数据中的线索进行推理 (Base Models Can Reason By Taking a Cue From Training Data)》。论文于10月5日提交,由MIT、加州大学伯克利分校、华盛顿大学和艾伦人工智能研究所的研究者共同完成。 论文第一作者是麻省理工学院硕士生索菲·L·王(Sophie L. Wang)和加州大学伯克利分校博士生阿米尔·德拉维德(Amil Dravid)。索菲·L·王目前仍是MIT的硕士生,她从2023年进入MIT本科,2026年进入MIT硕士,目前她已 先后在ICML和NeurIPS上发表研究成果 。 论文链接: https://arxiv.org/abs/2610.06851 项目链接: https://www.s