新闻

引入无奖励的评审标准,减少代理商评估中的过度信任

1 分钟阅读
来源:arXiv AI
arXiv:2608.13564v1 公告类型:新 摘要:大规模评估语言模型代理越来越依赖第二语言模型作为自动判断,因为黄金信号(可执行的环境奖励)在部署时昂贵、缓慢或不可用。这样的法官是一个无奖励的代理,其价值取决于它是否可信,但现有的法官要么像 G-Eval 那样手写评分标准,要么微调法官的权重,两者都倾向于将流畅但不成功的轨迹视为成功。相反,我们从一小部分带有真实标签的轨迹中归纳出代理判断标题的文本,并将其扎根于真实的结果。我们推出 RubricFo