News
GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发 OpenAI巨头OpenAI于当地时间 9 月 3 日正式发布了全新的GPT-6 Astra模型公告,然而其发布过程却波折不断
1 min read
Source: Telegram AI频道
GPT-6 Astra测试数据罗生门:OpenAI频繁修改成绩引「刷榜」质疑,大模型基准测试信任危机爆发 OpenAI巨头OpenAI于当地时间 9 月 3 日正式发布了全新的GPT-6 Astra模型公告,然而其发布过程却波折不断。公告刚刚上线便遭遇撤下,页面长时间陷入无法正常访问的状态。起初,官方将此次意外归咎于内容管理系统故障以及互联网中断,并极力澄清撤稿行动与任何基准测试成绩绝无关联。 然而,随着博客内容的重新上线及后续更新,外界发现该模型的各项评测数据经历了多次反复调整。其中最具争议的是,Astra的幻觉率数值率先从4.2%大幅下调至2%,随后又戏剧性地调回了最初的4.2%。不仅如此,GPT-5.6 Sol的幻觉率、内部网络安全评测等关键成绩也相继出现变动。值得注意的是,不仅是OpenAI自身产品,竞争对手Anthropic旗下部分模型的成绩也出现了先下调后回升的现象,甚至部分数据的调整时间早于官方首次发布博客之前。 面对外界的诸多猜测与不解,OpenAI官方解释称,这一系列调整的唯一目的是确保相关数据能够作为模型可用性能的最佳真实估计,且诸如测试条件等客观因素均会对最终结果产生影响。尽管如此,这番频繁的数据更迭依然引发了广大AI专家对其涉嫌“刷榜”的强烈质疑,同时也彻底暴露了整个AI行业长期存在的基准测试准确性争议,此类信任危机此前在Meta等头部公司身上也曾屡次上演。 业内资深人士纷纷呼吁,行业应当尽快建立统一规范,任何针对评测成绩的修改都必须同步公开、明确说明评测条件的具体变化。当前,基准测试成绩对于各大AI公司的市场定位与商业拓展具有举足轻重的意义,但数据频繁变动与由此引发的外界信任危机,不仅让企业客户和二级市场投资者难以准确评估模型的实际适配性,也对OpenAI长期的市场叙事和品牌公信力构成了不小的严峻挑战。 via AI新闻资讯 (author: AI Base)