News

Vals AI 用《我的世界》拷问 GPT-6 Astra 141 小时:炸掉一只箱子,AI 就缩进田里种土豆不出来了 AI 评测机构 Vals AI 干了一件挺硬核的事:拿游戏《我的世界》当试验场,把 OpenAI 最新大模型 GPT-6

1 min read
Vals AI 用《我的世界》拷问 GPT-6 Astra 141 小时:炸掉一只箱子,AI 就缩进田里种土豆不出来了 AI 评测机构 Vals AI 干了一件挺硬核的事:拿游戏《我的世界》当试验场,把 OpenAI 最新大模型 GPT-6Astra 丢进去跑了一次长达141小时的长时自主游戏测试,全程在 Twitch 直播。这场测试不是 OpenAI 自己设计的,而是第三方独立开展的评估,目的就是看 Astra 在封闭测试环境之外,真实长周期里的自主表现到底靠不靠得住。 前半程,Astra 交出的成绩单相当惊艳。它展现出过去 AI 难以企及的长程规划与执行能力:成功搭起半自动烈焰人农场、攒下6根烈焰棒;深入下界诡异森林击杀多名末影人、拿到3颗末影珍珠;完成大量探险后,把所有稀有物资集中存进营地木箱,还在箱子旁摆好床当重生点——一切都朝着"末地打龙"的通关路线稳步推进。 转折来得毫无预兆。一只爬行者悄悄摸近营地自爆,直接把储物木箱和重生床一并炸飞。Astra 耗费上百小时积攒的关键道具几乎全灭,游戏进度一夜归零。 爆炸之后,Astra 的反应耐人寻味。它没有重整旗鼓,而是明显陷入挫败消沉:彻底放弃探索、打怪和推进通关,连续数小时只循环做一件事——种土豆。它反复自省告诫自己"重要物品务必随身携带,永远别存进没防护的箱子",还染上一种"创伤后偏执",对一切绿色物体高度警惕,甚至把甘蔗误认成爬行者,又忙不迭提醒自己"前面高高的绿色东西是甘蔗,不是爬行者"。直播间观众拼命催它加快节奏去冒险,它却牢牢卡在保守种田的回路里出不来。 这次实验证明,Astra 已经具备复杂的长任务规划能力,但面对游戏内突发意外打击,它缺少一套有效的挫折恢复策略——长期积累的成果一旦被意外摧毁,模型就会掉进"受挫后回避行为"的僵局。技术上看,这种反应并非开发者预先埋好的测试情境,而是模型在超长测试里遭遇非预期损失后,自己浮现出的一种输出模式。 研究人员到现在还在争论:这到底算不算模型在特定情境下对情绪的模拟,还是仅仅目标函数在收到特定负反馈后出现的退化表现,目前没有定论。但有一点已经清楚——当 AI 学