News
攀爬AGI的南北坡:语言模型之外,生数从世界模型出发
1 min read
Source: zhidx.com
智东西 作者 | Ada 编辑 | 漠影 过去三年,通往AGI的主叙事,几乎都从语言开始:更多文本、更大参数、更长上下文、更强推理,再加上工具调用与智能体。 这条路已经证明了自己的力量。它让机器能够读写、编程、检索、规划,并开始接管一部分原本只存在于电脑屏幕里的复杂工作。 但当任务从“在网页上完成一份表格”变成“把一个灯泡稳稳拧进灯座”,问题忽然变了。机器人不仅要看见物体,还要判断手指该怎样接触、这一下转动会发生什么、拧偏了是否应该停下、下一步怎样纠正。它需要的,不只是一个能描述世界的模型,而是 一套能在行动前预演后果、在行动后复盘得失的内部世界 。 这正是当下AGI竞争开始出现分岔的地方。 同样脱胎于清华实验室的智谱与生数,恰好提供了两组值得观察的中国样本:前者 以语言模型与智能体为核心组织能力 ,后者 以世界生成、实时交互与世界动作模型为线索推进 。它们像在同一座山的两面攀爬:一面从人类已编码的语言和知识出发,另一面从世界持续发生的变化与反馈出发。 一条路从语言出发,一条路从世界出发。地貌不同,难题不同,却指向同一座山。 而要看清第二条路究竟难在哪里,最好先把镜头从宏大的AGI拉回一双正在工作的手。 把一只灯泡拧进灯座,看上去是一个再简单不过的动作。 真正难的地方,恰好发生在最容易被忽略的一瞬间:灯泡的螺纹刚刚碰到灯座,手指需要感到那一点阻力;旋转角度偏了,玻璃会卡住;握得太紧,动作又会变形。人的手并不会先算完一长串公式再行动,它会一边看、一边碰、一边根据细小的反馈调整下一下力道。 这才是“手巧”的本质。它不是把一段动作重复得更像人,而是在每一次动作之前,能判断这样做会发生