为什么大语言模型无法独立完成物理世界的理解?

有一次我随口问大模型:“杯子在桌边,轻轻往前推一点会怎样?”它答得特别顺,什么重心、惯性、掉落风险,一套一套的。可我越听越别扭——它说的是“听起来很像对”的话,不是它真看见了杯子和桌面的相对位置。那种感觉就像,你在跟一个读过无数说明书的人聊天,对方能把物理课本背给你听,却从没真正摸过那个杯子。

1787061388-aiimg6a84648c6abd92.62973326.webp

这大概就是大语言模型很难独立完成物理世界理解的根子。它的强项是接语言的龙:根据已经出现的词,去猜下一个最可能的词。写文章、翻译、拆任务,它都挺在行。可物理世界要的不是“像样的句子”,而是“接下来状态会怎么变”——物体在哪、推力会不会让它越过桌边、旁边有没有遮挡、动作之后场景会不会乱套。语言上通顺,和现实里站得住,根本是两回事。

我后来慢慢意识到,缺的不是更多词汇,而是一种内部的动态地图。地图上不能只有“这里有个杯子”的标签,还得有位置、距离、可能的运动方向,以及时间和因果关系怎么缠在一起。机器人要伸手去抓,光知道“杯子易碎”没用,它得判断从哪个角度靠近、力道会不会让杯子倾斜。大模型或许能写出“请轻轻拿起”这种建议,却未必能根据当前场景推演手指该挪多远。它靠的是文本里“杯子掉落”出现过多少次,不是对着眼前关系做预演。

所以你会看到一种很典型的幻觉:话说得特别自信,却把遮挡、碰撞、连续动作这些硬约束给忽略了。把上下文拉得再长,也只是让它读到更多规则描述,并不能自动变成对空间变化的持续观察。人的指令可以交给语言模型去理解和拆解,比如“把蓝色杯子拿到水槽边”;但这个计划在真实环境里可不可行,路径上有没有障碍,抓取会不会改变姿态,就不是纯靠语言关联能拍板的事了。

我并不觉得这是在唱衰大模型。更贴切的说法是:它擅长处理“人想做什么”,却不擅长独自回答“如果我这样做,现实会发生什么”。物理世界的理解,需要把物体、动作和后果真正连起来,还要靠传感器反馈不断纠偏。少了这一层,再流利的回答也只是停留在文字里的想象。对我们这些天天跟 AI 对话的人来说,认清这点反而更踏实——别把“会说”误当成“真懂现场”。

参与讨论

0 条评论

延伸阅读