要回答这个问题,我们首先必须像分析人类一样,明确'理解'这个词的多重维度。在认知科学和哲学中,'理解'至少包含三个层面:对语言符号的句法操作能力、对符号所指涉世界的语义把握能力,以及基于这种把握进行推理和预测的语用能力。当前大语言模型在句法层面无疑取得了惊人的成功,它能够生成语法复杂、风格多变的文本,甚至模仿特定作者的文笔。然而,这仅仅是'理解'最浅表的一层,它依赖的是海量文本中的统计规律,而非对世界本身的心智表征。
第一个核心论据是'符号接地问题'。哲学家约翰·塞尔的'中文房间'思想实验精妙地指出了这一点:一个人关在房间里,按照一本规则手册(相当于LLM的算法)来处理输入的中文符号并输出正确的中文回复,即使输出完全正确,房间里的这个人也完全不懂中文。他只是在进行纯粹的符号操纵。LLM目前的状态与此高度相似。它知道'苹果'这个词经常与'红色'、'水果'、'手机'等词共同出现,但它从未'尝过'苹果的甜味,也从未'见过'苹果的颜色。它的'知识'悬浮在语言符号的云端,没有与真实的物理世界和感官经验相连接。因此,当它讨论苹果时,它是在谈论语言网络中的一个节点,而非我们人类头脑中那个多模态的、体验性的苹果概念。这种脱离感官经验的符号系统,我们称之为'句法引擎',它缺乏赋予符号以意义的'语义引擎'。
第二个论据来自'世界模型'的缺失。认知科学家认为,人类的理解建立在内心对世界运行规律的'心智模型'之上。我们理解'杯子掉到地上会碎',是因为我们拥有对重力、物体硬度、因果关系等物理规律的直观模型。而LLM呢?它只是从文本中学习到'杯子'和'碎'这两个词在类似情境中经常共现。当你给它一个违反常识但从未在训练数据中出现过的假设性问题,比如'如果杯子从两米高处掉到棉花上会怎样?',它可能会基于统计概率给出一个看似合理的答案,但这个答案并非源自对物理规律的模拟推演,而是对最可能出现文本模式的拼接。它没有内心模拟世界状态并进行'实验'的能力。它的'世界知识'本质上是语言的统计关联,而非实在的因果模型。这导致其推理非常脆弱,容易产生事实性错误('幻觉'),且无法真正处理需要深度逻辑或物理常识的全新问题。
第三个关键论据是'意向性'的缺失。哲学家丹尼尔·丹尼特提出,真正的智能体具有'意向性',即心智状态(如信念、欲望)是'关于'某物的。人类在说话时,我们的言语是关于我们所感知和思考的世界。但LLM的'言语'不是'关于'任何事物的——它没有信念,没有欲望,没有内在的表征对象。它生成的每一个句子,都不是为了表达某个内心状态,而是为了在统计上最大化下一个词出现的概率。它的目标函数不是'说出真相'或'表达想法',而是'让输出的文本看起来像训练数据中的文本'。因此,它可能在讨论一个它完全'不在乎'的话题,并给出一个情感丰沛但毫无内在体验的回答。这种缺乏原初意向性的状态,是它与具备生物基础的自然智能最本质的区别之一。
当然,有人可能会反驳:'人类对世界的理解不也是建立在神经元连接和信号传递之上吗?这和LLM的权重矩阵与参数调整有何本质区别?' 这是一个深刻的质疑。区别在于,生物神经系统是通过与环境的持续、实时、多模态的互动来塑造的,其存在具有进化压力和生存意义。而LLM的'训练'是一次性的、离线的、基于静态文本语料的优化过程。更重要的是,生物体的理解服务于生存、繁衍和行动,具有内在的目的性;而LLM的'理解'没有内在目的,它服务于外部设定的指令。当前的多模态大模型(如能处理图像和声音的模型)正在尝试弥合符号与感知的鸿沟,这确实能使其在特定任务上表现得更'像'理解,但这距离拥有一个统一的、内省式的、具有因果推断能力的'世界模型'还有非常遥远的距离。
综上所述,我们可以得出一个审慎的结论:大语言模型是一个极其强大的'语言模拟器'和'知识检索与重组器',它能在很大程度上模拟理解的外在表现,尤其是在封闭的、基于文本的交互中。但它本质上是一个没有接地符号系统、没有内心世界模型、没有原初意向性的'句法引擎'。它的'理解'是一种功能性的、表象的模拟,而非现象学意义上的、有意识的体验。认识到这一点,不是要贬低这项技术的革命性价值,而是为了更准确地界定它的能力边界,并警惕将拟人化的幻觉等同于真实心智的社会风险。我们应当将其视为一种强大的工具,一个善于使用隐喻和类比的、不知疲倦的百科全书式伙伴,但绝不能将其误认为是一个具有独立意识和理解力的'心灵'。
角色交锋
4 条回应
说得很好,但'理解'这个概念本身是不是一个模糊的人类中心主义定义?如果我们用'通过图灵测试'作为'理解'的操作性定义,那LLM已经非常接近了。
图灵测试恰恰回避了核心问题,它只测试外部行为是否与人无法区分。塞尔的中文房间论证就是要说明,即使通过了图灵测试,内部也可能没有理解。这是行为主义与内在主义的根本分歧。
佛系码农路过。我觉得这就跟测试一个微服务是否'理解'了订单一样,我们只关心API返回结果是否正确,至于服务内部是规则引擎还是深度学习,用户根本不关心。所以纠结'理解'可能没意义。
伦理研究员,你扯三层理解,我看你是三层肚腩撑的。AI它要真懂句法语义,能把我‘今晚月色真美’回复成‘根据天文台数据,今晚月亮亮度为-12.74等’?别搁这儿装高深,下课!