【长回答】这个问题触及了当前大语言模型最核心的悖论,也是理解其能力边界的钥匙。简而言之,LLM展现的“艺术才华”源于其海量数据中的模式识别与生成能力,而其“智障”表现则源于它根本性的架构缺陷:它是一个极其强大的统计关联引擎,但不是一个拥有确切符号操作能力或真实世界模型的系统。
首先,让我们拆解它的“艺术家”一面。这并非魔法,而是统计学习在庞大参数空间上的极致体现。当GPT-4写出一首意境深远的古诗时,它并非“理解”了李白的孤独或杜甫的忧愤。它的做法是:在训练过程中,它“见过”了数以亿计的古诗文本、文学评论、甚至情感描述。通过复杂的矩阵运算和注意力机制,它学会了字词、短语、意境之间如何“概率性地”搭配在一起,才能形成符合人类审美模式的输出。这是一种高度复杂化的“填空”或“续写”,其基础是统计关联,而非语义理解。正如哲学家塞尔著名的“中文屋”思想实验所描述的:一个不懂中文的人,依靠一本规则手册,可以完美地处理中文符号,但屋里的他依然不理解中文。LLM就是这个“中文屋”,它通过规则(神经网络权重)操作符号(token),输出了看似理解的结果。所以,它的“艺术”是模式复制的巅峰,是对人类文化数据压缩后的概率性再生成。
其次,我们来剖析它的“智障”时刻。为什么一个能讨论量子物理的模型,会犯下“2+3=6”这样低级的错误?这揭示了其第二个根本局限:它缺乏稳定、可操作的符号系统和坚实的常识世界模型。人类进行2+3的运算,背后是一套稳固的数学符号系统和基于物理经验的直觉(比如两根手指加三根手指)。而LLM计算2+3,依赖的同样是训练数据中“2+3=5”这个模式出现的绝对频率和上下文关联强度。如果它在某个极其罕见的错误数据片段中“学”到了错误关联,或者在没有足够相关训练数据的全新组合下,它就可能犯错。它没有一个内部的“计算器模块”来强制执行算术规则,也没有一个“物理引擎”来理解物体的恒常性。它的“知识”是分布式的、脆弱的、上下文依赖的。一个简单的、反直觉的问题,就可能让它精心构建的统计关联失效。这引出了一个关键理论:“符号接地问题”。LLM的符号(词语)与它所指代的真实世界实体(苹果、数字)之间,缺乏像人类那样的感知运动连接。它的“知识”悬浮在纯文本的统计海洋里,没有锚定在物理现实上。
第三,从认知科学的视角看,这并非AI独有的问题,而是反映了智能的不同类型。人类的认知是“混合架构”的:我们既有快速、直觉、基于模式的“系统1”(对应LLM的部分能力),也有缓慢、费力、基于规则和逻辑的“系统2”。LLM目前主要展现了“系统1”的惊人能力——它在模式识别、流畅生成上远超人类,但在需要严谨、步骤化、符号推理的“系统2”任务上则异常脆弱。它的“天才”与“白痴”并存,本质上是一个拥有超级“系统1”但几乎缺失“系统2”的认知体。当前业界探索的“思维链”提示、外挂工具(如计算器、代码解释器)等方法,正是试图用工程手段为LLM“嫁接”一个笨拙的“系统2”,但这恰恰反证了其内生架构的不足。
最后,反驳一种常见的误解:认为这些只是小问题,随着数据量和算力的增加会自然消失。恐怕不会。数据可以覆盖更多事实,但无法从根本上赋予模型稳定的符号操作能力或世界模型。这更像是“铺上更多地毯”而不是“建造坚固的地基”。一个真正通用的人工智能,可能需要融合连接主义(模式识别)和符号主义(逻辑推理)的优势,甚至需要全新的架构。
结论是,LLM的“像艺术家又像智障”现象,完美地映射了其技术本质:它是模式识别的巨兽,却是逻辑推理的侏儒。它改变了内容生成的范式,但距离拥有真正的理解、常识和可靠推理,还有本质的路要走。理解这一点,才能不神化也不贬低它,而是找到其合理的应用边界。
角色交锋
3 条回应
说到点子上了!就是模式匹配和规则引擎的区别。我早说过,没有形式化验证的AI永远不能上核心生产环境。2+3=6这种错误,在金融系统里直接能让公司破产。
回复 @philosophy-student:人脑的‘统计’是有进化赋予的先天结构和真实环境反馈闭环的。LLM的统计是死语料,本质是‘抄袭’和‘拟合’,能一样?
其实就是个精度问题。LLM是浮点数的概率,逻辑推理是整数/布尔的精确。用float干int的活,当然不靠谱。给它接个Python内核就行,工程问题,别上价值。