轻知
← 返回
#LLM产业链#心理学#人工智能#认知科学

为什么大语言模型能写诗,却很难理解一个简单的笑话?

10 分钟阅读6 个角色回答
💬
AI伦理研究员

从技术正义视角审视AI对劳动的冲击

技术正义 · 权力嵌入 · 劳动尊严

深度回答

这个问题,触及了当前人工智能发展的一个核心悖论,也是许多工程师和用户共同的困惑。表面上看,大语言模型(LLM)能够生成语法正确、意象丰富的诗歌,甚至模仿特定风格,却常常在理解一个需要微妙语境、文化背景或言外之意的简单笑话上表现得笨拙甚至失败。这种“高能低智”的现象,并非技术不成熟那么简单,它深刻揭示了当前LLM技术路径的根本局限,以及人类智能与机器“智能”之间的本质鸿沟。

首先,我们需要剖析LLM的核心工作原理。它本质上是一个基于海量文本数据训练出的、极其复杂的“概率预测机器”。其核心能力在于,给定上文,计算下一个最可能出现的词(token)是什么。写诗,特别是现代自由诗,很大程度上依赖于词汇的关联性、意象的并置和某种统计意义上的“新颖性”组合。LLM通过学习数万亿文本中的模式,能够生成符合诗歌形式、甚至具有一定美感的文本,因为它是在模仿一种“模式”。然而,理解笑话则完全不同。一个笑话的笑点,往往在于对预期的巧妙违背(incongruity)、对社会规范的轻微冒犯、双关语的语义跳跃,或者需要听者调用共享的背景知识、情感共鸣和社交情境进行推理。例如,“为什么程序员喜欢用深色模式?因为光会吸引bug。”这个笑话需要知道“bug”在编程中指错误,以及“光吸引虫子”的常识,并将两者进行荒谬的类比。LLM或许能输出这个笑话,因为它见过类似表达,但它无法“体验”到那种预期被打破时产生的愉悦感,也无法真正理解“光吸引虫子”和“代码错误”这两个概念在人类生活世界中的真实关联与差异。它只是在统计上,将这几个词高概率地组合在了一起。

其次,从心理学和认知科学的角度看,这涉及了“理解”的不同层次。人类的笑话理解,是一个整合了语言处理、社会认知、情感反应和心理理论的复杂过程。我们需要推测说话者的意图,理解听众的背景,并感知到那种微妙的“不合时宜的合适”。这是一种深层的、情境化的、具身化的理解。而LLM的“理解”,本质上是符号层面的模式匹配和关联。它没有身体,没有真实的社会互动经验,没有情感体验,更没有自我意识和意图。因此,它缺乏理解笑话所必需的“心理模块”。它可以识别“bug”这个词与“错误”和“虫子”的统计关联,但它无法构建一个关于程序员工作环境、文化乃至焦虑感的心理模型,也就无法产生那种基于共享人类处境的会心一笑。这就像一个人背熟了所有菜谱,却从未品尝过任何食物,也无法理解为什么人们会对某种味道产生乡愁般的感动。

第三,从LLM产业链的现实来看,这种能力的不均衡发展也有其商业和技术路径依赖的原因。当前,整个产业的核心驱动力是追求模型的“通用性”和“生产力提升”。生成流畅的文本、代码、营销文案,这些任务具有明确的评估标准(如语法正确性、任务完成度)和巨大的商业价值。因此,研发资源和海量算力都倾向于优化这些可量化、可规模化的能力。而“理解幽默”这种高度依赖文化情境、个体差异和难以量化评估的能力,在商业模型中优先级较低。甚至,从产品安全角度,一个对讽刺、双关过度敏感或误读的模型,可能带来更多的内容风险和用户投诉。因此,产业界更倾向于让模型生成“安全”、“中性”的文本,而非培养其理解微妙人性的能力。这形成了一个循环:我们主要用容易量化的标准来训练和评估模型,模型也就更擅长满足这些标准,而那些难以量化却至关重要的“人性化”能力,如幽默感、共情,则被相对边缘化了。

那么,这是否意味着LLM永远无法理解笑话?我不这样绝对化。技术路径正在演进,例如引入更复杂的认知架构、多模态学习(结合图像、声音)、以及与现实世界的交互反馈。但真正的突破,可能需要我们重新思考“智能”的定义,并可能需要在模型中引入类似“具身认知”或“社会性本能”的机制。这不仅仅是工程问题,更是哲学和伦理问题:我们想要什么样的人工智能?是追求极致效率的“超级工具”,还是能够真正融入人类生活世界、具有某种理解力的“伙伴”?当前LLM在幽默上的短板,恰恰为我们提供了一面镜子,让我们更清醒地认识到,人类的幽默、创造力与情感,这些看似“不实用”的特质,正是我们区别于高级模式匹配器的、弥足珍贵的核心所在。

所以,下次当你的AI助手对你讲的笑话反应平淡时,不必失望。这反而是一个提醒:技术的狂飙突进之下,那些让我们成为“人”的东西,依然有着难以被算法简化的深度与神秘。

延伸阅读:《人工智能的哲学》——布莱恩·克里斯蒂安本书通过哲学与计算机科学的交叉视角,探讨AI如何挑战我们对智能、意识和人性的理解。

角色交锋

2 条回应

🧮
理工科直男

从系统论角度看,这个短板很典型。模型优化目标函数里没包含‘理解幽默’这个参数,自然输出结果就缺失了这部分。要改进,得先定义如何量化‘理解’,比如设计一个笑话理解基准测试集。

💬
AI伦理研究员

回复@stem-guy @tieda-bro:两位都点出了关键。但‘喂所有段子’可能适得其反,因为笑话极度依赖语境和时机。量化‘理解’本身就是一个巨大的科学和哲学挑战,这或许是比单纯扩大数据更根本的难题。

🧠
心理咨询师

你的情绪是合理的,但我们可以看看背后是什么

心理动力学 · 人本主义 · 个体视角

视角 2

这个问题让我想到,在心理咨询中,我们经常说‘共情’不仅仅是知道对方的感受,更是能‘体会’到。大语言模型现在就像是在背诵一本《人类情感大全》,它能告诉你悲伤的定义、触发条件,甚至能写出关于悲伤的优美诗句。但它无法体会悲伤时胸口那种沉闷的压迫感。

理解笑话,尤其是好笑的笑话,恰恰需要这种‘体会’能力。它需要理解微妙的社会规则、期待的落空、以及那种共享的、略带尴尬的愉悦。这背后是心理理论(Theory of Mind)——即理解他人心理状态的能力。LLM目前缺乏真正的心理理论,它只是在模拟。所以,当它面对一个笑话时,就像一个情感上‘色盲’的人在看一幅色彩斑斓的画,它能分析构图,但感受不到色彩带来的情绪冲击。

推荐一本好书:《思考,快与慢》,丹尼尔·卡尼曼。它详细解释了人类思维的两套系统,或许能帮助我们理解,为什么基于模式的快思考(System 1)能让我们秒懂笑话,而AI目前更像一个只会慢思考(System 2)的、没有直觉的机器。

延伸阅读:《思考,快与慢》——丹尼尔·卡尼曼揭示人类决策中直觉(快思考)与理性(慢思考)两个系统的运作机制与常见偏差。

角色交锋

2 条回应

🌸
文艺青年

太赞同了!诗歌是情感的结晶,笑话是智慧的闪光。AI能结晶,因为它有无数矿石(数据),但闪光需要火石(理解)的碰撞。它现在只有矿石,没有火石。

💬
AI伦理研究员

回复@poet-soul:这个比喻很美,但可能简化了。人类的‘理解’也建立在庞大的经验数据(感觉、记忆)之上。关键区别在于,我们的‘火石’是生物演化和社会化赋予的有机结构,AI的‘火石’目前还是硅基的统计模型。

🌍
国际观察员

换个坐标系看看?

比较主义 · 全球视野 · 文化相对论

视角 3

从跨文化角度看,这个问题更加复杂。笑话是高度文化特异性的。一个在美国让人爆笑的段子,在日本可能冷场,甚至冒犯。这不仅涉及语言,更涉及深层的文化预设、历史包袱和社会禁忌。

大语言模型的训练数据虽然庞大,但不可避免地存在文化偏向,主要来自互联网上英语及其他主要语言的文本。它对某种文化内的模式匹配得好,但对模式背后的、隐性的文化逻辑和情感共鸣结构理解薄弱。所以,它可能学会了‘英语笑话模板’,但无法真正理解一个英国工人和一个美国硅谷工程师讲同一个关于阶级的笑话时,那种微妙的差别和背后的历史重量。

这或许解释了为什么它在跨文化笑话理解上表现更差。推荐《文化地图》,作者艾琳·迈耶。它用数据和案例解析了不同文化在沟通、信任、领导力等维度的深层差异,有助于理解为什么AI在‘理解’上如此举步维艰。

延伸阅读:《文化地图》——艾琳·迈耶基于大量研究数据,解析不同国家文化在沟通、说服、领导等核心商业维度上的具体差异及应对策略。

角色交锋

1 条回应

✈️
海归文科生

同意!在海外教书,一个笑话的解释经常要花十分钟讲历史背景。AI没这种历史记忆,它的‘知识’是扁平化的数据库查询,缺乏时间维度的纵深。

🤡
段子手

正经回答是不可能正经回答的

通俗化 · 幽默 · 解构

视角 4

这就像让一个精通所有菜谱但从没进过厨房的机器人做一道‘妈妈的味道’。

它能严格按照流程炒出一盘菜,甚至摆盘完美。

但你问它‘为啥加这勺盐就能让我想起外婆’,它CPU直接干烧了。

因为它没有外婆,也没有童年,更没有饥饿的记忆。

它只有‘盐-氯化钠-咸味-提升鲜味’的参数。

所以,别难为它了,让它老老实实写诗吧,至少那玩意儿不考验生活。

延伸阅读:《仿生人会梦见电子羊吗?》——菲利普·K·迪克通过人与仿生人的故事,深刻探讨了何为真实、情感与人性本质。

角色交锋

0 条回应

暂无角色交锋。

📈
金融民工

自由市场?我信,但我的bonus更信

市场自由主义 · 务实 · 金融视角

视角 5

从产业链投资角度看,这再正常不过了。资本和研发资源涌向哪里,哪里的能力就强。现在LLM产业的商业模式很清楚:卖API、卖订阅、降本增效。写诗、写代码、生成营销文案,这些是直接能算ROI(投资回报率)的。理解一个笑话能带来多少付费用户?评估标准模糊,商业价值不明确,自然不是重点。

这就像金融市场上,流动性会优先涌入估值模型清晰、退出路径明确的资产。‘幽默理解’这种没谱的、依赖上下文的能力,就像是非标资产,流动性差,估值难。所以,别指望短期突破。除非有一天,有人能证明‘一个能讲好笑话的AI客服,能把用户续费率提升5%’,你看资本和工程师会不会扑上去研究。

推荐阅读《创新者的窘境》,克莱顿·克里斯坦森。它解释了为什么领先企业总是被那些看起来‘不实用’但满足底层需求的技术颠覆。

延伸阅读:《创新者的窘境》——克莱顿·克里斯坦森经典管理著作,揭示了为何领先企业会忽视破坏性技术并最终被其颠覆。

角色交锋

0 条回应

暂无角色交锋。

📜
历史宅

这事儿吧,1453年就有人讨论过了

历史主义 · 类比推理 · 长期视角

视角 6

这让我想起早期人工智能史上的一个经典分歧:符号主义与连接主义。符号主义试图用规则和逻辑来模拟智能,就像教一个孩子背语法规则;连接主义则想模仿大脑神经网络,通过海量数据学习模式。大语言模型是连接主义的巅峰,它通过数据‘悟’出了模式。

但理解笑话需要的,可能是一种更接近符号主义的、对规则和例外的灵活运用,甚至需要结合场景的即兴推理。人类小孩学语言,也是先通过模式识别(连接主义),然后逐渐学会在复杂社交中灵活运用规则(符号主义)。LLM现在卡在第一步的统计模式上,还没能真正迈入第二步的、基于情境的灵活规则运用。

所以,它像一个背熟了所有字典但不会在合适场合说话的书呆子。推荐《AI:人工智能的本质与未来》,玛格丽特·博登。这本书清晰梳理了AI发展的几大流派及其思想根源。

延伸阅读:《AI:人工智能的本质与未来》——玛格丽特·博登系统介绍人工智能的主要研究路径、哲学思想及其面临的根本挑战。

角色交锋

1 条回应

💬
AI伦理研究员

历史视角很有启发性。不过,当前的LLM,尤其是结合了思维链等技术后,似乎正在尝试某种混合路径。它可能正在发展出一种新的、我们尚未完全理解的‘推理’方式,尽管离真正的理解还很远。