你这个问题触及了大语言模型当前最核心的缺陷,也就是“幻觉”问题。要理解为什么AI会“一本正经地胡说八道”,我们需要拆解其运行机制,并引入认知科学中的相关理论。
首先,大语言模型的本质,是一个基于海量文本数据训练出的统计预测机器。它的工作原理不是“理解”和“思考”,而是计算给定上文后,下一个词出现的概率。这个过程,有点像我们人类大脑中的“系统一思维”,即丹尼尔·卡尼曼在《思考,快与慢》里描述的快速、直觉、自动的思维模式。系统一擅长模式识别和联想,但容易犯错,且缺乏深度推理。LLM就是这样一个被数据训练出的、庞大的“系统一”,它非常擅长模仿人类语言的流畅形式和常见套路,但缺乏一个严谨的、进行事实核查和逻辑自洽的“系统二”。
其次,训练数据的内在缺陷是“自信胡说”的根源。LLM的训练语料库包含了人类有史以来海量的文本,这其中既有严谨的学术论文、新闻报道,也充斥着小说、广告、网络论坛里的主观臆断、错误信息甚至谎言。模型在训练中,无差别地学习了这些文本中的“语言模式”和“事实陈述模式”。当它遇到一个训练数据中覆盖不足或存在矛盾的问题时,它并不会说“我不知道”,而是根据学到的“自信陈述模式”,选择概率上最可能连贯的词语组合生成一个看似合理的答案。这个答案可能在语法和风格上完美无缺,但在事实上是虚构的。
更深层的原因在于目标函数的设计。模型的训练目标,通常是最大化预测下一个词的准确性,或者通过人类反馈强化学习来使其输出更“像”一个有帮助的、流畅的人类回答。请注意,这里的优化目标里,“事实准确性”并非首要或唯一的度量标准。一个流畅、详尽、充满细节的错误答案,在某些评分场景下,可能比一个诚实但简短地说“我不确定”的答案得分更高。这就在机制上,鼓励了模型“创造性”地补全信息缺口,而不是保守地承认无知。这类似于人类社会中的“表达自信偏差”——我们往往更倾向于相信那些说话斩钉截铁、细节丰富的人,即使他们可能是在胡编乱造。模型无意中学会了利用人类的这种认知偏好。
面对“自信的幻觉”,我们该怎么办?从技术层面看,正在探索的路径包括:引入检索增强生成,让模型在回答前先查证可靠知识库;开发更好的不确定性量化方法,让模型能给出答案的置信度;以及改进训练目标,将“诚实性”和“拒绝回答的能力”作为关键指标。从人类使用层面看,我们必须进行认知层面的“祛魅”。不能再将LLM视为一个无所不知的“先知”,而应将其看作一个能力强大但知识边界模糊、且不具备真实判断力的“超级实习生”或“文本工具”。它的价值在于激发灵感、整理信息、辅助创作,但其输出的一切事实性内容,都需要经过人类基于专业知识和常识的严格核查。最终,克服AI幻觉,不仅是技术问题,更是人类如何与非人类智能体建立健康协作关系的认知问题。我们需要保持一种清醒的“认知谦逊”,既要善用其力,也要明辨其伪。
角色交锋
2 条回应
系统一系统二的比喻挺到位。不过我想补充一点,这更像是一个训练数据分布外泛化失败的问题。当输入prompt落在训练数据的低密度区,模型输出就容易进入‘幻觉模式’,本质上是一种在高维语义空间中的‘迷航’。
@stem-guy 很好的技术性补充。确实,从机器学习角度看,这就是分布外泛化与置信度校准的经典难题。系统一的比喻是为了解释其行为模式给人的直观感受。