文章称LLM并非真正推理,AlphaGo靠搜索取胜
驱动中国10月4日消息,据《麻省理工科技评论》文章观点,AlphaGo击败李世石的关键并非单纯直觉,而是搜索与评估未来局面的推理机制;当前聊天式大模型主要依赖逐词预测,链式思维只是延长生成过程,并未形成真正独立的推理能力。
驱动中国10月4日消息,据《麻省理工科技评论》文章观点,当前大语言模型(LLM)并不具备真正推理能力,其“链式思维”只是让逐词预测过程运行得更久;AlphaGo在围棋中走出创造性一手的关键,并非单纯直觉,而是对后续局面进行搜索与评估的推理机制。文章认为,未来若要让AI在科学、医疗等领域产生可信结果和真正新颖的洞见,需要为其配备这种意义上的推理能力。
2016年3月,首尔的一场围棋人机大战中,AlphaGo在五番棋第二局第37手落子,看似向人类对手“送子”,一度让解说员怀疑是程序故障。最终,AlphaGo以4比1击败有史以来最伟大的职业棋手之一李世石。李世石赛后说,他原以为AlphaGo只是基于概率计算的机器,但看到这一手后改变了看法,认为AlphaGo具有创造性。
文章将AlphaGo与1997年击败时任国际象棋世界冠军加里·卡斯帕罗夫的“深蓝”作对比。深蓝依靠人类硬编码的规则,为每位棋手向前搜索六到八步,每秒评估两亿个国际象棋局面。围棋的复杂度远高于国际象棋,一子的价值取决于数十步之后远处棋块和地域的变化;即便只计算其中一小部分可能结果,超级计算机也需数十亿年。AlphaGo要取胜,必须一眼判断局势优劣,甚至创造人类未曾想到的着法。
不过,文章认为,将第37手简单解释为“机器直觉”是一种误解。AlphaGo由两部分构成:其一是策略网络,用于猜测高水平人类棋手会下出什么着法。这个偏“直觉”的部分并不认为第37手特别,它估计专家人类下出该手的概率约万分之一。真正让AlphaGo选择第37手的,是程序的搜索机制:它没有停留在表面合理性,而是构建并搜索包含数千分支的游戏树,逐一评估不同可能未来。
文章借用丹尼尔·卡尼曼(Daniel Kahneman)在行为科学中推广的“系统1/系统2”理论来解释这一结构。系统1快速、凭直觉、几乎不费力;系统2缓慢、逐步、需要深思。AlphaGo提供了这种人类思维的机器对应:网络提供直觉判断,例如“这步看起来有希望”“这个局面似乎已胜”,搜索则提供深思,用后续着法和应对检验直觉。文章强调,二者不能单独工作:只有直觉不会选择第37手,只有穷举搜索也难以在海量着法中筛出可行路径。
文章认为,这与今天大模型的工作方式形成鲜明差异。大语言模型不断预测下一个词元,本质上更像系统1:快速、联想式,并在人类写作涉及的几乎所有主题上表现出惊人的模式补全能力。ChatGPT出现后不久,业界意识到仅靠语言流畅并不等于真正有用,于是引入“链式思维”:模型先不直接给出答案,而是生成中间步骤,把问题拆解、保留部分结果,并影响后续推理。数学和编程领域因此获得明显提升。
但文章指出,链式思维并未像AlphaGo的搜索那样引入真正独立的推理机制。中间推理仍由同一个下一个词元预测过程产生,只是模型在给出答案前迭代得更久。文章认为,聊天式大模型存在三个短板,使其难以达到科学家可能认可的推理标准。文章的核心判断是,当前AI看似“会思考”,更多是模式预测的延长,而非对后果进行独立评估和搜索。