停止将中间标记(tokens)拟人化为推理或思考过程。
Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces (2025)

原始链接: https://arxiv.org/abs/2504.09762

在立场文件《停止将中间词元拟人化为推理/思维轨迹!》中,Kambhampati 等人对语言模型在复杂任务中生成的输出标记为“推理”或“思维”轨迹的普遍做法提出了质疑。 作者认为,将中间词元生成(ITG)等同于类人认知过程,这不仅是一个无害的隐喻,更是一种危险的错误定性。通过对这些输出进行拟人化,研究人员和用户会误将其视为观察模型内部“思维过程”的可解释窗口。作者指出,这种框架模糊了语言模型的实际运作机制,导致了研究方法论的缺陷,并造成了这些系统应用上的低效。该论文向人工智能社区发出了关键性的行动号召:摒弃这种拟人化语言,转而采用更具技术准确性的描述,来阐述模型处理信息的方式。

最近关于论文《停止将中间标记拟人化为推理/思考痕迹》的 Hacker News 讨论,引发了关于大型语言模型(LLM)本质的激烈辩论。 **核心论点** 该论文认为,将模型的中间标记标记为“推理”或“思考”是一种危险的误解。作者主张这些痕迹仅仅是概率性输出,而非具有语义意义的“思维”过程。将这些痕迹视为透明的审计产物会营造一种虚假的安全感,可能在模型可靠性和意图方面误导用户及决策者。 **社区的主要观点:** * **怀疑论视角:** 许多参与者认同这些痕迹本质上是“草稿纸”空间——即允许模型对齐其输出的统计噪声。他们警告称,将这些过程拟人化会促使用户信任有缺陷的逻辑,并忽视该技术的机械本质。 * **类比论视角:** 另一些人认为,人类的思维同样混乱,容易出现合理化倾向,且在很大程度上是不透明的。他们建议,既然 LLM 是基于人类数据训练的,其“思维”模式——包括“顿悟”时刻——在功能上与人类的问题解决过程是类比的,因此这种拟人化隐喻即使在技术上不精确,也具有实用价值。 * **实用主义视角:** 第三类群体认为,标签本身的重要性不及实用性。如果“思维标记”能帮助模型产生更好的结果,就应该利用它们,即使这种“推理”纯粹是机械性的。他们主张,对语言进行规管是徒劳的,我们应关注输出的准确性,而非其本体论地位。 归根结底,这一讨论反映了深刻的分歧:一方寻求在生物认知与机械预测之间划清界限以维护问责制,而另一方则认为,随着人工智能表现持续模拟人类行为,这种界限正变得越来越无关紧要。
相关文章

原文

View a PDF of the paper titled Position: Stop Anthropomorphizing Intermediate Tokens as Reasoning/Thinking Traces!, by Subbarao Kambhampati and 8 other authors

View PDF HTML (experimental)
Abstract:Intermediate token generation (ITG), where a model produces output before the solution, has become a standard method to improve the performance of language models on reasoning tasks. These intermediate tokens have been called \say{reasoning traces} or even \say{thinking traces} -- implicitly anthropomorphizing the traces, and implying that these traces resemble steps a human might take when solving a challenging problem, and as such can provide an interpretable window into the operation of the model's thinking process to the end user. In this position paper, we present evidence that this anthropomorphization isn't a harmless metaphor, and instead is quite dangerous -- it confuses the nature of these models and how to use them effectively, and leads to questionable research. We call on the community to avoid such anthropomorphization of intermediate tokens.
From: Subbarao Kambhampati [view email]
[v1] Mon, 14 Apr 2025 00:03:34 UTC (381 KB)
[v2] Tue, 27 May 2025 16:35:47 UTC (536 KB)
[v3] Fri, 6 Mar 2026 14:36:07 UTC (1,321 KB)
[v4] Tue, 9 Jun 2026 20:08:39 UTC (4,278 KB)
联系我们 contact @ memedata.com