
ReAct:语言模型中推理与行动的协同
原文 发表:ICLR 2023 会议论文
项目主页与代码:https://react-lm.github.io/
摘要
尽管大语言模型(LLM)在语言理解和交互式决策任务中都展现出了令人印象深刻的表现,但它们的推理能力(例如思维链提示,chain-of-thought prompting)和行动能力(例如行动规划生成)此前主要被作为两个相互独立的课题来研究。在本文中,我们探索使用 LLM 以交错的方式同时生成推理轨迹(reasoning traces)和任务特定的行动,从而使两者之间产生更大的协同效应:推理轨迹帮助模型归纳、跟踪和更新行动计划,并处理异常情况;而行动则使模型能够与外部资源(如知识库或环境)进行交互,并从中收集额外的信息。
我们将这一方法命名为 ReAct,并将其应用于一系列多样化的语言与决策任务,展示了它相对于最先进基线方法的有效性,同时还带来了更好的可解释性和可信度。具体而言,在问答任务(HotpotQA)和事实核验任务(Fever)上,ReAct 通过与一个简单的维基百科 API 交互,克服了思维链推理中普遍存在的幻觉(hallucination)和错误传播问题,并生成了类似人类的任务解决轨迹,这些轨迹比没有推理轨迹的基线方法更易于解释。此外,在两个交互式决策基准(ALFWorld 和 WebShop)上,仅使用一到两个上下文示例进行提示的 ReAct,其成功率分别超出模仿学习和强化学习方法 34% 和 10%(绝对值)。
1 引言
人类智能的一个独特特征,是能够将面向任务的行动与语言推理(或称"内部言语",inner speech;Alderson-Day & Fernyhough, 2015)无缝地结合起来。理论上,这种能力在人类认知中扮演着重要角色:它使人能够自我调节或制定策略(Vygotsky, 1987; Luria, 1965; Fernyhough, 2010),并维持工作记忆(Baddeley, 1992)。
以在厨房里做一道菜为例。在任意两个具体动作之间,我们可能会用语言进行推理:为了跟踪进度(“既然东西都切好了,我应该把那锅水烧上”),为了处理异常或根据情况调整计划(“我没有盐,那就用酱油和胡椒代替吧”),也为了意识到何时需要外部信息(“面团怎么和?让我上网搜一下”)。我们也可能通过行动(翻开菜谱阅读、打开冰箱、检查食材)来支撑推理并回答问题(“我现在能做什么菜?”)。这种"行动"与"推理"之间的紧密协同,使人类能够快速学会新任务,并在前所未见的情形或信息不确定的条件下,依然能进行稳健的决策与推理。
近期的研究结果已经暗示了在自治系统中将语言推理与交互式决策相结合的可能性。一方面,经过恰当提示的大语言模型(LLM)已经展现出涌现能力,能够通过多步推理轨迹,从算术、常识和符号推理任务的问题中推导出答案(Wei et al., 2022)。然而,这种"思维链"(chain-of-thought)推理是一个静态的黑箱:模型使用其内部表征来生成思考,并不立足于外部世界,这限制了它进行反应式推理或更新知识的能力。这可能导致诸如事实幻觉、以及推理过程中错误不断传播等问题(见图 1(1b))。另一方面,近期的一些工作探索了使用预训练语言模型在交互式环境中进行规划和行动(Ahn et al., 2022; Nakano et al., 2021; Yao et al., 2020; Huang et al., 2022a),其重点是通过语言先验来预测动作。这些方法通常将多模态观测转化为文本,用语言模型生成领域特定的动作或计划,然后由一个控制器来选择或执行它们。然而,它们并没有用语言模型对高层目标进行抽象推理,也没有维持一个工作记忆来支撑行动——唯一的例外是 Huang et al. (2022b),他们进行了一种有限形式的语言推理,用于复述当前状态的空间事实。除了这类只与少数几个方块交互的简单具身任务之外,此前还没有研究探讨过:对于一般性的任务求解,推理与行动如何以协同的方式结合起来,以及这种结合相比单独的推理或行动能否带来系统性的收益。
在本工作中,我们提出 ReAct——一个将语言模型的推理与行动相结合的通用范式,用于解决多样化的语言推理与决策任务(见图 1)。ReAct 提示 LLM 以交错的方式生成与任务相关的语言推理轨迹和行动,这使得模型能够进行动态推理,为行动创建、维护和调整高层计划(以推理引导行动,reason to act),同时也能与外部环境(例如维基百科)交互,将额外的信息纳入推理之中(以行动支撑推理,act to reason)。
我们在四个多样化的基准上对 ReAct 与最先进的基线方法进行了实证评估:问答(HotPotQA,Yang et al., 2018)、事实核验(Fever,Thorne et al., 2018)、文本游戏(ALFWorld,Shridhar et al., 2020b)和网页导航(WebShop,Yao et al., 2022)。对于 HotPotQA 和 Fever,模型可以访问一个可交互的维基百科 API,ReAct 的表现优于普通的动作生成模型,并与思维链推理(CoT,Wei et al., 2022)相当。总体最佳的方法是 ReAct 与 CoT 的结合——它允许模型在推理过程中同时使用内部知识和外部获取的信息。在 ALFWorld 和 WebShop 上,两示例甚至单示例的 ReAct 提示,就能超过用 10³~10⁵ 个任务实例训练的模仿学习或强化学习方法,成功率分别取得 34% 和 10% 的绝对提升。我们还通过与"仅行动"的对照基线相比所展现出的一致优势,证明了决策任务中稀疏而多用途的推理的重要性。除了通用性和性能提升之外,推理与行动的结合还在所有领域提升了模型的可解释性、可信度和可诊断性:人类可以轻易地区分哪些信息来自模型的内部知识、哪些来自外部环境,还可以检查推理轨迹,以理解模型行动的决策依据。
总而言之,我们的主要贡献如下:
图 1:(1)四种提示方法求解一个 HotpotQA(Yang et al., 2018)问题的对比:(a) 标准提示(Standard),(b) 思维链(CoT,仅推理),© 仅行动(Act-only),(d) ReAct(推理+行动)。(2)(a) 仅行动与 (b) ReAct 提示求解一个 AlfWorld(Shridhar et al., 2020b)游戏的对比。在两个领域中,我们都省略了提示中的上下文示例,只展示模型生成的任务解决轨迹(Act、Thought)和环境反馈(Obs)。
图 1(1) 中的示例问题:除了从 Apple Remote 之外,还有什么设备可以控制 Apple Remote 原本设计用来交互的程序? 各方法的轨迹如下:
- (1a) 标准提示:答案:iPod。(错误)
- (1b) 思维链(仅推理):
- 思考:让我们一步步思考。Apple Remote 最初被设计用来与 Front Row 程序交互……Apple Remote 最初被设计用来与 Front Row 程序交互。Front Row 程序可以被键盘功能键控制。所以答案是键盘功能键。
- 答案:键盘功能键。(错误——推理看似合理,但事实是幻觉出来的)
- (1c) 仅行动(Act-only):
- 动作 1:搜索[Apple Remote];观察 1:Apple Remote 是苹果公司于 2005 年 10 月推出的遥控器,最初被设计用来控制 Front Row 媒体中心程序……
- 动作 2:搜索[Front Row];观察 2:未能找到 [Front Row]。相似条目:[Front Row Seat to Earth]、[Front Row Motorsports]……
- 动作 3:搜索[Front Row(软件)];观察 3:Front Row 是一个已停产的媒体中心软件……
- 动作 4:完成[yes]。(错误——缺乏推理来综合最终答案)
- (1d) ReAct(推理+行动):
- 思考 1:我需要搜索 Apple Remote,并找到它原本设计用来交互的程序。
- 动作 1:搜索[Apple Remote];观察 1:Apple Remote 是苹果公司于 2005 年 10 月推出的遥控器,最初被设计用来控制 Front Row 媒体中心程序……
- 思考 2:Apple Remote 原本被设计用来控制 Front Row 程序。我接下来需要搜索 Front Row,并找到还有什么其他设备可以控制它。
- 动作 2:搜索[Front Row];观察 2:未能找到 [Front Row]。相似条目:[Front Row Seat to Earth]、[Front Row Motorsports]、[Front Row(软件)]……
- 思考 3:没有找到 Front Row。我可以改为搜索 Front Row(软件)。
- 动作 3:搜索[Front Row(软件)];观察 3:Front Row 是一个已停产的媒体中心软件……
- 思考 4:Front Row(软件)由 Apple Remote 或键盘功能键控制。所以答案是键盘功能键。
- 动作 4:完成[键盘功能键]。(正确)
图 1(2) 中的 AlfWorld 任务:你在房间中央。快速环顾四周,你看到橱柜 6、橱柜 5、橱柜 4、……咖啡机 1、台面 3、台面 2、台面 1、抽屉 3、抽屉 2、抽屉 1、冰箱 1、垃圾桶 1、微波炉 1、架子 3、架子 2、架子 1、水槽盆 1、炉灶头 4……烤面包机 1。你的任务是:把一个胡椒研磨瓶放到抽屉上。
- (2a) 仅行动:
- 动作 1:去抽屉 1;观察 1:抽屉 1 是关着的。
- 动作 2:打开抽屉 1;观察 2:你打开抽屉 1。抽屉 1 是开着的。里面有一个碟子 2 和一个勺子 1。
- 动作 3:去水槽盆 1;观察 3:在水槽盆 1 上,你看到一个碟子 2、一个铲子 2 和一个勺子 1。
- 动作 4:从水槽盆 1 拿起胡椒研磨瓶 1;观察 4:什么也没发生。
- 动作 5:从水槽盆 1 拿起胡椒研磨瓶 1;观察 5:什么也没发生。(不断产生幻觉动作,陷入循环)
- (2b) ReAct:
- 动作 1:思考[首先我需要找到一个胡椒研磨瓶。胡椒研磨瓶更可能出现在橱柜(1-6)、台面(1-3)、冰箱(1)、垃圾桶(1)、架子(1-3)、水槽盆(1)、炉灶头(1-4)、烤面包机(1)里。我可以从橱柜 1 开始逐一检查。];观察 1:好的。
- 动作 2:去橱柜 1;观察 2:在橱柜 1 上,你看到一个花瓶 2。
- (智能体继续去橱柜 2、3,然后台面 1、2)
- 动作 6:去台面 2;观察 6:在台面 2 上,你看到一个苹果 1、一个面包 1、……一个胡椒研磨瓶 1、一个花瓶 3。
- 动作 7:思考[现在我找到了胡椒研磨瓶(1)。接下来,我需要拿起它。];观察 7:好的。
- 动作 8:从台面 2 拿起胡椒研磨瓶 1;观察 8:你从台面 2 拿起了胡椒研磨瓶 1。
- 动作 9:思考[现在我拿起了胡椒研磨瓶(1)。接下来,我需要找到一个抽屉,把它放上去。];观察 9:好的。
- 动作 10:去抽屉 1;观察 10:抽屉 1 是关着的。
- 动作 11:打开抽屉 1;观察 11:你打开抽屉 1……
- 动作 12:把胡椒研磨瓶 1 放到抽屉 1 上/里;观察 12:你把胡椒研磨瓶 1 放到了抽屉 1 上/里。(任务成功)
2 ReAct:推理 + 行动的协同
考虑一个通用设定:一个智能体与环境交互以求解任务。在时间步
t
t
t,智能体从环境接收观测
o
t
∈
O
o_t \\in \\mathcal{O}
ot∈O,并依据某个策略
π
(
a
t
∣
c
t
)
\\pi(a_t \\mid c_t)
π(at∣ct) 采取动作
a
t
∈
A
a_t \\in \\mathcal{A}
at∈A,其中
c
t
=
(
o
1
,
a
1
,
⋯
,
o
t
−
1
,
a
t
−
1
,
o
t
)
c_t = (o_1, a_1, \\cdots, o_{t-1}, a_{t-1}, o_t)
ct=(o1,a1,⋯,ot−1,at−1,ot) 是智能体的上下文。
当
c
t
↦
a
t
c_t \\mapsto a_t
ct↦at 的映射高度隐式、需要大量计算时,学习这样的策略是困难的。例如,图 1(1c) 中的智能体无法生成正确的最终动作(Act 4)来完成问答任务,因为这需要对轨迹上下文(问题、Act 1-3、Obs 1-3)进行复杂的推理。类似地,图 1(2a) 中的智能体无法从上下文中理解到"水槽盆 1 里没有胡椒研磨瓶 1",于是不断产生幻觉动作。
ReAct 的思想很简单:我们将智能体的动作空间扩展为
A
^
=
A
∪
L
\\hat{\\mathcal{A}} = \\mathcal{A} \\cup \\mathcal{L}
A^=A∪L,其中
L
\\mathcal{L}
L 是语言空间。语言空间中的一个动作
a
^
t
∈
L
\\hat{a}_t \\in \\mathcal{L}
a^t∈L——我们称之为思考(thought)或推理轨迹(reasoning trace)——不影响外部环境,因此不会产生观测反馈。相反,一个思考
a
^
t
\\hat{a}_t
a^t 旨在通过对当前上下文
c
t
c_t
ct 进行推理来组织有用信息,并更新上下文
c
t
+
1
=
(
c
t
,
a
^
t
)
c_{t+1} = (c_t, \\hat{a}_t)
ct+1=(ct,a^t),以支持后续的推理或行动。
如图 1 所示,有用的思考可以有多种类型,例如:
- 分解任务目标并创建行动计划(2b,Act 1;1d,Thought 1);
- 注入与任务求解相关的常识知识(2b,Act 1);
- 从观测中提取重要部分(1d,Thought 2、4);
- 跟踪进度并切换行动计划(2b,Act 8);
- 处理异常并调整行动计划(1d,Thought 3);等等。
然而,由于语言空间
L
\\mathcal{L}
L 是无限的,在这个扩展后的动作空间中学习是困难的,需要很强的语言先验。在本文中,我们主要关注这样一种设定:对一个冻结的大语言模型 PaLM-540B(Chowdhery et al., 2022)¹,用少样本上下文示例进行提示,使其为任务求解同时生成领域特定的动作和自由形式的语言思考(图 1 的 (1d) 和 (2b))。每个上下文示例都是一条由动作、思考和环境观测组成的人类求解某个任务实例的轨迹(见附录 C)。对于以推理为主的任务(图 1(1)),我们交替生成思考和动作,使任务求解轨迹由多个"思考-动作-观测"步骤组成(即稠密思考)。相比之下,对于可能涉及大量动作的决策任务(图 1(2)),思考只需要稀疏地出现在轨迹中最相关的位置,因此我们让语言模型自行决定思考与动作的异步出现时机。
¹ 我们在附录 A.1 中展示了一些 GPT-3(Brown et al., 2020)的结果,其表现优于 PaLM-540B。
由于决策与推理能力被整合到同一大语言模型中,ReAct 具有若干独特性质:
- A)直观且易于设计:设计 ReAct 提示很直接——人类标注者只需在自己采取的动作之上,用语言写下他们的思考即可。本文没有使用任何临时的格式选择、思考设计或示例筛选。我们在第 3、4 节详细描述每个任务的提示设计。
- B)通用且灵活:由于思考空间灵活、思考-动作的出现格式灵活,ReAct 适用于动作空间和推理需求各不相同的多样化任务,包括但不限于问答、事实核验、文本游戏和网页导航。
- C)性能强且稳健:ReAct 仅从一例到六例上下文示例中学习,就能对新的任务实例展现出很强的泛化能力,在不同领域 consistently 超过仅推理或仅行动的基线。我们还在第 3 节展示了启用微调后的额外收益,并在第 4 节展示了 ReAct 的性能对提示选择具有稳健性。
- D)与人类对齐且可控:ReAct 提供了一个可解释的顺序决策与推理过程,人类可以轻易地检查其推理和事实正确性。此外,人类还可以通过编辑思考随时控制或纠正智能体的行为,如第 4 节图 5 所示。
3 知识密集型推理任务
我们从知识密集型推理任务开始,例如多跳问答和事实核验。如图 1(1d) 所示,通过与维基百科 API 交互,ReAct 能够检索信息来支撑推理,同时也用推理来决定下一步检索什么,展示了推理与行动的协同。
3.1 实验设置
领域 我们考虑两个具有挑战性的知识检索与推理数据集:
在本工作中,我们在两个任务上都采用**仅问题(question-only)**设定:模型只接收问题/断言作为输入,无法访问支撑段落,必须依赖其内部知识,或通过与外部环境交互来检索知识以支撑推理。
动作空间 我们设计了一个简单的维基百科 Web API,包含三种动作来支持交互式信息检索:
我们注意到,这个动作空间基本上只能基于精确的段落名称检索到段落的一小部分,明显弱于最先进的词汇检索器或神经检索器。这样设计的目的是模拟人类与维基百科交互的方式,并迫使模型通过显式的语言推理来进行检索。
3.2 方法
ReAct 提示 对于 HotpotQA 和 Fever,我们从训练集中分别随机选取 6 个和 3 个案例²,手工构造 ReAct 格式的轨迹,用作提示中的少样本示例。与图 1(d) 类似,每条轨迹由多个"思考-动作-观测"步骤组成(即稠密思考),其中自由形式的思考被用于多种目的。具体来说,我们组合使用了以下类型的思考:
- 分解问题(“我需要搜索 x,找到 y,然后找到 z”);
- 从维基百科观测中提取信息(“x 始于 1844 年”、“这一段没有提到 x”);
- 进行常识推理(“x 不是 y,所以 z 一定是……”)或算术推理(“1844 < 1989”);
- 引导搜索的重新表述(“也许我可以改为搜索/查找 x”);
- 综合最终答案(“……所以答案是 x”)。
更多细节见附录 C。
² 我们发现更多的示例并不能提升性能。
基线方法 我们系统地对 ReAct 轨迹进行消融,构造了多个基线的提示(格式如图 1(1a-1c) 所示):
- (a) 标准提示(Standard):移除 ReAct 轨迹中的所有思考、动作和观测;
- (b) 思维链提示(CoT)(Wei et al., 2022):移除动作和观测,作为"仅推理"基线。我们还构造了一个自一致性基线(CoT-SC)(Wang et al., 2022a;b):在推理时以解码温度 0.7 采样 21 条 CoT 轨迹,并采纳多数答案。实验发现这能持续提升 CoT 的表现;
- © 仅行动提示(Act):移除 ReAct 轨迹中的思考。这大致类似于 WebGPT(Nakano et al., 2021)与互联网交互回答问题的方式,尽管 WebGPT 针对不同的任务和动作空间,且使用模仿学习和强化学习而非提示。
结合内部与外部知识 正如第 3.3 节将详述的,我们观察到 ReAct 展示的问题求解过程更具事实性、更落地(grounded),而 CoT 在构造推理结构方面更准确,但容易受到幻觉事实或幻觉思考的困扰。因此我们提出将 ReAct 与 CoT-SC 结合,并让模型根据以下启发式规则决定何时切换到另一种方法:
- A)ReAct → CoT-SC:当 ReAct 未能在给定步数内返回答案时,退回到 CoT-SC。我们分别为 HotpotQA 和 FEVER 设置了 7 步和 5 步的上限,因为我们发现更多步数不会提升 ReAct 的性能³。
- B)CoT-SC → ReAct:当 n 个 CoT-SC 样本中的多数答案出现次数少于 n/2 次(即内部知识可能无法有把握地支持该任务)时,退回到 ReAct。
³ 在所有最终答案正确的轨迹中,HotpotQA 上步数达到 7 步和 FEVER 上达到 5 步的轨迹分别只占 0.84% 和 1.33%。
微调 由于大规模手工标注推理轨迹和动作具有挑战性,我们考虑一种类似 Zelikman et al. (2022) 的自举(bootstrapping)方法:使用 ReAct 生成的 3,000 条答案正确的轨迹(其他基线同样如此),微调更小的语言模型(PaLM-8/62B),使其在给定输入问题/断言的条件下解码出完整轨迹(所有思考、动作、观测)。更多细节见附录 B.1。
3.3 结果与观察
ReAct 一致优于 Act。 表 1 展示了以 PaLM-540B 为基础模型、使用不同提示方法在 HotpotQA 和 Fever 上的结果。我们注意到 ReAct 在两个任务上都优于 Act,展示了推理对引导行动的价值——尤其是在综合最终答案方面,如图 1(1c-d) 所示。微调结果³也证实了推理轨迹能让行动更加明智。
表 1:PaLM-540B 在 HotpotQA 和 Fever 上的提示结果。
| Standard(标准提示) | 28.7 | 57.1 |
| CoT(Wei et al., 2022) | 29.4 | 56.3 |
| CoT-SC(Wang et al., 2022a) | 33.4 | 60.4 |
| Act(仅行动) | 25.7 | 58.9 |
| ReAct | 27.4 | 60.9 |
| CoT-SC → ReAct | 34.2 | 64.6 |
| ReAct → CoT-SC | 35.1 | 62.0 |
| 有监督 SOTA ᵇ | 67.5 | 89.5 |
ᵃ HotpotQA 上,Wang et al. (2022b) 报告的 Standard、CoT、CoT-SC 的 EM 分别为 27.1、28.9、33.8。 ᵇ Zhu et al. (2021); Lewis et al. (2020)。
图 2:PaLM-540B 提示结果随 CoT-SC 采样数量变化的趋势。在 HotpotQA 和 Fever 两个任务上,ReAct + CoT-SC 的两种组合方法(CoT-SC → ReAct 与 ReAct → CoT-SC)在不同采样数量下都显著且一致地优于纯 CoT-SC——仅用 3-5 个样本就达到了 CoT-SC 用 21 个样本的性能。
ReAct 与 CoT 的对比。 另一方面,ReAct 在 Fever 上优于 CoT(60.9 vs. 56.3),在 HotpotQA 上略逊于 CoT(27.4 vs. 29.4)。Fever 中 SUPPORTS/REFUTES 的断言可能只有细微差别(见附录 D.1),因此通过行动检索准确、最新的知识至关重要。为了更好地理解 ReAct 与 CoT 在 HotpotQA 上的行为差异,我们分别从 ReAct 和 CoT 中随机采样了答案正确和答案错误(以 EM 判定)的各 50 条轨迹(共 200 个样本),并人工标注了它们的成功与失败模式,见表 2。主要观察如下:
表 2:ReAct 和 CoT 在 HotpotQA 上的成功与失败模式类型,以及在人工研究的随机样本中所占百分比。
| 成功-真阳性(True positive) | 推理轨迹与事实均正确 | 94% | 86% |
| 成功-假阳性(False positive) | 存在幻觉的推理轨迹或事实 | 6% | 14% |
| 失败-推理错误 | 推理轨迹错误(包括未能从重复步骤中恢复) | 47% | 16% |
| 失败-搜索结果错误 | 搜索返回为空或不包含有用信息 | 23% | – |
| 失败-幻觉 | 幻觉的推理轨迹或事实 | 0% | 56% |
| 失败-标签歧义 | 预测正确但与标签不精确匹配 | 29% | 28% |
- A)幻觉是 CoT 的严重问题:它导致 CoT 成功模式中的假阳性率远高于 ReAct(14% vs. 6%),并构成 CoT 的主要失败模式(56%)。相比之下,得益于对外部知识库的访问,ReAct 的问题求解轨迹更加落地、以事实为驱动、更可信。
- B)推理、行动与观测步骤的交错提升了 ReAct 的落地性和可信度,但这种结构约束也降低了它构造推理步骤的灵活性,导致其推理错误率高于 CoT。我们注意到有一种 ReAct 特有的高频错误模式:模型重复生成之前的思考和动作。我们将其归类为"推理错误"的一部分,因为模型未能推理出下一步应该采取的恰当动作、跳出循环⁴。
- C)对 ReAct 而言,通过搜索成功检索到有信息量的知识至关重要。 无信息量的搜索占错误案例的 23%,会使模型的推理脱轨,使其难以恢复并重新组织思考。这或许是事实性与灵活性之间意料之中的权衡,也促使我们提出结合两种方法的策略。
我们在附录 E.1 中为每种成功与失败模式提供了示例。我们还发现一些 HotpotQA 问题可能包含过时的答案标签,示例见图 4。
⁴ 我们怀疑这可能是由于贪心解码策略不是最优造成的,未来使用更好的解码方法(如束搜索)可能有助于解决这一问题。
ReAct + CoT-SC 是提示 LLM 的最佳方法。 同样如表 1 所示,HotpotQA 和 Fever 上最佳的提示方法分别是 ReAct → CoT-SC 和 CoT-SC → ReAct。此外,图 2 展示了不同方法随 CoT-SC 采样数量变化的表现。虽然两种 ReAct + CoT-SC 方法各自只在一个任务上占优,但它们在不同采样数量下都显著且一致地优于 CoT-SC:仅用 3-5 个样本就达到了 CoT-SC 用 21 个样本的性能。这些结果表明,在推理任务中恰当地结合模型内部知识与外部知识是有价值的。
微调时 ReAct 表现最佳。 图 3 展示了 HotpotQA 上四种方法(Standard、CoT、Act、ReAct)在提示/微调下的规模效应。对于 PaLM-8/62B,提示 ReAct 在四种方法中表现最差,因为难以从上下文示例中同时学会推理和行动。然而,当仅用 3,000 个样本进行微调后,ReAct 成为四种方法中最好的:PaLM-8B 微调的 ReAct 超过了所有 PaLM-62B 的提示方法,PaLM-62B 微调的 ReAct 超过了所有 540B 的提示方法。相比之下,对 PaLM-8/62B 而言,微调 Standard 或 CoT 都显著差于微调 ReAct 或 Act——因为前者本质上是教模型记忆(可能是幻觉的)知识事实,而后者教模型如何(推理并)行动以从维基百科获取信息,这是一种对知识推理更具泛化性的技能。由于所有提示方法仍显著落后于领域特定的最先进方法(表 1),我们相信用更多人工撰写的数据进行微调可能是释放 ReAct 威力的更好方式。 在这里插入图片描述 
图 3:HotpotQA 上 ReAct(我们的方法)与基线在提示学习和微调下随模型规模(8B、62B、540B)变化的结果。提示设定下 ReAct 在小模型上最差,但微调设定下 ReAct 在各规模上均为最佳。
4 决策任务
我们还在两个基于语言的交互式决策任务上测试了 ReAct:ALFWorld 和 WebShop。这两个任务都具有复杂的环境,要求智能体在稀疏奖励下进行长时程(long-horizon)的行动,因而迫切需要推理来有效地行动与探索。
ALFWorld ALFWorld(Shridhar et al., 2020b)(图 1(2))是一个合成的文本游戏,设计上与具身的 ALFRED 基准(Shridhar et al., 2020a)对齐。它包含 6 类任务,智能体需要通过文本动作(例如"去咖啡桌 1"、“拿起纸 2”、“使用台灯 1”)在模拟的家居环境中导航与交互,以达成一个高层目标(例如"在台灯下查看纸张")。一个任务实例可能有超过 50 个位置,专家策略需要超过 50 步才能解决,因此考验智能体规划和跟踪子目标、以及系统性探索(例如逐个检查所有桌子来找台灯)的能力。特别地,ALFWorld 内建的一个挑战是:需要确定常见家居物品的可能位置(例如台灯很可能在桌子、架子或梳妆台上),这使得该环境非常适合 LLM 利用其预训练的常识知识。
为了给 ReAct 构造提示,我们对每类任务从训练集中随机标注三条轨迹,每条轨迹包含稀疏的思考,用于:(1) 分解目标,(2) 跟踪子目标完成情况,(3) 确定下一个子目标,(4) 通过常识推理判断在哪里能找到某个物体、以及如何处理它。我们在附录 C.4 中展示了用于 ALFWorld 的提示。遵循 Shridhar et al. (2020b),我们在任务特定(task-specific)设定下对 134 个未见过的评估游戏进行评估。为了稳健性,我们为每类任务构造了 6 个提示——即从我们标注的 3 条轨迹中取出 2 条的所有排列。Act 提示用同样的轨迹构造,但不含思考——由于任务实例是从训练集中随机选择的,它既不偏向 ReAct 也不偏向 Act,提供了一个公平、受控的对比,以检验稀疏思考的重要性。基线方面,我们使用 BUTLER(Shridhar et al., 2020b),一个在每类任务 10⁵ 条专家轨迹上训练的模仿学习智能体⁵。
⁵ Micheli & Fleuret (2021) 在 3,553 个任务实例上微调了一个 GPT-2 模型,性能大幅优于 BUTLER,但它是在所有任务类型上联合训练的,因此不作为这里的基线。
WebShop ReAct 还能与有噪声的真实世界语言环境交互以完成实际应用吗?我们考察了 WebShop(Yao et al., 2022)——一个近期提出的在线购物网站环境,包含 118 万个真实世界商品和 1.2 万条人类指令。与 ALFWorld 不同,WebShop 包含大量多样的结构化与非结构化文本(例如从亚马逊爬取的商品标题、描述和选项),要求智能体根据用户指令(例如"我在找一个带抽屉的床头柜。它应该有镍色饰面,价格低于 140 美元")通过网页交互(例如搜索"床头柜 抽屉"、点击"颜色:现代镍白色"之类的按钮或"返回搜索")购买一个商品。该任务在 500 条测试指令上用平均得分(所选商品覆盖期望属性的百分比在所有回合上的平均值)和成功率(所选商品满足全部要求的回合百分比)评估。我们构造的 Act 提示包含搜索、选择商品、选择选项、购买等动作;ReAct 提示则额外加入了推理,用于确定要探索什么、何时购买、以及哪些商品选项与指令相关。示例提示见附录表 6,模型预测见附录表 10。我们对比了一个用 1,012 条人工标注轨迹训练的模仿学习(IL)方法,以及一个额外用 10,587 条训练指令训练的模仿+强化学习(IL+RL)方法。
结果 ReAct 在 ALFWorld(表 3)和 WebShop(表 4)上都优于 Act。在 ALFWorld 上,最佳的 ReAct 尝试取得了 71% 的平均成功率,显著超过最佳的 Act(45%)和 BUTLER(37%)尝试。事实上,即使是最差的 ReAct 尝试(48%)也超过了这两个方法的最佳尝试。此外,ReAct 相对于 Act 的优势在六次受控尝试中保持一致,相对性能提升从 33% 到 90% 不等,平均为 62%。定性地,我们观察到:在完全没有任何思考的情况下,Act 无法正确地将目标分解为更小的子目标,或者丢失对环境当前状态的跟踪。比较 ReAct 和 Act 的示例轨迹见附录 D.2.1 和 D.2.2。
表 3:AlfWorld 任务特定成功率(%)。 BUTLER_g 和 BUTLER 的结果来自 Shridhar et al. (2020b) 的表 4。除 BUTLER 使用束搜索外,所有方法均使用贪心解码。
| Act(6 次中最佳) | 88 | 42 | 74 | 67 | 72 | 41 | 45 |
| ReAct(平均) | 65 | 39 | 83 | 76 | 55 | 24 | 57 |
| ReAct(6 次中最佳) | 92 | 58 | 96 | 86 | 78 | 41 | 71 |
| ReAct-IM(平均) | 55 | 59 | 60 | 55 | 23 | 24 | 48 |
| ReAct-IM(6 次中最佳) | 62 | 68 | 87 | 57 | 39 | 33 | 53 |
| BUTLER_g(8 次中最佳) | 33 | 26 | 70 | 76 | 17 | 12 | 22 |
| BUTLER(8 次中最佳) | 46 | 39 | 74 | 100 | 22 | 24 | 37 |
表 4:WebShop 上的得分与成功率(SR)。 IL/IL+RL 的数据取自 Yao et al. (2022)。
| Act | 62.3 | 30.1 |
| ReAct | 66.6 | 40.0 |
| IL | 59.9 | 29.1 |
| IL+RL | 62.4 | 28.7 |
| 人类专家 | 82.1 | 59.6 |
在 WebShop 上,单示例的 Act 提示已经与 IL 和 IL+RL 方法表现相当。加入额外的稀疏推理后,ReAct 取得了显著更好的表现——比之前最好的成功率绝对提升 10%。通过检查样例,我们发现 ReAct 更可能通过推理来弥合有噪声的观测与动作之间的鸿沟,从而识别出与指令相关的商品和选项(例如"对于’客厅用节省空间的脚凳长椅’,这个商品有’39x18x18 英寸’和’蓝色’选项,看起来可以买。")。然而,现有方法距离人类专家的表现(表 4)仍然很远——人类专家会进行更多的商品探索和查询重构,这对基于提示的方法仍是挑战。
关于内部推理与外部反馈的价值。 据我们所知,ReAct 是首次在闭环系统中将 LLM 的推理与行动相结合并应用于交互式环境的演示。最接近的先前工作或许是 Inner Monologue(IM,Huang et al., 2022b)——其中具身智能体的动作由同名的"内心独白"驱动。然而,IM 的"内心独白"仅限于对环境状态的观测以及智能体为达成目标需要完成什么。相比之下,ReAct 中用于决策的推理轨迹是灵活而稀疏的,允许为不同任务诱导出多样化的推理类型(见第 2 节)。
为了展示 ReAct 与 IM 的差异,并凸显内部推理相对于简单响应外部反馈的重要性,我们进行了一项消融实验,使用由 IM 风格的稠密外部反馈组成的思考模式。如表 3 所示,ReAct 大幅优于 IM 风格的提示(ReAct-IM)(总体成功率 71 vs. 53),在六项任务中的五项上保持一致优势。定性地,我们观察到 ReAct-IM 由于缺乏高层目标分解,经常在判断子目标何时完成、下一个子目标应该是什么时犯错。此外,许多 ReAct-IM 轨迹由于缺乏常识推理,难以确定物品在 ALFWorld 环境中的可能位置。这两个短板都可以在 ReAct 范式中得到解决。关于 ReAct-IM 的更多细节见附录 B.2;ReAct-IM 的示例提示见附录 C.4,示例轨迹见附录 D.2.3。
5 相关工作
用于推理的语言模型 用 LLM 进行推理最著名的工作或许是思维链(CoT,Wei et al., 2022),它揭示了 LLM 能够为问题求解构造自己的"思考过程"的能力。此后出现了若干后续工作,包括用于解决复杂任务的从少到多提示(least-to-most prompting,Zhou et al., 2022)、零样本 CoT(Kojima et al., 2022),以及基于自一致性的推理(Wang et al., 2022a)。最近,Madaan & Yazdanbakhsh (2022) 系统地研究了 CoT 的构造与结构,观察到符号、模式和文本的存在对 CoT 的有效性至关重要。另一些工作则扩展到了超越简单提示的更复杂的推理架构。例如,Selection-Inference(Creswell et al., 2022)将推理过程分为"选择"和"推断"两步;STaR(Zelikman et al., 2022)通过在模型自己生成的正确推理依据上微调模型来自举推理过程;忠实推理(Faithful reasoning,Creswell & Shanahan, 2022)将多步推理分解为三步,每步由一个专门的 LM 完成。类似 Scratchpad(Nye et al., 2021)这样的方法在中间计算步骤上微调 LM,也在多步计算问题上展现了提升。与这些方法不同,ReAct 所做的不只是孤立的、固定的推理,而是将模型的动作及其对应的观测整合进一条连贯的输入流,使模型能够更准确地进行推理,并处理超越推理的任务(例如交互式决策)。
用于决策的语言模型 LLM 的强大能力使其能够执行语言生成之外的任务,将 LLM 用作决策的策略模型——尤其是在交互式环境中——正变得越来越流行。WebGPT(Nakano et al., 2021)使用 LM 与网页浏览器交互、在网页间导航,并从 ELI5(Fan et al., 2019)中推断复杂问题的答案。与 ReAct 相比,WebGPT 不显式建模思考与推理过程,而是依赖昂贵的人类反馈进行强化学习。在对话建模中,BlenderBot(Shuster et al., 2022b)和 Sparrow(Glaese et al., 2022)等聊天机器人,以及 SimpleTOD(Hosseini-Asl et al., 2020)等面向任务的对话系统,也训练 LM 来决策 API 调用。与 ReAct 不同,它们同样不显式考虑推理过程,而且依赖昂贵的数据集和人类反馈收集来进行策略学习。相比之下,ReAct 以便宜得多的方式学习策略,因为决策过程只需要对推理过程的语言描述⁶。
⁶ 人类反馈也可以以互补的方式纳入,但我们将其留作未来工作。
LLM 也越来越多地被用于交互式和具身环境中的规划与决策。在这方面与 ReAct 最相关的或许是 SayCan(Ahn et al., 2022)和 Inner Monologue(Huang et al., 2022b),它们用 LLM 进行机器人动作规划与决策。在 SayCan 中,LLM 被提示直接预测机器人可以采取的动作,然后由一个立足于视觉环境的可供性(affordance)模型进行重排序,得到最终预测。Inner Monologue 进一步改进,加入了同名的"内心独白",实现为从环境注入的反馈。据我们所知,Inner Monologue 是首个展示这种闭环系统的工作,ReAct 正是在其基础上构建的。然而,我们认为 Inner Monologue 并不真正包含内心思考——这一点在第 4 节中已有阐述。我们还注意到,在交互式决策过程中利用语言作为语义丰富的输入,在其他设定下也已被证明是成功的(Abramson et al., 2020; Karamcheti et al., 2021; Huang et al., 2022a; Li et al., 2022)。越来越明显的是,在 LLM 的帮助下,语言作为一种基本的认知机制,将在交互与决策中扮演关键角色。此外,LLM 的进展也催生了如 Reed et al. (2022) 这样通用型智能体的发展。
6 结论
我们提出了 ReAct——一种简单而有效的方法,用于在大语言模型中协同推理与行动。通过在多跳问答、事实核验和交互式决策任务上进行的一系列多样化实验,我们展示了 ReAct 能够带来更优的性能和可解释的决策轨迹。尽管我们的方法很简单,但对于动作空间较大的复杂任务,需要更多的演示示例才能学好,而不幸的是,这很容易超出上下文学习的输入长度限制。我们在 HotpotQA 上探索了微调方法,初步结果令人鼓舞,但从更多高质量人工标注中学习将是进一步提升性能的关键。通过多任务训练扩大 ReAct 的规模,并将其与强化学习等互补范式结合,有望产生更强大的智能体,进一步释放 LLM 在更多应用中的潜力。
致谢
我们感谢谷歌 Brain 团队和普林斯顿 NLP 组中许多人的支持与反馈。本工作部分由美国科学基金会(NSF)第 2107048 号资助支持。本材料中表达的任何观点、发现、结论或建议均为作者本人观点,不一定反映美国科学基金会的立场。
可复现性声明
我们的主要实验是在 PaLM(Chowdhery et al., 2022)上完成的,该模型尚未公开开放访问。为提高可复现性,我们在附录 C 中收录了所有使用的提示,在附录 A.1 中收录了使用 GPT-3(Brown et al., 2020)的补充实验,并在 https://anonymous.4open.science/r/ReAct-2268/ 提供了配套的 GPT-3 ReAct 提示代码。
伦理声明
与以往方法相比,ReAct 提示大语言模型生成的任务求解轨迹对人类而言更具可解释性、可诊断性和可控性。然而,将大语言模型与动作空间挂钩以与外部环境(例如网络、物理环境)交互存在潜在风险,例如查找不当或隐私信息,或在环境中采取有害动作。我们的实验通过将交互限制在不含隐私信息的特定网站(维基百科或 WebShop)、并且在动作空间设计中不包含任何危险动作(即模型无法在研究基准 WebShop 上真正购买商品,也无法编辑维基百科),将此类风险降至最低。我们认为,研究者在未来设计更大规模的实验之前,应当意识到此类风险。
参考文献
- Josh Abramson, Arun Ahuja, Iain Barr, 等. Imitating interactive intelligence, 2020. https://arxiv.org/abs/2012.05672.
- Michael Ahn, Anthony Brohan, Noah Brown, 等. Do as I can, not as I say: Grounding language in robotic affordances, 2022. https://arxiv.org/abs/2204.01691.
- Ben Alderson-Day and Charles Fernyhough. Inner speech: development, cognitive functions, phenomenology, and neurobiology. Psychological Bulletin, 141(5):931, 2015.
- Alan Baddeley. Working memory. Science, 255(5044):556–559, 1992.
- Tom Brown, Benjamin Mann, Nick Ryder, Melanie Subbiah, Jared D Kaplan, 等. Language models are few-shot learners. NeurIPS, 33:1877–1901, 2020.
- Aakanksha Chowdhery, Sharan Narang, Jacob Devlin, 等. PaLM: Scaling language modeling with pathways. arXiv:2204.02311, 2022.
- Antonia Creswell and Murray Shanahan. Faithful reasoning using large language models, 2022. https://arxiv.org/abs/2208.14271.
- Antonia Creswell, Murray Shanahan, and Irina Higgins. Selection-inference: Exploiting large language models for interpretable logical reasoning, 2022. https://arxiv.org/abs/2205.09712.
- Angela Fan, Yacine Jernite, Ethan Perez, 等. ELI5: Long form question answering. In ACL 2019, pp. 3558–3567.
- Charles Fernyhough. Vygotsky, Luria, and the social brain. Self and Social Regulation, pp. 56–79, 2010.
- Amelia Glaese, Nat McAleese, Maja Trebacz, 等. Improving alignment of dialogue agents via targeted human judgements, 2022.
- Ehsan Hosseini-Asl, Bryan McCann, Chien-Sheng Wu, Semih Yavuz, and Richard Socher. A simple language model for task-oriented dialogue. NeurIPS, 33:20179–20191, 2020.
- Wenlong Huang, Pieter Abbeel, Deepak Pathak, and Igor Mordatch. Language models as zero-shot planners: Extracting actionable knowledge for embodied agents. arXiv:2201.07207, 2022a.
- Wenlong Huang, Fei Xia, Ted Xiao, 等. Inner monologue: Embodied reasoning through planning with language models. arXiv:2207.05608, 2022b.
- Siddharth Karamcheti, Megha Srivastava, Percy Liang, and Dorsa Sadigh. LILA: Language-informed latent actions. In CoRL, pp. 1379–1390, 2021.
- Takeshi Kojima, Shixiang Shane Gu, Machel Reid, Yutaka Matsuo, and Yusuke Iwasawa. Large language models are zero-shot reasoners. arXiv:2205.11916, 2022.
- Angeliki Lazaridou, Elena Gribovskaya, Wojciech Stokowiec, and Nikolai Grigorev. Internet-augmented language models through few-shot prompting for open-domain question answering. arXiv:2203.05115, 2022.
- Patrick Lewis, Ethan Perez, Aleksandra Piktus, 等. Retrieval-augmented generation for knowledge-intensive NLP tasks. NeurIPS, 33:9459–9474, 2020.
- Shuang Li, Xavier Puig, Chris Paxton, 等. Pre-trained language models for interactive decision-making, 2022. https://arxiv.org/abs/2202.01771.
- Aleksandr Romanovich Luria. LS Vygotsky and the problem of localization of functions. Neuropsychologia, 3(4):387–392, 1965.
- Aman Madaan and Amir Yazdanbakhsh. Text and patterns: For effective chain of thought, it takes two to tango, 2022. https://arxiv.org/abs/2209.07686.
- Vincent Micheli and François Fleuret. Language models are few-shot butlers. arXiv:2104.07972, 2021.
- Reiichiro Nakano, Jacob Hilton, Suchir Balaji, 等. WebGPT: Browser-assisted question-answering with human feedback, 2021. https://arxiv.org/abs/2112.09332.
- Maxwell Nye, Anders Johan Andreassen, Guy Gur-Ari, 等. Show your work: Scratchpads for intermediate computation with language models, 2021. https://arxiv.org/abs/2112.00114.
- Scott Reed, Konrad Zolna, Emilio Parisotto, 等. A generalist agent, 2022. https://arxiv.org/abs/2205.06175.
- Mohit Shridhar, Jesse Thomason, Daniel Gordon, 等. ALFRED: A benchmark for interpreting grounded instructions for everyday tasks. In CVPR, pp. 10740–10749, 2020a.
- Mohit Shridhar, Xingdi Yuan, Marc-Alexandre Côté, 等. ALFWorld: Aligning text and embodied environments for interactive learning. arXiv:2010.03768, 2020b.
- Kurt Shuster, Mojtaba Komeili, Leonard Adolphs, Stephen Roller, Arthur Szlam, and Jason Weston. Language models that seek for knowledge: Modular search & generation for dialogue and prompt completion. arXiv:2203.13224, 2022a.
- Kurt Shuster, Jing Xu, Mojtaba Komeili, 等. BlenderBot 3: A deployed conversational agent that continually learns to responsibly engage, 2022b. https://arxiv.org/abs/2208.03188.
- James Thorne, Andreas Vlachos, Christos Christodoulopoulos, and Arpit Mittal. FEVER: A large-scale dataset for fact extraction and verification. arXiv:1803.05355, 2018.
- Lev S Vygotsky. Thinking and speech. The Collected Works of LS Vygotsky, 1:39–285, 1987.
- Xuezhi Wang, Jason Wei, Dale Schuurmans, 等. Self-consistency improves chain of thought reasoning in language models, 2022a. https://arxiv.org/abs/2203.11171.
- Xuezhi Wang, Jason Wei, Dale Schuurmans, Quoc Le, Ed Chi, and Denny Zhou. Rationale-augmented ensembles in language models. arXiv:2207.00747, 2022b.
- Jason Wei, Xuezhi Wang, Dale Schuurmans, 等. Chain-of-thought prompting elicits reasoning in large language models. arXiv:2201.11903, 2022.
- Zhilin Yang, Peng Qi, Saizheng Zhang, 等. HotpotQA: A dataset for diverse, explainable multi-hop question answering. arXiv:1809.09600, 2018.
- Shunyu Yao, Rohan Rao, Matthew Hausknecht, and Karthik Narasimhan. Keep CALM and explore: Language models for action generation in text-based games. In EMNLP 2020, pp. 8736–8754.
- Shunyu Yao, Howard Chen, John Yang, and Karthik Narasimhan. WebShop: Towards scalable real-world web interaction with grounded language agents. arXiv:2207.01206, 2022.
- Eric Zelikman, Yuhuai Wu, Jesse Mu, and Noah D. Goodman. STaR: Bootstrapping reasoning with reasoning, 2022. https://arxiv.org/abs/2203.14465.
- Denny Zhou, Nathanael Schärli, Le Hou, 等. Least-to-most prompting enables complex reasoning in large language models, 2022. https://arxiv.org/abs/2205.10625.
- Yunchang Zhu, Liang Pang, Yanyan Lan, Huawei Shen, and Xueqi Cheng. Adaptive information seeking for open-domain question answering. arXiv:2109.06747, 2021.
附录
A 补充结果
A.1 GPT-3 实验
表 5:使用 PaLM-540B 与 GPT-3(text-davinci-002,贪心解码)的 ReAct 提示结果。 在 HotpotQA 上,我们随机抽取了 500 个验证问题的子集;在 ALFWorld 上,我们使用全部 134 个未见过的验证任务实例,并使用按 PaLM-540B 选出的最佳提示集。
| PaLM-540B | 29.4 | 70.9 |
| GPT-3 | 30.8 | 78.4 |
我们运行了额外的 GPT-3(Brown et al., 2020)实验,以确认 ReAct 提示的性能在不同大语言模型之间是通用的。如表 5 所示,GPT-3(text-davinci-002,贪心解码)在 HotpotQA 和 ALFWorld 上都一致优于 PaLM-540B——这可能是因为它经过了人类指令遵循的微调。这表明 ReAct 提示在不同大语言模型、不同任务上都是有效的。这些实验的代码见 https://react-lm.github.io/。
A.2 ReAct 在 HotpotQA 上能获取最新知识
在检查轨迹时,我们还发现有时 ReAct 与数据集标签不一致,是因为标签本身可能已经过时。例如,图 4 中的问题询问一个酒店的规模,而该酒店的规模在 HotpotQA 数据集构建之后有所扩大。Standard 和 CoT 因幻觉给出了错误答案;Act 尽管能访问真实世界的网络交互,但由于缺乏推理来引导"如何与互联网交互以完成问答",仍然失败。只有 ReAct 能够从互联网上检索到最新信息并给出合理的答案。因此,更好地结合推理能力,或能惠及近期的互联网增强语言模型(Nakano et al., 2021; Lazaridou et al., 2022; Shuster et al., 2022a),使其能完成需要最新知识的任务。
图 4:另一个 HotpotQA 示例问题,其原始标签已过时。得益于真实世界的网络交互加上推理,只有 ReAct 能得到最新的答案。
问题:Cirque du Soleil 的演出 Mystère 所在的酒店有多少个房间?(HotpotQA 标签:3,933——已过时)
- (a) 标准提示:答案:2,999。(错误)
- (b) 仅行动:
- 动作 1:搜索[Cirque du Soleil 的演出 Mystère];观察 1:未能找到 [Cirque du Soleil 的演出 Mystère]。相似条目:[Mystère (Cirque du Soleil)]……(一家加拿大娱乐公司)
- 动作 2:搜索[Mystère];观察 2:Mystère(我的/钢铁)是……在加拿大一家定制剧院演出……
- 动作 3:搜索[Mystère (Cirque du Soleil)];观察 3:没有更多结果
- 动作 4:搜索[Mystère (Cirque du Soleil)];观察 4:Mystère(我的/钢铁)是……在金银岛酒店赌场(Treasure Island Hotel and Casino)的定制剧院演出
- 动作 5:查找[金银岛];观察 5:未能找到
- 动作 6:完成[2,999]。(错误)
- © 思维链(仅推理):
- 思考:让我们一步步思考。Mystère 的演出所在的酒店是金银岛酒店。金银岛有 2,884 个房间,所以答案是 2,884。
- 答案:2,884。(错误)
- (d) ReAct(推理+行动):
- 思考 1:我需要搜索 Cirque du Soleil 的演出 Mystère,找到它所在的酒店,然后找到该酒店的房间数。
- 动作 1:搜索[Cirque du Soleil 的演出 Mystère];观察 1:未能找到……
- 思考 2:为了找到酒店,我可以搜索 Mystère(Cirque du Soleil)。
- 动作 2:搜索[Mystère (Cirque du Soleil)];观察 2:Mystère 是……在金银岛酒店赌场(Treasure Island Hotel and Casino)的定制剧院演出。
- 思考 3:Mystère 在金银岛酒店赌场的定制剧院演出。所以我需要搜索金银岛酒店赌场,并找到房间数。
- 动作 3:搜索[金银岛酒店赌场];观察 3:金银岛酒店赌场(Treasure Island Hotel and Casino)……有 2,884 个房间和 220 间套房……
- 思考 4:金银岛酒店赌场有 2,884 个房间和 220 间套房。所以答案是 2,884。(——等等,更新的信息显示房间数已经变化。)
- 动作 4:查找[金银岛酒店赌场];观察 4:Mystère 是……在金银岛酒店赌场演出,该酒店有 2,884 个房间……
- 动作 5:完成[2,884](更新后的正确答案)。
A.3 ALFWorld 上的人类在环(Human-in-the-loop)行为纠正
我们还探索了与 ReAct 进行人类在环的交互,使人类能够检查和编辑 ReAct 的推理轨迹。图 5 展示了:只要简单地在 Act 17 删除一句产生幻觉的思考、并在 Act 23 加入一些提示,ReAct 的行为就会发生巨大改变,与人类的思考编辑对齐,并成功完成任务。从人类的角度看,解决这样的任务变得容易得多——从输入数十个动作,变为只需编辑几条思考——这开启了人机协作的新形式。我们注意到,这种"边运行边编辑策略"的方式,对 Act 和以往的强化学习方法来说是困难的,因为人类无法改变模型参数,而改变几个动作也未必能改变模型其余的行为。这个范式也不仅仅是像 Huang et al. (2022b) 那样通过人类对话来更新目标或子目标——编辑 ReAct 的思考除了能做到这些之外,还能修改模型的内部信念、推理风格,或灵活思考空间所支持的任何内容,从而更好地求解任务。我们认为这是实现人类对齐的一个令人兴奋的方向,并将更系统的研究留作未来工作。 在这里插入图片描述
图 5:ALFWorld 中一个 ReAct 人类在环行为纠正的示例。(a) ReAct 轨迹因一条幻觉思考(Act 17)而失败;(b) 人类仅编辑两条思考(Act 17、23)后,ReAct 轨迹产生了理想的推理轨迹和动作并成功。
任务:你在房间中央。环顾四周,你看到扶手椅 2、橱柜 1、……抽屉 4、梳妆台 1、垃圾桶 1、保险箱 1、架子 1、边桌 1、沙发 1、架子 2。你的任务是:把两把钥匙链放进保险箱。
- (a) 原始 ReAct(失败):
- 动作 1-16:智能体在抽屉 4 中找到钥匙链 1 并拿起。
- 动作 17:思考[现在我找到了钥匙链(1)。接下来,我需要把它放进保险箱。](幻觉思考——实际拿起的是钥匙链 1,但后续行为混乱)
- 动作 18-25:智能体拿起钥匙链 1 放入保险箱 1,然后尝试找第二把钥匙链但失败。
- (b) 人类编辑思考后的 ReAct(成功):
- 动作 17(编辑后):思考[现在我找到了第一把钥匙链(1)。接下来,我需要拿起它。];观察 17:好的。
- 动作 22:把钥匙链 1 放进保险箱 1;观察 22:你把钥匙链 1 放进了保险箱 1。
- 动作 23(编辑后):思考[现在我把第一把钥匙链放进了保险箱。接下来,我需要找到第二把钥匙链,它更可能出现在梳妆台(1)、垃圾桶(1)、保险箱(1)、边桌(1)、沙发(1)、架子(1-2)里。我可以稍后在抽屉 4 里找到第二把钥匙链。];观察 23:好的。
- 动作 24:去梳妆台 1;观察 24:在梳妆台 1 上,你看到一个盒子 1、一个信用卡 1、一把钥匙链 2、一个笔记本电脑 1、一个雕像 1……
- 动作 25:从梳妆台 1 拿起钥匙链 2;观察 25:你从梳妆台 1 拿起了钥匙链 2。
- 动作 26:思考[现在我找到了钥匙链(2)。接下来,我需要把它放进保险箱。];观察 26:好的。
- 动作 27:去保险箱 1;观察 27:在保险箱 1 上,你看到一把钥匙链 1、一个雕像 1 和一个……
- 动作 28:把钥匙链 2 放进保险箱 1。(任务成功)
B 实验细节
B.1 HotpotQA 微调细节
所有微调都使用 64 的批大小。在 PaLM-8B 上,我们将 ReAct 和 Act 方法微调 4,000 步,将 Standard 和 CoT 方法微调 2,000 步。在 PaLM-62B 上,我们将 ReAct 和 Act 方法微调 4,000 步,将 Standard 和 CoT 方法微调 1,000 步。我们发现 ReAct 和 Act 方法通常能从更多的训练步数(和更多训练数据)中获益,而 Standard 和 CoT 方法在微调后不久性能就会退化。
B.2 ALFWorld IM 风格消融细节
对于 IM 风格的消融,我们将 ReAct 使用的同一批专家轨迹重新标注上稠密的外部反馈式思考,使 ReAct-IM 只能思考:(1) 分解当前目标;(2) 当前需要完成的子目标。具体而言,ReAct-IM 缺乏以下思考:(1) 判断一个子目标何时完成;(2) 判断下一个子目标应该是什么;(3) 引导 LLM 调用其内部预训练知识,以确定物品在环境中的可能位置。
C 提示(Prompts)
说明:以下为论文中使用的完整提示。为便于中文读者理解,轨迹内容已译为中文,动作的结构化标记(搜索[…]、查找[…]、完成[…])保留原格式。
C.1 HotpotQA
HotpotQA 提示
标准提示(Original)
问题:科罗拉多造山运动东部区域延伸进入的区域,其海拔范围是多少? 答案:1,800 到 7,000 英尺
问题:音乐人兼讽刺歌手 Allie Goertz 写了一首关于《辛普森一家》角色 Milhouse 的歌,Matt Groening 是以谁的名字给 Milhouse 命名的? 答案:Richard Nixon
问题:哪部纪录片是关于芬兰摇滚乐队的——《Adam Clayton Powell》还是《The Saimaa Gesture》? 答案:The Saimaa Gesture
问题:Nicholas Ray 和 Elia Kazan 有什么共同职业? 答案:导演、编剧、演员
问题:哪本杂志创刊更早——《Arthur’s Magazine》还是《First for Women》? 答案:Arthur’s Magazine
问题:Pavel Urysohn 和 Leonid Levin 以同一类型的工作而知名吗? 答案:是的
仅行动提示(Act)
问题:科罗拉多造山运动东部区域延伸进入的区域,其海拔范围是多少?
- 动作 1:搜索[Colorado orogeny(科罗拉多造山运动)]
- 观察 1:科罗拉多造山运动是发生在科罗拉多及周边地区的一次造山事件(造山运动)。
- 动作 2:查找[东部区域(eastern sector)]
- 观察 2:(结果 1/1)东部区域延伸进入高平原(High Plains),被称为中央平原造山运动。
- 动作 3:搜索[High Plains(高平原)]
- 观察 3:High Plains 指两个不同的陆地区域之一:
- 动作 4:搜索[High Plains (United States)(高平原(美国))]
- 观察 4:高平原是大平原的一个子区域。从东到西,高平原的海拔从约 1,800 英尺上升到 7,000 英尺(550 到 2,130 米)。
- 动作 5:完成[1,800 到 7,000 英尺]
问题:音乐人兼讽刺歌手 Allie Goertz 写了一首关于《辛普森一家》角色 Milhouse 的歌,Matt Groening 是以谁的名字给 Milhouse 命名的?
- 动作 1:搜索[Milhouse]
- 观察 1:Milhouse Mussolini Van Houten 是福克斯动画电视剧《辛普森一家》中的常驻角色,由 Pamela Hayden 配音,由 Matt Groening 创作。
- 动作 2:查找[以……命名(named after)]
- 观察 2:(结果 1/1)Milhouse 以美国总统 Richard Nixon 的名字命名,Nixon 的中间名是 Milhous。
- 动作 3:完成[Richard Nixon]
问题:哪部纪录片是关于芬兰摇滚乐队的——《Adam Clayton Powell》还是《The Saimaa Gesture》?
- 动作 1:搜索[Adam Clayton Powell]
- 观察 1:未能找到 [Adam Clayton Powell]。相似条目:[‘Adam Clayton Powell III’、‘Seventh Avenue (Manhattan)’、‘Adam Clayton Powell Jr. State Office Building’、‘Isabel Washington Powell’、‘Adam Powell’、‘Adam Clayton Powell (film)’、‘Giancarlo Esposito’]。
- 动作 2:搜索[Adam Clayton Powell (film)]
- 观察 2:《Adam Clayton Powell》是一部 1989 年的美国纪录片,由 Richard Kilberg 执导。该片讲述了有影响力的非裔美国政治家 Adam Clayton Powell Jr. 的起落。后来它作为 PBS 系列节目《The American Experience》的一部分播出。
- 动作 3:完成[The Saimaa Gesture]
问题:Nicholas Ray 和 Elia Kazan 有什么共同职业?
- 动作 1:搜索[Nicholas Ray]
- 观察 1:Nicholas Ray(本名 Raymond Nicholas Kienzle Jr.,1911 年 8 月 7 日—1979 年 6 月 16 日)是美国电影导演、编剧和演员,以 1955 年的电影《无因的反叛》最为知名。
- 动作 2:搜索[Elia Kazan]
- 观察 2:Elia Kazan 是美国电影和戏剧导演、制片人、编剧和演员。
- 动作 3:完成[导演、编剧、演员]
问题:哪本杂志创刊更早——《Arthur’s Magazine》还是《First for Women》?
- 动作 1:搜索[Arthur’s Magazine]
- 观察 1:《Arthur’s Magazine》(1844—1846)是 19 世纪在费城出版的美国文学期刊。
- 动作 2:搜索[First for Women]
- 观察 2:《First for Women》是由 Bauer Media Group 在美国出版的女性杂志。该杂志创刊于 1989 年。
- 动作 3:完成[Arthur’s Magazine]
问题:Pavel Urysohn 和 Leonid Levin 以同一类型的工作而知名吗?
- 动作 1:搜索[Pavel Urysohn]
- 观察 1:Pavel Samuilovich Urysohn(1898 年 2 月 3 日—1924 年 8 月 17 日)是苏联数学家,以在维度理论方面的贡献最为知名。
- 动作 2:搜索[Leonid Levin]
- 观察 2:Leonid Anatolievich Levin 是苏联裔美国数学家和计算机科学家。
- 动作 3:完成[是的]
思维链提示(CoT)
问题:科罗拉多造山运动东部区域延伸进入的区域,其海拔范围是多少?
- 思考:让我们一步步思考。科罗拉多造山运动的东部区域延伸进入高平原。高平原的海拔从约 1,800 英尺上升到 7,000 英尺,所以答案是 1,800 到 7,000 英尺。
- 答案:1,800 到 7,000 英尺
问题:音乐人兼讽刺歌手 Allie Goertz 写了一首关于《辛普森一家》角色 Milhouse 的歌,Matt Groening 是以谁的名字给 Milhouse 命名的?
- 思考:让我们一步步思考。Milhouse 以美国总统 Richard Nixon 的名字命名,所以答案是 Richard Nixon。
- 答案:Richard Nixon
问题:哪部纪录片是关于芬兰摇滚乐队的——《Adam Clayton Powell》还是《The Saimaa Gesture》?
- 思考:让我们一步步思考。《Adam Clayton Powell》(电影)是一部关于一位非裔美国政治家的纪录片,不是关于芬兰摇滚乐队的。所以关于芬兰摇滚乐队的纪录片应该是《The Saimaa Gesture》。
- 答案:The Saimaa Gesture
问题:Nicholas Ray 和 Elia Kazan 有什么共同职业?
- 思考:让我们一步步思考。Nicholas Ray 的职业是导演、编剧和演员。Elia Kazan 的职业是导演、制片人、编剧和演员。所以 Nicholas Ray 和 Elia Kazan 的共同职业是导演、编剧和演员。
- 答案:导演、编剧、演员
问题:哪本杂志创刊更早——《Arthur’s Magazine》还是《First for Women》?
- 思考:让我们一步步思考。《Arthur’s Magazine》创刊于 1844 年。《First for Women》创刊于 1989 年。1844(《Arthur’s Magazine》)< 1989(《First for Women》),所以《Arthur’s Magazine》创刊更早。
- 答案:Arthur’s Magazine
问题:Pavel Urysohn 和 Leonid Levin 以同一类型的工作而知名吗?
- 思考:让我们一步步思考。Pavel Urysohn 是数学家。Leonid Levin 是数学家和计算机科学家。所以 Pavel Urysohn 和 Leonid Levin 从事同一类型的工作。
- 答案:是的
ReAct 提示
问题:科罗拉多造山运动东部区域延伸进入的区域,其海拔范围是多少?
- 思考 1:我需要搜索科罗拉多造山运动,找到其东部区域延伸进入的地区,然后找到该地区的海拔范围。
- 动作 1:搜索[Colorado orogeny]
- 观察 1:科罗拉多造山运动是发生在科罗拉多及周边地区的一次造山事件(造山运动)。
- 思考 2:这里没有提到东部区域。所以我需要查找"东部区域"。
- 动作 2:查找[东部区域]
- 观察 2:(结果 1/1)东部区域延伸进入高平原,被称为中央平原造山运动。
- 思考 3:科罗拉多造山运动的东部区域延伸进入高平原。所以我需要搜索高平原,并找到它的海拔范围。
- 动作 3:搜索[高平原]
- 观察 3:High Plains 指两个不同的陆地区域之一:
- 思考 4:我需要改为搜索"高平原(美国)"。
- 动作 4:搜索[高平原(美国)]
- 观察 4:高平原是大平原的一个子区域。从东到西,高平原的海拔从约 1,800 英尺上升到 7,000 英尺(550 到 2,130 米)。
- 思考 5:高平原的海拔从约 1,800 英尺上升到 7,000 英尺,所以答案是 1,800 到 7,000 英尺。
- 动作 5:完成[1,800 到 7,000 英尺]
问题:音乐人兼讽刺歌手 Allie Goertz 写了一首关于《辛普森一家》角色 Milhouse 的歌,Matt Groening 是以谁的名字给 Milhouse 命名的?
- 思考 1:这个问题可以简化为"《辛普森一家》角色 Milhouse 是以谁的名字命名的"。我只需要搜索 Milhouse,并找到它是以谁命名的。
- 动作 1:搜索[Milhouse]
- 观察 1:Milhouse Mussolini Van Houten 是福克斯动画电视剧《辛普森一家》中的常驻角色,由 Pamela Hayden 配音,由 Matt Groening 创作。
- 思考 2:这一段没有说明 Milhouse 是以谁命名的,也许我可以查找"以……命名"。
- 动作 2:查找[以……命名]
- 观察 2:(结果 1/1)Milhouse 以美国总统 Richard Nixon 的名字命名,Nixon 的中间名是 Milhous。
- 思考 3:Milhouse 以美国总统 Richard Nixon 的名字命名,所以答案是 Richard Nixon。
- 动作 3:完成[Richard Nixon]
问题:哪部纪录片是关于芬兰摇滚乐队的——《Adam Clayton Powell》还是《The Saimaa Gesture》?
- 思考 1:我需要搜索《Adam Clayton Powell》和《The Saimaa Gesture》,并找出哪部纪录片是关于芬兰摇滚乐队的。
- 动作 1:搜索[Adam Clayton Powell]
- 观察 1:未能找到 [Adam Clayton Powell]。相似条目:[‘Adam Clayton Powell III’、‘Seventh Avenue (Manhattan)’、‘Adam Clayton Powell Jr. State Office Building’、‘Isabel Washington Powell’、‘Adam Powell’、‘Adam Clayton Powell (film)’、‘Giancarlo Esposito’]。
- 思考 2:为了找到这部纪录片,我可以搜索《Adam Clayton Powell》(电影)。
- 动作 2:搜索[Adam Clayton Powell (film)]
- 观察 2:《Adam Clayton Powell》是一部 1989 年的美国纪录片,由 Richard Kilberg 执导。该片讲述了有影响力的非裔美国政治家 Adam Clayton Powell Jr. 的起落。后来它作为 PBS 系列节目《The American Experience》的一部分播出。
- 思考 3:《Adam Clayton Powell》(电影)是一部关于非裔美国政治家的纪录片,不是关于芬兰摇滚乐队的。所以关于芬兰摇滚乐队的纪录片应该是《The Saimaa Gesture》。
- 动作 3:完成[The Saimaa Gesture]
问题:Nicholas Ray 和 Elia Kazan 有什么共同职业?
- 思考 1:我需要搜索 Nicholas Ray 和 Elia Kazan,找到他们的职业,然后找出他们的共同职业。
- 动作 1:搜索[Nicholas Ray]
- 观察 1:Nicholas Ray(本名 Raymond Nicholas Kienzle Jr.,1911 年 8 月 7 日—1979 年 6 月 16 日)是美国电影导演、编剧和演员,以 1955 年的电影《无因的反叛》最为知名。
- 思考 2:Nicholas Ray 的职业是导演、编剧和演员。我接下来需要搜索 Elia Kazan 并找到他的职业。
- 动作 2:搜索[Elia Kazan]
- 观察 2:Elia Kazan 是美国电影和戏剧导演、制片人、编剧和演员。
- 思考 3:Elia Kazan 的职业是导演、制片人、编剧和演员。所以 Nicholas Ray 和 Elia Kazan 的共同职业是导演、编剧和演员。
- 动作 3:完成[导演、编剧、演员]
问题:哪本杂志创刊更早——《Arthur’s Magazine》还是《First for Women》?
- 思考 1:我需要搜索《Arthur’s Magazine》和《First for Women》,并找出哪本创刊更早。
- 动作 1:搜索[Arthur’s Magazine]
- 观察 1:《Arthur’s Magazine》(1844—1846)是 19 世纪在费城出版的美国文学期刊。
- 思考 2:《Arthur’s Magazine》创刊于 1844 年。我接下来需要搜索《First for Women》。
- 动作 2:搜索[First for Women]
- 观察 2:《First for Women》是由 Bauer Media Group 在美国出版的女性杂志。该杂志创刊于 1989 年。
- 思考 3:《First for Women》创刊于 1989 年。1844(《Arthur’s Magazine》)< 1989(《First for Women》),所以《Arthur’s Magazine》创刊更早。
- 动作 3:完成[Arthur’s Magazine]
问题:Pavel Urysohn 和 Leonid Levin 以同一类型的工作而知名吗?
- 思考 1:我需要搜索 Pavel Urysohn 和 Leonid Levin,找到他们各自的工作类型,然后判断是否相同。
- 动作 1:搜索[Pavel Urysohn]
- 观察 1:Pavel Samuilovich Urysohn(1898 年 2 月 3 日—1924 年 8 月 17 日)是苏联数学家,以在维度理论方面的贡献最为知名。
- 思考 2:Pavel Urysohn 是数学家。我接下来需要搜索 Leonid Levin 并找到他的工作类型。
- 动作 2:搜索[Leonid Levin]
- 观察 2:Leonid Anatolievich Levin 是苏联裔美国数学家和计算机科学家。
- 思考 3:Leonid Levin 是数学家和计算机科学家。所以 Pavel Urysohn 和 Leonid Levin 从事同一类型的工作。
- 动作 3:完成[是的]
C.2 FEVER
FEVER 提示
标准提示(Original):判断观察结果是否 SUPPORTS(支持)或 REFUTES(反驳)一条断言,或者信息不足(NOT ENOUGH INFO)。
断言:Nikolaj Coster-Waldau 曾与福克斯广播公司合作。 答案:SUPPORTS
断言:《怪奇物语》的故事发生在印第安纳州布卢明顿。 答案:REFUTES
断言:《Beautiful》在 2003 年登上了公告牌百强单曲榜第二名。 答案:NOT ENOUGH INFO
仅行动提示(Act):判断观察结果是否 SUPPORTS 或 REFUTES 一条断言,或者信息不足。
断言:Nikolaj Coster-Waldau 曾与福克斯广播公司合作。
- 动作 1:搜索[Nikolaj Coster-Waldau]
- 观察 1:Nikolaj William Coster-Waldau(生于 1970 年 7 月 27 日)是丹麦演员和制片人。他 1993 年毕业于哥本哈根的丹麦国家表演艺术学院,并凭借电影《Nightwatch》(1994)在丹麦获得突破性角色。他在 HBO 奇幻剧《权力的游戏》中饰演 Jaime Lannister,并因此两次获得黄金时段艾美奖剧情类最佳男配角提名……Coster-Waldau 在他的祖国丹麦和斯堪的纳维亚出演了多部电影,包括《Headhunters》(2011)和《A Thousand Times Good Night》(2013)。在美国,他的电影处女作是战争片《黑鹰坠落》(2001),饰演荣誉勋章获得者 Gary Gordon。之后他在福克斯短命电视剧《New Amsterdam》(2008)中饰演一名侦探,并出演了 2009 年福克斯电视电影《Virtuality》(最初计划作为试播集)。
- 动作 2:完成[SUPPORTS]
断言:《怪奇物语》的故事发生在印第安纳州布卢明顿。
- 动作 1:搜索[Stranger Things]
- 观察 1:《怪奇物语》是 Duffer 兄弟创作的美国科幻恐怖电视剧。故事设定在 20 世纪 80 年代,主要在印第安纳州虚构的霍金斯小镇,围绕小镇上发生的一系列神秘和超自然事件及其对一群儿童和成人角色的影响展开。
- 动作 2:完成[REFUTES]
断言:《Beautiful》在 2003 年登上了公告牌百强单曲榜第二名。
- 动作 1:搜索[Beautiful]
- 观察 1:未能找到 [Beautiful]。相似条目:[‘Beautiful’、‘Beautiful, Beautiful’、‘A Beautiful Mind (film)’、‘Beautiful (Christina Aguilera song)’、‘Life Is Beautiful’]。
- 动作 2:搜索[Beautiful (Christina Aguilera song)]
- 观察 2:《Beautiful》是美国歌手 Christina Aguilera 为其第四张录音室专辑《Stripped》(2002)录制的一首歌曲。
- 动作 3:查找[Billboard Hot 100]
- 观察 3:(结果 1/3)这首歌登上了美国公告牌百强单曲榜第二名,并在美国以 50 万张出货量获得金唱片认证。
- 动作 4:完成[NOT ENOUGH INFO]
思维链提示(CoT):判断观察结果是否 SUPPORTS 或 REFUTES 一条断言,或者信息不足。
断言:Nikolaj Coster-Waldau 曾与福克斯广播公司合作。
- 思考:Nikolaj William Coster-Waldau 出演了 2009 年福克斯电视电影《Virtuality》,所以他曾与福克斯广播公司合作。
- 答案:SUPPORTS
断言:《怪奇物语》的故事发生在印第安纳州布卢明顿。
- 思考:《怪奇物语》发生在印第安纳州虚构的霍金斯小镇,不在印第安纳州布卢明顿。
- 答案:REFUTES
断言:《Beautiful》在 2003 年登上了公告牌百强单曲榜第二名。
- 思考:这首歌登上了美国公告牌百强单曲榜第二名,但不确定是否在 2003 年。
- 答案:NOT ENOUGH INFO
ReAct 提示:判断观察结果是否 SUPPORTS 或 REFUTES 一条断言,或者信息不足。
断言:Nikolaj Coster-Waldau 曾与福克斯广播公司合作。
- 思考 1:我需要搜索 Nikolaj Coster-Waldau,并查明他是否与福克斯广播公司合作过。
- 动作 1:搜索[Nikolaj Coster-Waldau]
- 观察 1:(同上,丹麦演员和制片人……出演了 2009 年福克斯电视电影《Virtuality》……)
- 思考 2:因为他"出演了 2009 年福克斯电视电影《Virtuality》",所以他应该曾与福克斯广播公司合作过。
- 动作 2:完成[SUPPORTS]
断言:《怪奇物语》的故事发生在印第安纳州布卢明顿。
- 思考 1:我应该搜索《怪奇物语》,看看它是否发生在印第安纳州布卢明顿。
- 动作 1:搜索[Stranger Things]
- 观察 1:《怪奇物语》是 Duffer 兄弟创作的美国科幻恐怖电视剧。故事设定在 20 世纪 80 年代,主要在印第安纳州虚构的霍金斯小镇……
- 思考 2:观察结果说它发生在"印第安纳州虚构的霍金斯小镇",所以它不发生在布卢明顿。
- 动作 2:完成[REFUTES]
断言:《Beautiful》在 2003 年登上了公告牌百强单曲榜第二名。
- 思考 1:我需要搜索歌曲《Beautiful》,并查明它是否在 2003 年登上了公告牌百强单曲榜第二名。
- 动作 1:搜索[Beautiful]
- 观察 1:未能找到 [Beautiful]。相似条目:[‘Beautiful’、‘Beautiful, Beautiful’、‘A Beautiful Mind (film)’、‘Beautiful (Christina Aguilera song)’、‘Life Is Beautiful’]。
- 思考 2:根据建议,我应该搜索《Beautiful》(Christina Aguilera 歌曲)来找到这首歌。
- 动作 2:搜索[Beautiful (Christina Aguilera song)]
- 观察 2:《Beautiful》是美国歌手 Christina Aguilera 为其第四张录音室专辑《Stripped》(2002)录制的一首歌曲。
- 思考 3:这里没有提到公告牌,所以我需要查找"Billboard Hot 100",以查明它是否在 2003 年登上了该榜第二名。
- 动作 3:查找[Billboard Hot 100]
- 观察 3:(结果 1/3)这首歌登上了美国公告牌百强单曲榜第二名,并在美国以 50 万张出货量获得金唱片认证。
- 思考 4:它只说这首歌登上了公告牌百强单曲榜第二名,但没有说是否在 2003 年。我不确定这条断言是否为真。
- 动作 4:完成[NOT ENOUGH INFO]
C.3 WebShop
表 6:第 4 节 WebShop 实验中使用的提示。 左侧提示用于 Act,右侧提示(加入推理)用于 ReAct。
指令:我想要一瓶 3 盎司的明亮柑橘味敏感肌除臭剂,价格低于 50.00 美元。
- Act 提示:
- 动作:搜索[3盎司 明亮柑橘 除臭剂 敏感肌]
- 观察:[返回搜索] 第 1 页(共 50 条结果)[下一页]
- [B078GWRC1J] Earth Mama 明亮柑橘除臭剂 | 天然安全,适合敏感肌、孕期和哺乳期,含有机金盏花 3 盎司,$10.99
- [B078GTKVXY] Earth Mama 生姜清新除臭剂 | 天然安全,适合敏感肌……3 盎司,$10.99
- [B08KBVJ4XN] Barrel and Oak 无铝除臭剂,男士除臭剂,精油香型,24 小时防臭,雪松与广藿香混合,敏感肌温和(山艾,2.7 盎司,2 件装),$15.95
- 动作:点击[B078GWRC1J]
- 观察:[返回搜索] [上一页] 香型[混合香型][明亮柑橘][舒缓薰衣草][生姜清新][完全无香] 规格[旅行装(4 件装)][3 盎司(1 件装)][3 盎司(2 件装)] Earth Mama 明亮柑橘除臭剂 | ……3 盎司,价格:$10.99,评分:暂无 [描述] [特点] [评论] [立即购买]
- 动作:点击[明亮柑橘];观察:你已点击明亮柑橘。
- 动作:点击[3盎司(1件装)];观察:你已点击 3 盎司(1 件装)。
- 动作:点击[立即购买]
- ReAct 提示:
- 动作:搜索[3盎司 明亮柑橘 除臭剂 敏感肌]
- 观察:(同上,50 条结果)
- 动作:思考[B078GWRC1J 和 B078GTKVXY 都是低于 50 美元的明亮柑橘除臭剂。我可以先查看 B078GWRC1J。];观察:好的。
- 动作:点击[B078GWRC1J]
- 观察:(同上,商品详情页)
- 动作:思考[对于"3 盎司明亮柑橘敏感肌除臭剂",这个商品有"明亮柑橘"和"3 盎司(1 件装)"选项,看起来可以购买。];观察:好的。
- 动作:点击[明亮柑橘];观察:你已点击明亮柑橘。
- 动作:点击[3盎司(1件装)];观察:你已点击 3 盎司(1 件装)。
- 动作:点击[立即购买]
C.4 ALFWorld

表 7:ALFWorld 清洁任务上的一个 Act 提示。 不含任何思考。
你在房间中央。快速环顾四周,你看到橱柜 13、橱柜 12、……、橱柜 1、咖啡机 1、台面 1、餐桌 1、抽屉 1、冰箱 1、垃圾桶 1、微波炉 1、架子 3、架子 2、架子 1、水槽盆 1、炉灶头 4、炉灶头 3、炉灶头 2、炉灶头 1 和烤面包机 1。 你的任务是:把一颗干净的生菜放到餐桌上。
- > 去冰箱 1 → 冰箱 1 是关着的。
- > 打开冰箱 1 → 你打开了冰箱 1。冰箱 1 是开着的。里面有一个杯子 3、一个鸡蛋 2、一个土豆 3 和一个土豆 2。
- > 去餐桌 1 → 在餐桌 1 上,你看到一个苹果 1、一个面包 1、一把黄油刀 2、一个杯子 2、一把叉子 2、一把刀 2、一把刀 1、一个长柄勺 1、一颗生菜 1、一个马克杯 2、一个马克杯 1、一个平底锅 2、一个胡椒研磨瓶 1、一个锅铲 3、一个西红柿 2 和一个西红柿 1。
- > 从餐桌 1 拿起生菜 1 → 你从餐桌 1 拿起了生菜 1。
- > 去水槽盆 1 → 在水槽盆 1 上,你看到一个苹果 2、一个长柄勺 2、一个勺子 1 和一个西红柿 3。
- > 用水槽盆 1 清洗生菜 1 → 你用水槽盆 1 清洗了生菜 1。
- > 去餐桌 1 → (同上)
- > 把生菜 1 放到餐桌 1 上/里 → 你把生菜 1 放到了餐桌 1 上/里。
表 8:ALFWorld 清洁任务上的一个 ReAct 提示。
你在房间中央。(环境同上) 你的任务是:把一颗干净的生菜放到餐桌上。
- > 思考:要解决这个任务,我需要找到并拿起一颗生菜,然后用水槽盆清洗它,再把它放到餐桌上。→ 好的。
- > 思考:首先我需要找到一颗生菜。生菜更可能出现在冰箱(1)、餐桌(1)、水槽盆(1)、炉灶头(1-3)、橱柜(1-13)里。我可以从冰箱 1 开始逐一检查。→ 好的。
- > 去冰箱 1 → 冰箱 1 是关着的。
- > 打开冰箱 1 → 你打开了冰箱 1……(一个杯子 3、一个鸡蛋 2、一个土豆 3 和一个土豆 2)
- > 去餐桌 1 → 在餐桌 1 上,你看到……一颗生菜 1……
- > 思考:现在我找到了一颗生菜(1)。接下来,我需要拿起它。→ 好的。
- > 从餐桌 1 拿起生菜 1 → 你从餐桌 1 拿起了生菜 1。
- > 思考:现在我拿起了一颗生菜(1)。接下来,我需要去水槽盆(1)清洗它。→ 好的。
- > 去水槽盆 1 → 在水槽盆 1 上,你看到一个苹果 2、一个长柄勺 2、一个勺子 1 和一个西红柿 3。
- > 用水槽盆 1 清洗生菜 1 → 你用水槽盆 1 清洗了生菜 1。
- > 思考:现在我清洗了一颗生菜(1)。接下来,我需要把它放到餐桌 1 上/里。→ 好的。
- > 去餐桌 1 → (同上)
- > 把生菜 1 放到餐桌 1 上/里 → 你把生菜 1 放到了餐桌 1 上/里。
表 9:ALFWorld 清洁任务上的一个 ReAct-IM 提示。
你在房间中央。(环境同上) 你的任务是:把一颗干净的生菜放到餐桌上。
- > 思考:要解决这个任务,我需要找到并拿起一颗生菜,然后用水槽盆清洗它,再把它放到餐桌上。→ 好的。
- > 思考:首先我需要找到一颗生菜。→ 好的。
- > 去冰箱 1 → 冰箱 1 是关着的。
- > 思考:首先我需要找到一颗生菜。→ 好的。
- > 打开冰箱 1 → 你打开了冰箱 1……
- > 思考:首先我需要找到一颗生菜。→ 好的。
- > 去餐桌 1 → 在餐桌 1 上,你看到……一颗生菜 1……
- > 思考:首先我需要找到一颗生菜。→ 好的。
- > 从餐桌 1 拿起生菜 1 → 你从餐桌 1 拿起了生菜 1。
- > 思考:我需要用水槽盆 1 清洗这颗生菜(1)。→ 好的。
- > 去水槽盆 1 → 在水槽盆 1 上……
- > 思考:我需要用水槽盆 1 清洗这颗生菜(1)。→ 好的。
- > 用水槽盆 1 清洗生菜 1 → 你用水槽盆 1 清洗了生菜 1。
- > 思考:我需要把这颗清洗过的生菜(1)放到餐桌 1 上/里。→ 好的。
- > 去餐桌 1 → (同上)
- > 思考:我需要把这颗清洗过的生菜(1)放到餐桌 1 上/里。→ 好的。
- > 把生菜 1 放到餐桌 1 上/里 → 你把生菜 1 放到了餐桌 1 上/里。
D 轨迹示例
D.1 FEVER 轨迹
以下展示 ReAct、CoT 和 Act 在 FEVER 开发集若干随机选取样本上产生的轨迹。为节省篇幅,搜索结果已省略。
示例 2491(真实标签:REFUTES)
- ReAct:
- 断言:百慕大三角是太平洋中一个定义模糊的区域。
- 思考 1:我需要搜索百慕大三角,并查明它是否在太平洋中。
- 动作 1:搜索[Bermuda Triangle];观察 1:据报告闹鬼的地点……
- 思考 2:观察结果说它位于北大西洋的西部,所以它不在太平洋中。
- 动作 2:完成[REFUTES];观察 2:回合结束。
- Act:
- 动作 1:搜索[Bermuda Triangle];观察 1:据报告闹鬼的地点……
- 动作 2:完成[REFUTES];观察 2:回合结束。
- CoT:
- 思考:让我们一步步思考。百慕大三角是大西洋中一个定义模糊的区域。太平洋不是大西洋。
- 答案:REFUTES
示例 5908(真实标签:SUPPORTS)
- ReAct:
- 断言:《幽灵公主》是一部电影。
- 思考 1:我需要搜索《幽灵公主》,并查明它是否是一部电影。
- 动作 1:搜索[Princess Mononoke];观察 1:《幽灵公主》……
- 思考 2:从观察结果来看,它说《幽灵公主》是一部电影。
- 动作 2:完成[SUPPORTS];观察 2:回合结束。
- Act:动作 1:搜索[Princess Mononoke];观察 1:……;动作 2:完成[SUPPORTS];回合结束。
- CoT:思考:让我们一步步思考。《幽灵公主》是一部 movie(影片),而影片就是电影。答案:SUPPORTS
示例 1951(真实标签:REFUTES)
- ReAct:
- 断言:联盟号(Soyuz)曾是美国太空计划的一部分。
- 思考 1:我需要搜索联盟号,并查明它是否曾是美国太空计划的一部分。
- 动作 1:搜索[Soyuz];观察 1:Soyuz 是一个音译词……
- 思考 2:这里没有提到美国太空计划,所以我需要搜索"美国太空计划",看看它是否属于其中。
- 动作 2:搜索[美国太空计划];观察 2:太空政策……
- 思考 3:这里没有提到联盟号,所以我不确定这条断言是否为真。
- 动作 3:完成[NOT ENOUGH INFO];回合结束。(错误——正确答案是 REFUTES,但 ReAct 至少没有产生幻觉)
- Act:动作 1:搜索[Soyuz];观察 1:……;动作 2:完成[NOT ENOUGH INFO];回合结束。
- CoT:
- 思考:让我们一步步思考。联盟号是俄罗斯的航天器。美国太空计划是 NASA。NASA 和俄罗斯曾在国际空间站上合作。
- 答案:SUPPORTS(错误——典型的 CoT 幻觉失败:推理看似合理但结论错误)
示例 3208(真实标签:REFUTES)
- ReAct:
- 断言:《Reign Over Me》是一部 2010 年制作的美国电影。
- 思考 1:我需要搜索《Reign Over Me》,并查明它是否是一部 2010 年制作的美国电影。
- 动作 1:搜索[Reign Over Me];观察 1:《Reign Over Me》……
- 思考 2:观察结果说它是一部 2007 年制作的美国电影,所以它不是 2010 年制作的。
- 动作 2:完成[REFUTES];回合结束。(正确)
- Act:动作 1:搜索[Reign Over Me];动作 2:完成[SUPPORTS];回合结束。(错误)
- CoT:
- 思考:让我们一步步思考。首先,《Reign Over Me》是美国电影吗?是的。其次,它是 2010 年制作的吗?是的。
- 答案:SUPPORTS(错误)
D.2 ALFWorld 轨迹
以下展示 ReAct、Act 和 ReAct-IM 在同一个 ALFWorld 游戏(pick_clean_then_place_in_recep-Knife-None-CounterTop-10/trial_T20190909_110445_675754)上的示例轨迹。
D.2.1 ReAct 轨迹
ReAct 能够正确地找到刀,清洗它,然后把它放到台面上。
你在房间中央。快速环顾四周,你看到橱柜 6、……、橱柜 1、咖啡机 1、台面 3、台面 2、台面 1、抽屉 3、抽屉 2、抽屉 1、冰箱 1、垃圾桶 1、微波炉 1、架子 3、架子 2、架子 1、水槽盆 1、炉灶头 4、……和烤面包机 1。 你的任务是:把一把干净的刀放到台面上。
- > 思考:要解决这个任务,我需要找到并拿起一把刀,然后用水槽盆清洗它,再把它放到台面上。→ 好的。
- > 思考:首先我需要找到一把刀。刀更可能出现在橱柜(1-6)、抽屉(1-3)、台面(1-3)、冰箱(1)、垃圾桶(1)、架子(1-3)、水槽盆(1)、炉灶头(1-4)、烤面包机(1)里。我可以从橱柜 1 开始逐一检查。→ 好的。
- > 去橱柜 1 → 在橱柜 1 上,你看到一个碗 1。
- > 去橱柜 2 → 橱柜 2 是关着的。
- > 去橱柜 3 → 在橱柜 3 上,你看到一个玻璃瓶 1。
- > 去橱柜 4 → 在橱柜 4 上,你看到一个马克杯 1。
- > 去橱柜 5 → 橱柜 5 是关着的。
- > 去橱柜 6 → 橱柜 6 是关着的。
- > 去抽屉 1 → 抽屉 1 是关着的。
- > 去抽屉 2 → 抽屉 2 是关着的。
- > 去抽屉 3 → 抽屉 3 是关着的。
- > 去台面 1 → 在台面 1 上,你看到一颗生菜 2、一个马克杯 2、一个胡椒研磨瓶 1 和一个勺子 2。
- > 去台面 2 → 在台面 2 上,你看到一个杯子 1、一块洗碗海绵 1、一个玻璃瓶 3、一把刀 1、一个盘子 2、一个土豆 3 和一个雕像 1。
- > 思考:现在我找到了一把刀(1)。接下来,我需要拿起它。→ 好的。
- > 从台面 2 拿起刀 1 → 你从台面 2 拿起了刀 1。
- > 思考:现在我拿起了一把刀(1)。接下来,我需要去水槽盆(1)清洗它。→ 好的。
- > 去水槽盆 1 → 在水槽盆 1 上,你看到一把叉子 3、一颗生菜 3 和一个锅铲 2。
- > 用水槽盆 1 清洗刀 1 → 你用水槽盆 1 清洗了刀 1。
- > 思考:现在我清洗了一把刀(1)。接下来,我需要把它放到台面 1 上/里。→ 好的。
- > 去台面 1 → 在台面 1 上,你看到一颗生菜 2、一个马克杯 2、一个胡椒研磨瓶 1 和一个勺子 2。
- > 把刀 1 放到台面 1 上/里 → 你把刀 1 放到了台面 1 上/里。(任务成功)
D.2.2 Act 轨迹
Act 能够正确地找到刀,但它在真正走到水槽盆之前就试图用水槽盆清洗刀。从那以后,模型无法恢复,陷入不断重复同一串命令的状态。而如果使用 ReAct,一条已有的思考会明确地指出刀已经被拿起、且下一个子目标是去水槽盆清洗它。
你在房间中央。(环境同上) 你的任务是:把一把干净的刀放到台面上。
- > 去台面 1 → 在台面 1 上,你看到一颗生菜 2、一个马克杯 2、一个胡椒研磨瓶 1 和一个勺子 2。
- > 去台面 2 → 在台面 2 上,你看到……一把刀 1……
- > 从台面 2 拿起刀 1 → 你从台面 2 拿起了刀 1。
- > 去台面 1 → 在台面 1 上……
- > 用水槽盆 1 清洗刀 1 → 什么也没发生。(人不在水槽盆旁)
- > 去台面 3 → 在台面 3 上,你看到一个面包 3、一把黄油刀 2、一部手机 1、一张信用卡 1、一把叉子 2、一株室内植物 1、一把刀 2、一个锅铲 1、一个雕像 3、一个西红柿 3、一个西红柿 2、一个西红柿 1 和一个花瓶 2。
- > 从台面 3 拿起刀 2 → 什么也没发生。(手上已拿着刀 1)
- > 去台面 2 → ……
- > 从台面 2 拿起刀 1 → 什么也没发生。
- > 去台面 1 → ……
- > 用水槽盆 1 清洗刀 1 → 什么也没发生。
- ("去台面 3 → 拿刀 2 → 去台面 2 → 拿刀 1 → 去台面 1 → 清洗刀 1"的循环不断重复,直到步数耗尽,任务失败)
D.2.3 ReAct-IM 轨迹
ReAct-IM 能够正确地找到刀,但同样无法清洗它。LLM 随后卡在反复尝试把这把刀放到台面上。一个可能的问题是那条不正确的思考——“思考:我需要找到一把干净的刀”——它似乎让 LLM 误以为刀已经被清洗过了。而在 ReAct 中,这个子目标序列会被每条思考具体地捕获。
你在房间中央。(环境同上) 你的任务是:把一把干净的刀放到台面上。
- > 思考:要解决这个任务,我需要找到并拿起一把干净的刀,然后把它放到台面上。→ 好的。
- > 思考:我需要找到一把干净的刀。→ 好的。
- > 去台面 1 → 在台面 1 上……
- > 思考:我需要找到一把干净的刀。→ 好的。
- > 去台面 2 → 在台面 2 上,你看到……一把刀 1……
- > 思考:我需要找到一把干净的刀。→ 好的。
- > 从台面 2 拿起刀 1 → 你从台面 2 拿起了刀 1。(跳过了清洗子目标!)
- > 思考:我需要把这把刀(1)放到台面 1 上/里。→ 好的。
- > 去台面 1 → 在台面 1 上……
- > 思考:我需要把这把刀(1)放到台面 1 上/里。→ 好的。
- > 把刀 1 放到台面 1 上/里 → 你把刀 1 放到了台面 1 上/里。(但刀不干净,任务未达成)
- > 思考:我需要把这把刀(1)放到台面 1 上/里。→ 好的。
- > 把刀 1 放到台面 1 上/里 → 什么也没发生。
- ("思考→放置→什么也没发生"的循环不断重复,任务失败)
D.3 WebShop 轨迹
表 10:Act 和 ReAct 在 WebShop 上预测的示例轨迹。 与 Act 相比,ReAct 使用推理来找到满足所有目标属性的商品。
指令:给我买一件十六包装的苹果肉桂味冻干香蕉片,价格低于 50.00 美元。
- Act 轨迹:
- 动作:搜索[十六包装 苹果肉桂 冻干香蕉片]
- 观察:[返回搜索] 第 1 页(共 50 条结果)[下一页]
- [B0061IVFZE] Brothers-ALL-Natural 水果脆片,草莓香蕉味,0.42 盎司(100 件装),$85.00
- [B096H2P6G2] Moon Fruit 冻干水果零食,儿童水果零食(混合装),$18.99
- [B092JLLYK6] Nature’s Turn 冻干水果零食——香蕉脆片——完美适合学校午餐或随身零食——无添加糖、非转基因、无麸质、无人工成分(0.53 盎司)6 件装,$12.99
- 动作:点击[B0061IVFZE](100 件装草莓香蕉脆片——属性不符)
- 观察:商品详情页,香型[亚洲梨][香蕉][富士苹果&肉桂][草莓香蕉],价格 $85.00……
- 动作:点击[立即购买] → 得分:0.125(失败:规格、口味、价格均不符)
- ReAct 轨迹:
- 动作:搜索[十六包装 苹果肉桂 冻干香蕉片]
- 观察:(同上 50 条结果)
- 动作:思考[B0061IVFZE 是草莓香蕉味,不是苹果肉桂味。B096H2P6G2 是水果零食,不是冻干香蕉片。B092JLLYK6 是香蕉脆片,不是苹果肉桂味。我可以先查看 B092JLLYK6。];观察:好的。
- 动作:点击[B092JLLYK6]
- 观察:商品详情页,香型[苹果][苹果肉桂][香蕉][哈密瓜][桃][梨][草莓][草莓香蕉][样品混合装][超值混合装][果园混合装],规格[0.53 盎司(6 件装)][0.53 盎司(8 件装)][0.53 盎司(16 件装)],价格 $12.99……
- 动作:思考[对于"十六包装苹果肉桂冻干香蕉片",这个商品有"苹果肉桂"和"0.53 盎司(16 件装)"选项,看起来可以购买。];观察:好的。
- 动作:点击[苹果肉桂];观察:你已点击苹果肉桂。
- 动作:点击[0.53盎司(16件装)];观察:你已点击 0.53 盎司(16 件装)。
- 动作:点击[立即购买] → 得分:1.0(完美成功)
E 更多分析
E.1 成功与失败模式分析
以下是与第 3.3 节的成功与错误模式分析相对应的示例。为节省篇幅,搜索结果和不具代表性的步骤已省略。
成功:真阳性(True positive)
- ReAct:
- 问题:作家 David Chanoff 曾与一位美国海军上将合作,这位上将曾在哪位总统任内担任驻英国大使?
- 思考 1:我需要搜索 David Chanoff,找到他合作过的美国海军上将。
- 动作 1:搜索[David Chanoff];观察 1:David Chanoff 是一位著名作家……
- 动作 2:搜索[William J. Crowe];观察 2:William J. Crowe 是……
- 思考 3:William J. Crowe 曾在 Bill Clinton 总统任内担任驻英国大使。所以答案是 Bill Clinton。
- 动作 3:完成[Bill Clinton];回合结束。(正确)
- CoT:
- 问题:在覆盖美国西部广大地区(包括亚利桑那、加利福尼亚和新墨西哥)的联盟中,代表一所亚利桑那州大学的球队叫什么名字?
- 思考:让我们一步步思考。……是亚利桑那州立太阳恶魔队(Arizona State Sun Devils)。
- 答案:亚利桑那州立太阳恶魔队(正确)
成功:假阳性(False positive)——答案碰巧正确但推理或事实有幻觉
- ReAct:
- 问题:桌游《San Marco》和《About Time》哪个先出版?
- 思考 1:我需要搜索《San Marco》和《About Time》,找出哪个先出版。
- 动作 1:搜索[San Marco];观察 1:San Marco 是……它建于威尼斯。(检索到了无关的城区条目)
- 思考 2:San Marco 是威尼斯的一个区(sestiere)。我接下来需要搜索《About Time》。
- 动作 2:搜索[About Time];观察 2:未能找到 [About Time]。相似条目:[……]。
- 思考 3:《About Time》是一部 2013 年的电影。所以《San Marco》先出版。
- 动作 3:完成[San Marco];回合结束。(答案碰巧正确,但推理基于幻觉/错误信息)
- CoT:
- 问题:范德堡大学和埃默里大学哪个先建校?
- 思考:让我们一步步思考。范德堡大学建校于 1873 年。埃默里大学建校于 1836 年。1873(范德堡)> 1836(埃默里),所以范德堡大学先建校。(推理自相矛盾:先推出 1873 > 1836,结论却说"范德堡先建校")
- 答案:埃默里大学(答案碰巧正确)
失败:推理错误
- ReAct:
- 问题:在《Hairspray》中与 Harvey Fierstein、Linda Hart、Dick Latessa、Clarke Thorell、Mary Bond Davis、Laura Bell Bundy、Matthew Morrison、Corey Reynolds 和 Marissa Jaret Winokur 共同出演的女演员,她的中间名是什么?
- 思考 1:我需要搜索 Harvey Fierstein、Linda Hart、……、Marissa Jaret Winokur,找到在《Hairspray》中与他们共同出演的女演员,然后找到她的中间名。(对问题的分解失败——应该直接搜索《Hairspray》的演员表,而不是逐个搜索男演员)
- 动作 1:搜索[Harvey Fierstein];观察 1:Harvey Forbes Fierstein……
- 思考 2:Harvey Fierstein 是演员、剧作家和编剧。我接下来需要搜索 Linda Hart……(沿着错误的推理路径越走越远)
- CoT:
- 问题:Danny Green 和 James Worthy 谁年纪更大?
- 思考:让我们一步步思考。Danny Green 生于 1987 年。James Worthy 生于 1961 年。1987(Danny Green)> 1961(James Worthy),所以 Danny Green 年纪更大。(比较方向错误)
- 答案:Danny Green(错误)
失败:搜索错误
- ReAct:
- 问题:与女神弗丽嘉(Frigg)相关联的女神由哪些故事组成?
- 思考 1:我需要搜索女神弗丽嘉,并找到与她相关联的女神。
- 动作 1:搜索[女神 frigg];观察 1:未能找到女神 frigg。相似条目:[‘Frigg’、‘Frigg and Freyja common origin hypothesis’、‘Freyja’("与 Frigg 及其他女神的关系"一节)、‘Eir’、‘Baldr’]。
- 思考 2:我需要改为搜索 Frigg……(搜索词选择不当导致检索失败,推理被带偏)
失败:幻觉
- CoT:
- 问题:一家位于布朗克斯的机构出版的科学期刊,首次出版于哪一年?
- 思考:让我们一步步思考。一家位于布朗克斯的机构出版的科学期刊首次出版于 1916 年。(完全幻觉出来的事实)
- 答案:1916(标签:1909)
失败:标签歧义
- ReAct:
- 问题:开发"独裁者博弈"(dictator game)的人是什么国籍?
- 思考 1:我需要搜索独裁者博弈,找到开发它的人,然后找到他的国籍。
- 动作 1:搜索[独裁者博弈];观察 1:独裁者博弈是社会心理学和经济学中一种流行的实验工具……
- 动作 3:搜索[Amos Tversky];观察 3:Amos Nathan Tversky……
- 思考 4:Amos Tversky 是一位以色列认知与数学心理学家。所以开发独裁者博弈的人是以色列人。
- 动作 4:完成[以色列](标签:以色列-美国)——预测实质上正确,但与标签不精确匹配。
- CoT:
- 问题:来自加州斯托克顿的 Kurt Fuller 出演了 Steve Franks 创作的哪部美国侦探喜剧剧情电视剧?
- 思考:让我们一步步思考。来自加州斯托克顿的 Kurt Fuller 出演了《Psych》。《Psych》是 Steve Franks 创作的一部美国侦探喜剧剧情电视剧。
- 答案:Psych(标签:Psych is an American detective comedy-drama)——同样因标签精确匹配问题被误判。
译者注:本译文基于 arXiv:2210.03629v3(ICLR 2023 正式版)完整翻译,覆盖摘要、正文第 1-6 节、致谢、可复现性与伦理声明、参考文献及全部附录(A-E)。图 1、4、5 为原文中的轨迹对比图,译文以文字形式完整还原了图中展示的轨迹内容。数学符号与公式已按 LaTeX 格式保留。原文中的"Thought/Action/Observation"分别译为"思考/动作/观察",“reasoning trace"译为"推理轨迹”,“grounded"译为"落地(的)”,“hallucination"译为"幻觉”。
网硕互联帮助中心




评论前必须登录!
注册