ReAct(Reasoning and Acting) 是一种思考与行动紧密结合的范式,让智能体边想边做,动态调整。

工作流程

在ReAct诞生之前,模型解决问题的方式主要包括两种:

  • 推理型:“思维链(Chain-of-Thought)”引导模型进行复杂的逻辑推理。
  • 行动型:模型直接输出要执行的动作。

ReAct将推理与行动显式结合了起来,形成一个“思考-行动-观察”的循环。

image-20260731173933255

  1. Thought:智能体分析当前情况,分解任务制定下一步计划或者反思上一步结果的结论。
  2. Action:智能体采取的具体动作,如工具调用等。
  3. Observation:执行动作后智能体返回的结果。

具体来说,在每个时间步 $t$,智能体的策略(即大语言模型 $\pi$)会根据初始问题 $q$ 和之前所有步骤的”行动-观察”历史轨迹 $((a_1, o_1), \dots, (a_{t-1}, o_{t-1}))$,来生成当前的思考 $th_t$ 和行动 $a_t$:

$$ (th_t, a_t) = \pi(q, (a_1, o_1), \dots, (a_{t-1}, o_{t-1})) $$

随后,环境中的工具 $T$ 会执行行动 $a_t$,并返回一个新的观察结果 $o_t$:

$$ o_t = T(a_t) $$