ReAct(Reasoning and Acting) 是一种思考与行动紧密结合的范式,让智能体边想边做,动态调整。
工作流程
在ReAct诞生之前,模型解决问题的方式主要包括两种:
- 推理型:“思维链(Chain-of-Thought)”引导模型进行复杂的逻辑推理。
- 行动型:模型直接输出要执行的动作。
ReAct将推理与行动显式结合了起来,形成一个“思考-行动-观察”的循环。

- Thought:智能体分析当前情况,分解任务制定下一步计划或者反思上一步结果的结论。
- Action:智能体采取的具体动作,如工具调用等。
- Observation:执行动作后智能体返回的结果。
具体来说,在每个时间步 $t$,智能体的策略(即大语言模型 $\pi$)会根据初始问题 $q$ 和之前所有步骤的”行动-观察”历史轨迹 $((a_1, o_1), \dots, (a_{t-1}, o_{t-1}))$,来生成当前的思考 $th_t$ 和行动 $a_t$:
$$
(th_t, a_t) = \pi(q, (a_1, o_1), \dots, (a_{t-1}, o_{t-1}))
$$
随后,环境中的工具 $T$ 会执行行动 $a_t$,并返回一个新的观察结果 $o_t$:
$$
o_t = T(a_t)
$$