
预训练阶段
这个阶段的目标是让模型学习语言的基本规律和世界知识,这个阶段使用海量数据,通过自监督学习的方式训练模型:训练信号来自文本本身,如根据上下文预测下一个词。最常见的任务是因果语言建模。
$\mathcal{L}_{\text{pretrain}} = -\sum_{t=1}^{T} \log P(x_t | x_1, x_2, \dots, x_{t-1}; \theta)$
强化学习阶段
策略优化(Policy Optimization)是强化学习的核心问题之一,本章列举3种重要的策略优化方法。
PPO
LLM PPO是OpenAI提出的基于策略梯度(Policy Gradient)的强化学习方法,采用Actor-Critic结构,结合策略梯度和价值函数估计进行训练。它的核心思想是在策略更新时对变化幅度进行约束,提高训练稳定性。
[!NOTE]
强化学习算法目前分为两大类:
1.基于值函数的强化学习
基于值函数的强化学习通过递归求解贝尔曼方程来维护Q值函数,每次选择状态下Q值最大的动作,使未来积累的奖励值最大。经典的基于值函数的强化学习算法有Q-Learning、DQN等。这些算法学习后的Q值函数不再变化,每次做出的策略也是确定的。
2.基于策略的强化学习
基于策略的强化学习不再通过价值函数来确定动作,而是直接学习策略本身(即选择动作的方法),通过一组参数来对选择策略参数的方法进行优化。