AB
AiBoss站
百科

什么是近端策略优化(Proximal Policy Optimization)?

近端策略优化(PPO)是 John Schulman 等人在 2017 年论文中提出的一族策略梯度强化学习方法。它通过与环境的交互采样数据,再用随机梯度上升优化一个「替代」目标函数,其目标函数允许对同一批数据做多个轮次的小批量更新。论文称它具备信赖域策略优化(TRPO)的部分优点,但实现更简单、更通用,经验上的样本复杂度也更好。

近端策略优化(Proximal Policy Optimization,缩写 PPO)是一族用于强化学习的策略梯度(policy gradient)方法,由 John Schulman、Filip Wolski、Prafulla Dhariwal、Alec Radford 与 Oleg Klimov 在 2017 年的论文《Proximal Policy Optimization Algorithms》中提出。按该论文的表述,这类方法在「与环境交互采样数据」和「用随机梯度上升优化一个替代(surrogate)目标函数」之间交替进行。它要解决的问题是:标准策略梯度方法每份数据样本只做一次梯度更新,数据利用率低;而信赖域类方法虽然约束了更新幅度,却实现复杂。PPO 提出的新目标函数允许对同一批数据做多个轮次(epoch)的小批量更新,从而在样本效率与实现难度之间取得折中。

为什么重要

在 PPO 出现之前,策略梯度方法的主流做法是:采集一批轨迹,估计策略梯度,做一次更新,然后把数据丢掉。这种「一份数据一次更新」的模式在样本效率上代价很高——强化学习中的样本通常来自昂贵的真实交互或耗时的仿真,反复采样往往是最贵的环节。

另一条路线是信赖域策略优化(Trust Region Policy Optimization,TRPO)。它通过约束新旧策略之间的差异来控制每次更新的步长,避免策略一步走得太远而崩溃。但论文指出,TRPO 的代价是复杂度:它需要求解带约束的优化问题,实现和调参都更麻烦。

PPO 的动机正来自这个夹缝。论文声称,PPO 具备 TRPO 的「部分优点」,同时「实现起来简单得多、更通用,并且(经验上)有更好的样本复杂度」。换句话说,它试图把「限制策略更新幅度」这一安全机制,从复杂的约束优化改写成可以直接用一阶梯度方法优化的目标函数形式。论文的实验覆盖了仿真机器人运动控制和 Atari 游戏等基准任务,并称 PPO 优于其他在线策略梯度方法,在样本复杂度、简单性和实际运行时间之间取得了较好的平衡。

工作机制

按论文的描述,PPO 的核心可以拆成以下几个要点。

  • 交替循环。 算法在两步之间反复:先用当前策略与环境交互、采样一批数据;再在这批数据上用随机梯度上升优化替代目标函数。这与一般的策略梯度框架一致,区别在于第二步能做多少。
  • 替代目标函数。 论文的关键贡献是提出一个新的目标函数。它不是直接对期望回报求梯度,而是构造一个可用已有数据估计的「替代」目标,使得优化这个替代目标等价于(或近似于)改进真实策略。
  • 多轮次小批量更新。 标准策略梯度方法每份样本只做一次梯度更新;PPO 的目标函数设计使得同一批采样数据可以被反复使用,做多个轮次的小批量更新。这是它提升样本效率的直接来源。
  • 限制更新幅度。 之所以能安全地重复使用同一批数据,前提是每次更新不能让新策略偏离采样时的旧策略太远——否则用旧数据估计的目标就不再可信。PPO 通过目标函数本身对偏离程度施加惩罚或裁剪,把「近端」(proximal)这一约束内化进优化目标,而不必像信赖域方法那样显式求解约束问题。
  • 通用性。 论文强调该方法是「一族」方法而非单一算法,并称其更通用,可适用于不同的策略参数化与任务设定。

需要说明的是,上述机制描述来自论文自身的表述。论文对具体目标函数形式、裁剪或惩罚项的具体写法给出了定义,本词条不展开公式细节;读者应以原文为准。

典型例子

论文中给出的实验场景包括以下几类,均为该论文报告的基准任务:

  • 仿真机器人运动控制。 论文在仿真机器人 locomotion 类任务上测试 PPO,这类任务通常要求连续控制,对策略更新的稳定性敏感。
  • Atari 游戏。 论文也在 Atari 游戏上做了测试,这类任务以离散动作和高维视觉输入为特征,是当时强化学习常用的评测基准。
  • 与其他在线策略梯度方法的对比。 论文称在这些基准上 PPO 优于其他在线策略梯度方法,并在样本复杂度、简单性和 wall-time(实际运行时间)之间取得较好的平衡。

论文摘要中提到的对比对象是「其他在线策略梯度方法」,以及作为动机来源的 TRPO。除此之外,本词条不引用论文未提及的具体系统、模型或数值结果。

边界与常见误解

它不是「无需调参的万能算法」。 论文的表述是「更简单、更通用、经验上样本复杂度更好」,这是相对于 TRPO 而言的比较性主张,而非绝对保证。论文中的「经验上」(empirically)一词表明样本复杂度优势来自实验观察,不是理论证明。

「近端」不等于「绝对安全」。 限制更新幅度是为了让旧数据仍然可用,但它约束的是策略变化的程度,并不保证训练过程一定单调改进,也不保证不会出现性能崩溃。约束的强度本身是需要选择的超参数。

多轮次更新有前提。 同一批数据能被重复使用,依赖于新旧策略足够接近。如果更新幅度过大或轮次过多,替代目标的估计会失真,重复利用数据反而可能有害。这是该方法内在的权衡,而非实现缺陷。

它属于在线策略梯度方法。 论文将其定位为在线(on-policy)方法族,采样与优化交替进行。把它当作离线(off-policy)方法使用,超出了论文所描述的范围。

不要把论文的主张读成行业共识。 「PPO 优于其他在线策略梯度方法」「在样本复杂度、简单性和 wall-time 之间取得有利平衡」都是该论文基于其自身实验设置得出的结论。其他方法在不同任务、不同实现和不同调参预算下可能表现不同,论文并未声称结论在所有设定下普遍成立。

关于名称。 论文标题中的「Proximal」对应中文「近端」,缩写 PPO 在文献与工程实践中被广泛使用;本词条所述内容以该论文为准,不涉及后续的各类实现变体。

参考资料