AB
AiBoss站
百科

什么是宪法式 AI(Constitutional AI)?

宪法式 AI(Constitutional AI,CAI)是 arXiv 论文《Constitutional AI: Harmlessness from AI Feedback》提出的一种训练无害 AI 助手的方法。它用一份规则或原则清单代替人工标注有害输出,通过监督学习与强化学习两个阶段让模型自我批评、自我修订,并用「AI 反馈强化学习」(RLAIF)训练偏好模型作为奖励信号。

宪法式 AI(Constitutional AI,CAI)是一种训练无害 AI 助手的方法:它不依赖人工标注哪些输出有害,而是给模型一份由规则或原则组成的清单(论文中称为「宪法」),让模型依据这份清单对自己的回答进行自我批评与修订,并在此基础上完成训练。该论文把这份人类监督所依托的规则清单称为「宪法」,方法因此得名。它要解决的问题是:在模型能力不断增强的背景下,如何用远少于人工标注的监督信号,更精确地控制 AI 的行为,并训练出一个无害但不回避问题的助手。

为什么重要

在宪法式 AI 出现之前,让模型变得「无害」的主流做法高度依赖人工:由人类标注者阅读模型输出,判断哪些内容有害,再据此调整模型。论文的出发点正是这种依赖的代价——它希望「招募 AI 来监督其他 AI」,从而减少对人类标签的需求。

论文描述的目标不止于「无害」。它指出,用这种方法可以训练出一个无害但不回避(non-evasive)的 AI 助手:面对有害提问时,它不是简单地拒答或绕开,而是与提问互动,解释自己为何反对。这一点构成了该方法与单纯「拒答式」安全训练的重要区别。论文还称,监督学习与强化学习两种方法都可以利用思维链(chain-of-thought)式的推理,以提升人类评判下的表现以及 AI 决策的透明度。论文的结论是,这些方法使更精确地控制 AI 行为、并大幅减少人类标签成为可能。

工作机制

论文把整个过程分为两个阶段:一个监督学习阶段,一个强化学习阶段。

监督学习阶段

论文对该阶段的描述是:先从初始模型采样,然后生成自我批评(self-critiques)与修订(revisions),再用修订后的回答对原始模型做微调(finetune)。也就是说,模型先给出一个回答,再依据宪法中的原则指出这个回答的问题,并改写它;改写后的版本成为训练目标。这一阶段不需要人类逐条标注哪些输出有害,人类监督只体现在那份规则清单上。

强化学习阶段

论文对该阶段的描述是:从已经微调过的模型采样,用一个模型去评估两个样本中哪一个更好,再根据这份「AI 偏好」数据集训练一个偏好模型(preference model)。随后用这个偏好模型作为奖励信号进行强化学习,论文把这一做法称为「AI 反馈强化学习」(RL from AI Feedback,RLAIF)。

把两个阶段合起来看,宪法式 AI 的核心做法可以概括为几点:

  • 监督来自原则而非标签。人类提供的是一份规则或原则清单,而不是对有害输出的逐条标注。
  • 自我批评与自我修订。模型先对自己的输出提出批评,再据此改写,修订结果用于微调。
  • AI 偏好代替人类偏好。在强化学习阶段,由模型来判断两个样本哪个更好,形成偏好数据集。
  • 以偏好模型为奖励。用 AI 偏好训练出的偏好模型充当强化学习的奖励信号,即 RLAIF。
  • 可结合思维链推理。论文称两个阶段都能利用思维链式推理,以改善人类评判下的表现与决策透明度。

论文强调,整个过程的目标是「自我改进」(self-improvement),且不使用任何标识有害输出的人类标签。

典型例子

论文给出的最直接例子就是它自身所描述的训练流程:从一个初始模型采样,生成自我批评与修订,用修订后的回答微调原模型;随后从微调后的模型采样,由模型评估两个样本的优劣,据此训练偏好模型,再以该偏好模型为奖励做强化学习。论文把这一整套流程称为宪法式 AI,并把其中的强化学习部分称为 RLAIF。

论文给出的另一个具体结果是:用这种方式可以训练出一个无害但不回避的 AI 助手,它在面对有害提问时会与提问互动,并解释自己的反对理由。论文还提到,监督学习与强化学习两种方法都可以借助思维链式推理,来提升人类评判下的表现与 AI 决策的透明度。

该论文由 Yuntao Bai 等 51 位作者署名,于 2022 年 12 月 15 日提交至 arXiv,编号 arXiv:2212.08073,主题分类为计算与语言(cs.CL)与人工智能(cs.AI)。

边界与常见误解

首先需要明确归属:以上机制与效果均出自这篇论文的表述,是该论文提出并报告的方法与结论,不应被当作整个行业已经验证的共识。论文描述的是其自身实验中的做法与观察,其他系统是否采用、采用后效果如何,需要看各自的文档与报告。

常见的误解之一,是把宪法式 AI 等同于「让 AI 自己定规则」。论文的表述恰恰相反:人类监督是通过一份规则或原则清单提供的,宪法本身来自人类,被交给 AI 的是依据这份清单进行批评、修订与评判的能力。减少的是逐条标注有害输出的人力,而不是人类对规则的设定。

误解之二,是把它等同于「拒答」。论文明确把目标描述为训练一个无害但不回避的助手,它会就有害提问展开互动并说明反对理由,这与简单拒答是两种不同的行为取向。

误解之三,是把它与「AI 反馈强化学习」(RLAIF)混为一谈。按论文的划分,RLAIF 是宪法式 AI 强化学习阶段所使用的具体手段——用 AI 偏好训练偏好模型并以其为奖励信号;而宪法式 AI 是包含监督学习阶段与强化学习阶段的完整方法。

关于代价与限制,论文本身给出的定位是:这些方法使更精确地控制 AI 行为、并大幅减少人类标签成为可能。论文并未在摘要中给出该方法在所有场景下普遍适用的结论,其效果描述均限于论文所报告的训练设置与人类评判结果。此外,论文提到思维链式推理可以提升人类评判下的表现与透明度,这属于论文的观察,而非对任意模型的普适保证。

参考资料