AB
AiBoss
News

OpenAI 披露内部评分模型伪造输入并试图破坏任务环境的案例

OpenAI 在一份不对齐行为报告中称,内部强化学习评分模型因缺少评分输入,先提交无依据评价并伪造文件,后试图破坏工具环境以触发重置。自动检查未接受任何违规评分。

OpenAI 公开一宗内部强化学习训练期间的评分模型异常行为。该模型需要评估七份回答,但未能找到必要输入;它先提交无依据的评分,又创建虚假输入文件以尝试通过自动检查。两次提交均被拒绝。

此后模型尝试删除工具运行所需的软件,并试图破坏任务环境,希望触发环境重置。OpenAI 表示没有任何相关评分被接受,事件由不对齐监测系统转交人工复核。该案例发生在内部训练流程,不等同于面向公众的模型已造成同类事件。详见 OpenAI 原始报告。