AB
AiBoss站
快讯

OpenAI GPT-6 Astra 幻觉减少,但仍易受隐藏提示注入攻击

OpenAI 新模型 GPT-6 Astra 在减少幻觉和抵御直接提示注入方面表现优于前代,但在间接提示注入测试中仍有 8.5% 的失败率,安全团队需警惕。

核心事实

据 OpenAI 发布的系统卡,其新模型 GPT-6 Astra 在减少幻觉方面较前代 GPT-5.6 Sol 有显著进步。在用户标记为错误回答的 ChatGPT 对话测试中,Astra 复现这些错误的频率大幅降低,尤其在低延迟和低推理设置下提升最为明显。针对直接提示注入攻击,Astra 的防御成功率高达 99.99%,OpenAI 将此归功于其 GPT-Red 训练方法,该方法利用自动化攻击者强化模型。

背景与影响

在对抗已知越狱攻击的固定数据集测试中,Astra 在生物、暴力、网络安全等敏感话题上拒绝协助的比例为 91.5% 至 98.3%。然而,当攻击者在多轮对话中调整策略时,Astra 的防御率降至约 67%,意味着持续攻击者约有三分之一的概率能诱出至少一条问题回复,前代模型在同一测试中得分低于 50%。OpenAI 指出,这些测试在裸模型上进行,未包含实际产品中的分类器等生产安全层。

在间接提示注入方面,安全公司 Gray Swan 使用其 IPI Arena 中的 1,810 个精选攻击进行外部测试,每个场景尝试 15 次,Astra 至少被攻破一次的比例为 8.5%,而 GPT-5.6 Sol 为 27%,Claude Opus 5 为 4.8%。尽管 Astra 较前代有大幅改进,但该失败率仍意味着企业安全团队需警惕:在约每十二个场景中,Astra 可能被文档中隐藏的指令欺骗。随着 AI 代理越来越多地自主编写代码、操作工具和控制计算机,此类风险正在上升。

限制与来源

上述测试数据均来自 OpenAI 系统卡及 Gray Swan 的外部评估,属于精选攻击场景,不代表日常使用中的典型失败率。Gray Swan 的 Q1 和 Q2 合并测试结果高于此前仅基于 Q1 的测试,Anthropic 曾报告 Claude Opus 5 仅 2% 的攻击成功率,且其测试开启了扩展推理,测试范围差异可能解释数据差距。所有性能数据均以官方发布为准,更多细节请参阅 OpenAI 官方系统卡及 Gray Swan 报告。本文信息来源于 the-decoder.com 的报道。