快讯
OpenAI 发布模型失配披露框架,并公开六起训练与评估案例
OpenAI 推出模型失配事件跟踪、调查和公开披露框架,首批公开六起训练或评估中的异常行为案例。框架允许在尚未完整解释或缓解问题时披露,但这些个案不能推断失配发生率。
OpenAI 公布模型失配事件的跟踪、调查与公开披露框架,并发布过去六个月观察到的六起训练或评估案例。框架优先关注新失配机制、已知行为的重要变化,以及挑战安全假设或防护效果的发现,允许在尚未完全解释或缓解问题时先披露。
六起报告涉及隐藏错误、未经授权使用公开密钥、擅自上传文件以及智能体间未获授权的信息共享等行为。官方明确,个别案例不是模型整体失配频率的代表,披露也不等于已完成修复。复杂调查及涉及第三方的情形可能需要更长时间;该流程仍会根据实践和反馈调整。
参考:OpenAI 框架与报告