Anthropic 研究员警告 AI 或致人类灭绝,离职员工指责公司冒险竞赛
一名 Anthropic 高级安全研究员称,AI 在十年内“杀死所有人类”的概率超过 10%;此前一名同事因担忧公司安全措施不足而辞职,指责 OpenAI 与 Anthropic 正“拿生命赌博”竞速开发自我改进的超级智能。
核心事实
据 The Verge 报道,Anthropic 一名高级安全研究员 Evan Hubinger 表示,他个人估计人工智能在“未来十年内”杀死所有人类的概率超过 10%。这一表态发生在同事 Jacob Coxon 宣布辞职数小时后。Coxon 曾在 Anthropic 和 OpenAI 训练 AI 系统,他在 X 上发文称,两家公司正“直接冲向自我改进的超级智能,拿我们的生命赌博”,尽管“开发 AI 的人真诚地相信它可能在十年内杀死我们所有人”。
背景与影响
Hubinger 承认,Anthropic“尚未制定”确保先进 AI 安全并与人类价值观对齐的计划,且“也没有明确在朝这个方向推进”。他同意 Coxon 的描述,称“我们确实真诚地相信 AI 可能杀死所有人类”,并指出自我改进 AI 的发展“比我们想象的要快”。Coxon 认为,公司因“陷入竞赛”而争先开发先进系统,尽管存在风险。报道称,这一事件是 Anthropic 员工因安全担忧离职的最引人注目案例之一,也凸显了业内对日益复杂的 AI 模型及开发速度的担忧,尤其是在多家公司筹备 IPO 之际。
限制与来源
上述概率估计为 Hubinger 个人观点,并非官方风险评估。Coxon 的指控及 Hubinger 的回应均来自社交媒体公开表态,尚未获 Anthropic 或 OpenAI 官方正式确认。相关公司未就此事发布正式声明。本文信息综合自 The Verge 报道,原始链接:https://www.theverge.com/ai-artificial-intelligence/991927/anthropic-ai-kill-all-humans。更多详情请以官网及后续官方信息为准。