AB
AiBoss
ニュース

研究:有AI可问时,人们几乎不再愿意说“我不知道”

一项涵盖五项实验、3132名参与者的研究发现,仅仅让AI建议可供查询,就几乎消除了参与者说“我不知道”的意愿:无AI时36%至44%的题目被放弃作答,有AI时降至3%至6%,但正确率同时大幅下滑。

核心事实

据科技媒体 the-decoder.com 报道,一项尚未获官方确认的研究通过五项实验、共 3132 名参与者,测试了“能否使用语言模型”是否会改变人们面对不确定性的处理方式。结果显示,仅仅让AI建议处于可获取状态,就几乎抹平了参与者说“我不知道”的意愿。

研究选用的题目是该模型几乎总是答错的细粒度视觉细节题(例如某部电影中球队队服的颜色)。据作者说法,这类细节很少出现在网络文本中,因此容易诱发幻觉。由于AI建议大多是错的,这一效应无法用“合理地把任务委托给可靠工具”来解释。

背景与影响

在前两项研究(1a、1b)中,参与者可自行决定是否向AI求助。无AI的对照组分别有 36% 和 44% 的题目选择不作判断;有AI时这两个数字降至 6% 和 3%。研究2还测量了信心:无经济激励时,有AI可用的信心为 75.9 分(满分100),无AI为 29.6 分,约为前者的两倍半;同期正确率却从 27.6% 降至 10.0%。

研究2至4加入了经济激励(答对得10美分、答错扣10美分、“我不知道”不得分)。研究者预注册的假设是激励会提高弃答意愿、而AI可用性会削弱该效果,但三项研究均未发现统计上显著的交互作用。研究4中AI答案被自动展示、无需主动询问,效应几乎没有变化。研究者将结果置于“Epistemia”语境下,即人们因为AI答案听起来有说服力而接受它,而非真正核查。

限制与来源

研究者指出,参与者确实存在向AI答案让渡判断的倾向,但这一结论是否同样适用于电影冷知识之外的场景,仍是未解问题;激励措施虽有效果,但幅度有限,更大额度或基于声誉的激励能否进一步缩小差距尚不清楚。本文内容整理自 the-decoder.com 的报道,相关数据与结论以原研究及后续官方信息为准。