AB
AiBoss
News

微软称其聊天机器人极少逐字复述新闻文章内容

微软在针对《纽约时报》等出版商的版权诉讼中提交新法律文件,称其 Copilot 聊天机器人在超过 820 万份聊天记录中,仅有不到 1% 复述了至少 16 个与新闻内容相同的词。

核心事实

微软在应对《纽约时报》及图书作者版权诉讼的新法律文件中表示,其 Copilot 聊天机器人极少逐字复述新闻文章或书籍内容。作为诉讼证据开示的一部分,微软向新闻出版商聘请的专家提供了 820 万份 Copilot 聊天记录。微软称,这些记录是特意挑选的,因为它们涉及使用新闻网站的关键词,是最可能包含原告作品的内容。分析显示,其中 59,545 份包含至少 16 个与用于训练 AI 模型的新闻内容相同的词。

背景与影响

微软指出,调查报道中心(CIR)的专家在该数据集中发现了 51 处与 CIR 作品的“实质性重叠”,而作者诉讼中的专家发现,820 万次对话中仅有 24 条回复包含至少 30 个匹配词,212 本被评估的书籍中只有 10 本出现任何匹配。微软认为这些数据支持其立场,即使用受版权保护的内容训练 AI 应被视为合理使用,并称系统偶尔复现文本片段“很难削弱 LLM 训练的变革性目的”。《纽约时报》首席律师伊恩·克罗斯比则发表声明反驳,称证据表明微软和 OpenAI“窃取”了该报内容以制造替代其新闻业的商业产品。相关诉讼已合并至一名法官审理,微软于上周五提交文件,请求法官作出即决判决以尽早结束案件。

限制与来源

上述数据和分析均来自微软在诉讼中的单方面陈述,尚未经法院最终认定,CIR 和作者协会未立即回应置评请求。案件后续进展及最终裁决结果尚不确定。信息来源:The Verge(www.theverge.com),标题“Microsoft says virtually nobody was grabbing NYT articles through its chatbot”。