
开源开发者应对 EU AI Act 合规指南:模型文档、版权退出与透明度义务
开源开发者应对 EU AI Act 合规指南:模型文档、版权退出与透明度义务
面向开源 AI 开发者的 EU AI Act 合规入门:梳理模型与系统的适用范围、风险分级、有限风险系统的透明度义务,以及非系统性风险通用目的 AI 模型需要准备的训练数据摘要、版权退出机制与文档实践,并给出可落地的准备步骤。
EU AI Act(欧盟人工智能法案)是全球第一部针对人工智能的综合性立法,已经正式生效。它的适用范围并不局限于欧盟境内的开发者:只要你的 AI 模型或系统在欧盟境内被提供、投放市场,或者会影响到欧盟境内的人,就可能落入它的管辖范围。对开源开发者来说,这意味着过去「把权重和代码放出去就完事」的做法,可能需要补上一些文档、披露和版权合规动作。
这篇教程面向正在开发或发布开源 AI 模型、以及用这些模型搭建应用的开发者,目标是把法案中和开源社区关系最密切的部分拆开讲清楚:哪些东西被管、风险等级怎么划分、非系统性风险的通用目的 AI 模型具体要做什么、有限风险系统要披露什么,以及可以提前准备哪些材料。需要先说明的是,本文只做信息整理,不构成法律意见;涉及具体项目的合规判断,应当咨询专业法律人士。另外,法案中的价格、配额、时间节点、算力阈值等都可能调整,请以欧盟官方渠道的当前信息为准。
准备工作
在动手准备合规材料之前,先要弄清楚自己在这部法案里扮演什么角色、手上是什么东西。这一步不需要写代码,但决定了后面所有义务的范围。
确认你的角色
法案在 AI 技术栈的不同层级上施加不同义务,角色大致分为几类:
- 提供者(provider):把 AI 系统或模型投放市场、投入服务的人,通常包括开发者本人。
- 部署者(deployer):在自己的专业活动中使用 AI 系统的个人或公司。很多开发者同时也是自己系统的部署者,比如把模型接进一个对外服务的聊天机器人。
- 分销者、进口者等:把 AI 系统带入欧盟市场链条的其他主体。
同一个人可能同时具备多个身份。比如你训练了一个开源大模型(提供者),又用它搭了一个对公众开放的对话应用(部署者),两边的义务都要看。
区分「模型」和「系统」
这是整部法案里最容易混淆的一对概念,务必分清:
- 模型:法案直接监管的只有通用目的 AI(GPAI)模型。GPAI 模型指用大量数据训练、表现出显著通用性、能完成广泛任务、可被集成进各种系统和应用的模型,大语言模型是典型例子。对模型做修改或微调,同样要满足相应义务。
- 系统:能够从输入进行推断的系统。它通常表现为一套传统软件栈,调用一个或多个 AI 模型,把输入映射成某种数字表示。面向终端用户的聊天机器人、托管在平台上的交互式应用,都属于系统。
判断自己面对的是模型义务还是系统义务,是后面选择合规路径的前提。
确认开源是否满足法案定义
法案对「开源」有明确定义:以自由和开源许可证发布、允许公开共享、用户可以自由访问、使用、修改并再分发(包括修改后的版本)的软件和数据,其中包含模型。也就是说,仅仅公开权重并不自动等于法案意义上的开源,许可证条款必须满足这一定义。
准备阶段要做的一件事,就是检查你当前使用的许可证是否落在法案的开源定义之内。如果许可证带有使用领域限制、用户数量限制或其他不符合自由再分发条件的条款,那么你的发布方式可能不被视为开源,随之而来的义务会更重。许可证清单和文本会更新,具体条款请以官方发布渠道的当前版本为准。
准备文档与元数据基础设施
合规动作的很大一部分落在「把信息写清楚并公开」上。提前准备好以下载体,后面会省很多力气:
- 模型卡:记录模型用途、训练数据概况、评估结果、限制与已知风险。
- 数据集卡:记录数据来源、采集方式、许可与使用限制。
- 许可证文件:明确授权范围与再分发条件。
- 可机读的合成内容标识能力:用于在生成内容中嵌入标识信息。
- 版权退出(opt-out)处理流程:用于接收并执行权利人的退出请求。
这些实践在开源社区里本来就很常见,如果你已经在认真写模型卡和数据卡,那么合规的起点并不低。
操作步骤
第一步:判断风险等级
法案的规则随风险等级递增。先把自己的模型或系统归入下面某一档:
| 风险等级 | 典型情形 | 后果 |
|---|---|---|
| 不可接受 | 侵犯人权的系统,例如从互联网或监控录像中抓取人脸图像 | 被禁止,不得投放市场 |
| 高风险 | 可能影响人身安全或基本权利的系统,例如关键基础设施、基本服务、执法领域 | 投放市场前须完成完整的合规步骤 |
| 有限风险 | 直接与人交互、可能带来冒充、操纵或欺骗风险的系统 | 须满足透明度要求 |
| 最小风险 | 不具备上述风险的绝大多数系统 | 只需遵守既有法律法规,法案不额外增加义务 |
对 GPAI 模型,还有一档单独的风险类别叫系统性风险:使用大规模算力训练的模型,目前的界定标准是训练算力超过 10^25 FLOPs,或者具备高影响能力。这个阈值属于易变信息,请以官方当前口径为准。
作为模型开发者,如果你的模型已经满足相应要求、文档齐全,它被集成进各类 AI 系统的难度会更低、可能性会更高——这本身就是一种竞争力。
第二步:有限风险系统的透明度义务
有限风险系统直接与终端用户交互,可能带来冒充、操纵或欺骗风险,例如生成文本的聊天机器人、文生图工具。这类工具也可能被用来制造虚假信息或深度伪造内容。法案的应对思路是让普通用户明白自己正在和 AI 系统打交道。
这类义务不区分是否开源,只要属于有限风险系统就要履行。开发者需要做到:
- 向用户披露其正在与 AI 系统交互,除非这一点已经显而易见。注意终端用户未必具备和专家相同的技术理解能力,披露要用清晰、完整的方式表达,不能靠术语堆砌。
- 标记合成内容:AI 生成的音频、图像、视频、文本必须以机器可读的格式清楚标注为人工生成或被操纵。一些交互框架自带的水印功能可以用于满足这一要求。
如果你同时是部署者,还要额外承担:
- 对于情绪识别和生物特征识别系统,部署者必须告知相关个人这些系统正在被使用,并依照相关法规处理个人数据。
- 对于深度伪造和 AI 生成内容,部署者必须进行披露。当生成内容属于艺术创作的一部分时,披露方式应当做到不破坏观赏体验,同时让人知道其中存在生成或操纵的内容。
上述信息要用清晰的语言提供,时间点最晚不迟于用户首次与 AI 系统交互或被其影响之时。
负责实施法案的 AI Office 会牵头制定行为准则,为检测和标注人工生成内容提供指引。这些准则正在由产业界和公民社会参与撰写,预计在 2025 年 5 月前后发布,相关义务预计从 2026 年 8 月起开始执行。时间节点可能变动,请以官方当前公告为准。
第三步:非系统性风险开源 GPAI 模型的义务
如果你开发的是不构成系统性风险的开源 GPAI 模型(例如常见的大语言模型),需要履行以下义务。
1. 训练内容摘要
按照 AI Office 提供的模板,起草并公开一份足够详细的训练内容摘要,说明用于训练该 GPAI 模型的内容。摘要的详细程度目前仍在讨论中,但总体方向是相对全面。这份摘要应当随模型一起发布,而不是藏在内部文档里。
2. 版权合规政策
需要建立一套遵守欧盟版权及相关权利法律的政策,其中最关键的是尊重权利人的退出(opt-out)声明。开发者必须确保自己有权使用受版权保护的材料,这种授权可以来自权利人许可,也可以来自版权例外与限制的适用。
文本与数据挖掘(TDM)例外是这一场景中被广泛使用的机制,用于检索和分析内容。但 TDM 例外通常不适用于权利人明确保留其作品用于此类目的之权利的情形——这就是所谓的 opt-out。在制定符合欧盟版权指令的政策时,应当尊重这些退出声明,限制或禁止使用相关受保护材料。
换句话说,用受版权保护的材料训练模型本身并不违法,前提是你尊重作者退出 AI 训练的决定。目前 opt-out 在技术上应如何表达(尤其是机器可读格式)仍有开放问题,但尊重网站 robots.txt 中表达的信息、以及接入专门的退出声明 API,是一个合理的起点。
法案与既有的版权法规和个人数据保护法规是相互衔接的。可以关注支持退出机制和个人数据脱敏的工具,并留意欧洲及各国数据保护机构发布的建议。
社区中已经出现了一些理解和执行训练数据退出的实践,例如让创作者查询自己的代码是否出现在训练集中并申请移除的应用,以及为带图像 URL 的数据集集成退出声明组件。借助这类工具,创作者可以简单地声明不允许其受版权保护的材料被用于 AI 训练。随着退出流程逐步成熟,这些工具在落实权利人决定方面相当有效。
开发者可以依据行为准则来证明自己履行了上述义务,这些准则正在制定中,预计 2025 年 5 月前后出台。
3. 注意非开源发布方式的额外义务
如果你的发布方式不满足法案对开源的定义,还会有其他义务适用。此外,如果某个 GPAI 模型满足构成系统性风险的条件,其开发者必须通知欧盟委员会。在通知过程中,开发者可以主张自己的模型因特定特征而不构成系统性风险。委员会会逐案审查这些主张,结合模型的具体特征和能力,判断论证是否足够充分,并决定接受或驳回。如果主张被驳回,该模型将被认定为构成系统性风险,需要履行更多义务,例如提供涵盖训练与测试过程、评估结果的技术文档。
GPAI 模型的相关义务预计从 2025 年 8 月起开始执行。同样,请以官方当前信息为准。
一个完整示例
下面用一个假想的开源项目走一遍流程,说明各步骤如何衔接。假设你训练并发布了一个中等规模的开源大语言模型,同时用它搭了一个对公众开放的对话应用。
项目情况
- 模型:一个通用目的语言模型,训练算力远低于 10^25 FLOPs 量级,不构成系统性风险。
- 发布方式:以符合法案开源定义的许可证公开权重和代码。
- 应用:一个面向终端用户的对话界面,用户可以直接输入问题并获得回答。
第一步:归类
模型侧:属于非系统性风险的开源 GPAI 模型,适用第三步中的三项义务。系统侧:对话应用直接与人交互,可能被用于生成误导性内容,归入有限风险系统,适用第二步中的透明度义务。由于你同时运营这个应用,你也是部署者。
第二步:准备模型侧材料
为模型仓库补齐以下文件:
- 模型卡:写明模型用途、训练数据概况、评估结果、已知限制与风险。
- 训练内容摘要:按 AI Office 模板的结构组织,说明训练内容的来源与范围。
- 许可证文件:确认许可证条款满足法案的开源定义,允许自由访问、使用、修改和再分发。
- 版权政策说明:在仓库中明确说明如何处理权利人的退出声明,包括接收渠道与执行方式。
第三步:接入退出声明处理
在数据准备流程中加入退出声明的检查环节:
- 对来自网站的抓取数据,检查并遵守 robots.txt 中表达的意愿。
- 对通过退出声明 API 提交的请求,建立记录并定期同步到数据过滤流程。
- 对带图像 URL 的数据集,接入相应的退出声明组件,让创作者可以自助声明。
这些动作的目的是确保训练数据的来源可追溯、权利人的退出决定可执行。
第四步:准备系统侧披露
在对话应用中:
- 在用户首次进入对话时,用清晰的语言说明他们正在与 AI 系统交互,而不是与真人交流。
- 对生成的内容启用机器可读的标识,例如使用交互框架自带的水印能力。
- 如果应用涉及情绪识别或生物特征识别,在相应环节告知用户,并按个人数据保护要求处理数据。
- 如果生成内容可能构成深度伪造,按部署者义务进行披露;若属于艺术创作,采用不破坏体验的方式提示。
第五步:持续跟踪
把以下事项列入例行检查:行为准则的发布进展、义务执行时间节点的变化、许可证清单的更新、以及算力阈值等界定标准的调整。这些信息都可能随时间变化,以官方当前发布为准。
注意事项
- 适用范围不限于欧盟境内:只要 AI 系统或模型在欧盟被提供,或会影响到欧盟境内的人,就可能被纳入管辖。身在欧盟之外并不自动豁免。
- 开源不等于零义务:有限风险系统的透明度义务不区分是否开源;非系统性风险的开源 GPAI 模型也有训练内容摘要和版权政策等义务。只有发布方式不满足法案开源定义时,义务还会更多。
- 微调同样受约束:对模型做修改或微调,也要满足相应义务,不能因为「只是微调」就跳过。
- 系统性风险需要主动通知:一旦模型满足构成系统性风险的条件,开发者必须通知欧盟委员会。开发者可以提出反驳论证,但最终由委员会结合模型特征和能力判断是否成立;论证被驳回后,模型将被认定构成系统性风险,需要提供训练与测试过程、评估结果等技术文档。
- 退出声明必须被尊重:TDM 例外通常不适用于权利人明确保留权利的情形。用受版权保护的材料训练并不当然违法,但必须尊重 opt-out。robots.txt 和专门的退出声明 API 是目前可用的起点。
- 时间节点会变:行为准则预计 2025 年 5 月前后发布,GPAI 模型义务预计 2025 年 8 月起执行,有限风险系统的相关义务预计 2026 年 8 月起执行。这些日期和算力阈值都属于易变信息,请以官方当前信息为准。
- 本文不构成法律意见:合规判断涉及具体事实和最新法规文本,必要时应咨询专业法律人士。