跳到主内容
快讯直播
AI智模界
AI 词典

合理使用(Fair Use):AI 训练数据能用多少别人的作品

合理使用(Fair Use)是美国版权法下的一项抗辩规则:在满足特定条件时,未经权利人许可使用其受版权保护的作品,不构成侵权。

注意措辞——它是"抗辩"(defense),不是"许可"。你先用了,被起诉了,再拿它来辩护,能不能成立由法院逐案判断。

四个考量因素

美国成文法给出四条,通常放在一起权衡:

1. 使用的目的与性质:是否具有转换性(transformative),是商业还是非营利;

2. 原作的性质;

3. 使用部分的数量与实质性;

4. 对原作潜在市场或价值的影响。

第四条的权重通常最高。打个比方:合理使用像小区门禁给的"临时通行证"。你不是业主,但说明来意(给邻居送东西),保安可能放你进去;进去之后干什么、待多久、有没有动别人的东西,决定这张证算不算数。没有"用满 200 字就安全"这种硬线。

为什么 AI 训练会扯上它

训练大模型需要海量语料,逐一向作者取得授权在成本上几乎不可能,于是合理使用成了主要法律战场。争论集中在三处:训练行为本身是否构成转换性使用;模型输出会不会替代原作市场;模型会不会"记住"并复现训练数据中的片段。

各国路径差别很大:美国靠判例逐步界定,欧盟有文本与数据挖掘(Text and Data Mining, TDM)例外,中国著作权法的合理使用是相对封闭的列举,日本则设有较宽的信息解析例外。具体范围和最新进展请以各国官方立法与法院文书为准,网上流传的"某案已经一锤定音"大多过度简化。

别和这几个概念混

概念要不要事先许可风险特征
合理使用不要,但事后可能被诉逐案判断,结果不确定
授权许可要成本可控、边界清晰
公共领域不要基本无风险,可选作品有限
开放许可(如 CC 协议)按协议条件需遵守署名等条款

对从业者的意义

  • 把数据来源(provenance)记清楚:爬了什么、从哪来、有没有 robots 协议或服务条款限制。
  • 别把合理使用当免责金牌:真被起诉,举证在你,诉讼成本本身就很贵。
  • 输出侧也要管:过滤明显复现的片段,是对"市场影响"这一因素的实际回应。
  • 采购与合规应把"这批数据能不能用于训练"写进合同。

对普通人:你发布的内容可能被用于训练,也可能因此受益于更强的模型。关注平台有没有提供退出机制与来源说明,比争论一句"这算不算合理使用"更实际。

AI 生成本文由 AI 基于公开信息自动生成,仅供参考。