合理使用(Fair Use)是美国版权法下的一项抗辩规则:在满足特定条件时,未经权利人许可使用其受版权保护的作品,不构成侵权。
注意措辞——它是"抗辩"(defense),不是"许可"。你先用了,被起诉了,再拿它来辩护,能不能成立由法院逐案判断。
四个考量因素
美国成文法给出四条,通常放在一起权衡:
1. 使用的目的与性质:是否具有转换性(transformative),是商业还是非营利;
2. 原作的性质;
3. 使用部分的数量与实质性;
4. 对原作潜在市场或价值的影响。
第四条的权重通常最高。打个比方:合理使用像小区门禁给的"临时通行证"。你不是业主,但说明来意(给邻居送东西),保安可能放你进去;进去之后干什么、待多久、有没有动别人的东西,决定这张证算不算数。没有"用满 200 字就安全"这种硬线。
为什么 AI 训练会扯上它
训练大模型需要海量语料,逐一向作者取得授权在成本上几乎不可能,于是合理使用成了主要法律战场。争论集中在三处:训练行为本身是否构成转换性使用;模型输出会不会替代原作市场;模型会不会"记住"并复现训练数据中的片段。
各国路径差别很大:美国靠判例逐步界定,欧盟有文本与数据挖掘(Text and Data Mining, TDM)例外,中国著作权法的合理使用是相对封闭的列举,日本则设有较宽的信息解析例外。具体范围和最新进展请以各国官方立法与法院文书为准,网上流传的"某案已经一锤定音"大多过度简化。
别和这几个概念混
| 概念 | 要不要事先许可 | 风险特征 |
|---|---|---|
| 合理使用 | 不要,但事后可能被诉 | 逐案判断,结果不确定 |
| 授权许可 | 要 | 成本可控、边界清晰 |
| 公共领域 | 不要 | 基本无风险,可选作品有限 |
| 开放许可(如 CC 协议) | 按协议条件 | 需遵守署名等条款 |
对从业者的意义
- 把数据来源(provenance)记清楚:爬了什么、从哪来、有没有 robots 协议或服务条款限制。
- 别把合理使用当免责金牌:真被起诉,举证在你,诉讼成本本身就很贵。
- 输出侧也要管:过滤明显复现的片段,是对"市场影响"这一因素的实际回应。
- 采购与合规应把"这批数据能不能用于训练"写进合同。
对普通人:你发布的内容可能被用于训练,也可能因此受益于更强的模型。关注平台有没有提供退出机制与来源说明,比争论一句"这算不算合理使用"更实际。
