一句话定义:AI 蛋白质水印(AI-designed Proteins Watermark)是指在蛋白质生成模型输出氨基酸序列时,暗中嵌入一种统计性"暗记",只有掌握密钥的一方才能通过统计检验判断这段序列是否出自该模型。Google 的研究团队提出的这类方案,目标就是让 AI 设计的蛋白质可溯源、可问责。
它怎么工作
蛋白质序列说穿了就是一串字母——20 种氨基酸对应 20 个字符。生成模型(比如常见的反向折叠模型,给它一个骨架结构,让它反推可能的序列)在每一个位置上挑一个氨基酸。加水印的做法是:用一个只有发布方持有的密钥,对每个位置做伪随机划分,把 20 种氨基酸分成"绿名单"和"其他",然后轻微提高绿名单被选中的概率。
单看一条序列,你完全看不出异样,它照样能折叠、照样有功能。但检测者拿到密钥后重新算一遍绿名单的命中率:如果只是随机选,长期期望大约是一半;如果命中率显著偏高,就可以用统计显著性判断"这条序列来自那个模型"。打个比方,这像是给每位员工发一副只有内部人看得出颜色的墨镜——外人看不出谁戴了,内部人一眼就能数出来。
难点在于约束比文本严得多。文本水印改个词最多影响文风,蛋白质里换一个氨基酸,可能整个蛋白就折叠错、失去功能。所以水印方案通常还要用结构预测和打分校验:加了水的序列,依然要能折成目标结构。
和相邻概念的区别
| 维度 | LLM 文本水印 | AI 蛋白质水印 |
|---|---|---|
| 载体 | 大词表(数万 token) | 20 种氨基酸 |
| 硬约束 | 通顺、大致正确 | 必须能折叠、保留功能 |
| 验证方式 | 统计检验 | 统计检验 + 结构/功能校验 |
| 检测门槛 | 持密钥方 | 持密钥方 |
还要和另外两个概念分开:DNA 合成筛查(synthesis screening)查的是"这段序列是不是已知的危险物",回答安全与否;水印回答的是"是不是某模型生成的",回答归属问题。图像数字水印改的是像素值,这里改的是离散序列,而且不能牺牲功能。
对从业者意味着什么
对做蛋白设计、云实验室、DNA 合成和生物安全的人来说,这提供了模型输出的溯源机制:在授权前提下抽查一段序列是否来自某个模型,进而把责任链补上。对普通职场人,它就是"AI 生成内容可溯源"这套思路在生物领域的翻版,也提醒一件事:水印保护的是归属与问责,不是绝对防伪。知道方法的攻击者可以换一个模型重新设计来洗掉信号,天然序列也可能偶然触发假阳性,所以阈值要卡得很严。具体方案细节与判定标准,以官方论文和页面为准。
