一句话定义:蛋白质语言模型(Protein Language Model, PLM)是一类把蛋白质的氨基酸序列当作"自然语言句子"来训练的模型,靠海量序列自学规律,从而在没做实验结构解析的情况下推断功能。
它是怎么工作的
蛋白质是一条由 20 种氨基酸首尾相连组成的长链,就像一句话由字母串成。ESM(Evolutionary Scale Modeling)是这类模型的代表,训练方式和 BERT 的AI 词典:掩码语言建模">掩码语言建模(Masked Language Modeling)几乎一样:随机遮住序列里的某些氨基酸,让模型根据上下文把它们猜回来。
打个比方:一个人读了一万本侦探小说后,即使某页被撕掉一角,也能猜出缺的是什么字。模型在反复"填空"的过程中,被迫学会了一件更重要的事——哪些位置的氨基酸是配套变化的。
这就是关键。在自然界中,如果位置 A 突变了,位置 B 往往也跟着变,说明两者在三维空间里可能挨着,或在功能上互相牵制。这种共变(co-evolution)模式被模型隐式地学进了参数里。
为什么不做结构预测也能推功能
结构预测(如 AlphaFold 这类方法)回答的是"这个蛋白质长什么样",输出原子坐标;蛋白质语言模型回答的是"这条序列读起来像不像一个合理的蛋白质",输出向量或概率分数。
前者依赖物理和几何约束,后者依赖进化统计。因为进化压力本身就是由结构约束和功能约束共同塑造的,所以序列里已经藏着结构的影子。模型不需要显式输出 3D 坐标,也能给出有功能含义的判断。
| 对比对象 | 关注点 | 典型输出 | 需要人工标注吗 |
|---|---|---|---|
| 结构预测模型 | 原子空间位置 | 三维结构 | 否 |
| 蛋白质语言模型 | 序列概率与表示 | 向量 / 分数 | 否 |
| 传统同源比对(如 BLAST) | 序列相似度 | 相似序列列表 | 否 |
实际怎么用
- 变体效应预测:给一个突变,算它在模型下的概率。概率明显偏低,说明这个位置"读起来别扭",可能损害功能,值得优先做实验验证。
- 蛋白质设计:反过来让模型采样新序列,生成可能折叠稳定的候选。
- 当特征提取器:把序列压成向量,喂给下游的小分类器,往往只需少量标注数据就能微调(fine-tuning)出不错的效果。
对从业者和普通人的意义
对算法从业者,它相当于蛋白质领域的"预训练骨干网",地位类似 NLP 里的 BERT——先在大规模无标注数据上预训练,再按任务微调。对非技术岗位,它的价值在于先把候选范围收窄:药物研发、酶工程、育种里,用它筛掉大部分明显不靠谱的候选,把有限的湿实验预算花在最有希望的少数上。
需要提醒的是,模型给出的是概率性建议,不是实验结论;具体模型的能力边界和可获取方式,以官方页面为准。
