MIT 团队开发 PottsMPNN 框架,将物理原理引入蛋白序列设计,减少对天然序列的依赖,提升突变预测能力。
蛋白质的功能取决于它的三维结构,而结构又由氨基酸序列决定。设计新蛋白时,常用流程分两步:先确定目标结构,再让机器学习模型生成一批可能折叠成这个结构的序列。难点在于,自然界中许多不同的序列都能折叠成同一种结构,同一条序列又可能因蛋白质的柔韧性或功能触发而呈现不同结构。研究人员需要引导 AI 理解:正确答案是一整片可能序列的空间。
麻省理工学院(MIT)生物系在《美国国家科学院院刊》(PNAS)发表研究,指出这个领域长期用错了成功标准:衡量模型好坏,通常看它能否复现进化恰好选出的那条天然序列。资深作者、生物系系主任 Amy E. Keating 认为,这并不是衡量蛋白质设计的最佳指标。
该团队提出的新框架叫 PottsMPNN。它把支配蛋白质结构与稳定性的物理原理纳入模型,让模型更好地理解"序列—能量景观",也就是每个位置的氨基酸选择与蛋白质整体稳定性之间的关系。这带来两项改进:生成序列的能力更强,预测突变如何影响稳定性的能力也更强。论文第一作者、研究生 Foster Birnbaum 解释,对一个全新的设计结构来说,世界上不存在可参照的天然序列;真正要紧的是生成的序列有多大可能折叠成目标结构,以及模型能否预测突变对稳定性的影响。
PottsMPNN 有三个关键设计。第一,训练时向蛋白质结构引入"噪声",也就是添加变化,这也是 Birnbaum 最初感兴趣的问题。噪声能降低模型过度模仿天然序列的倾向,扩大它能应对的结构多样性。第二,用成对分布捕捉氨基酸之间的相互作用,在一个位置对上同时考虑全部 20 种氨基酸选项的物理相互作用,这是它比其他方法更准确建模序列—能量景观的关键。第三,训练中引入进化上相关联的序列集合,教模型理解不同序列如何折叠成同一结构。
引入进化信息,某种意义上仍是对天然序列的依赖,Birnbaum 并不讳言这一点。但实验结果显示:模型对天然序列的依赖越少,结构相容性与能量预测反而越好,对全新蛋白质也是如此。
这个方向之所以重要,还因为一个背景,机器学习近年显著改变了基础生物学研究的速度和广度,用计算模型可靠生成蛋白质结构或序列只是最近才实现;而目前应用最广的蛋白生成模型发布于 2022 年,在一个推进极快的领域里始终没有被超越。理解它为什么好用,正是 Birnbaum 团队改进模型的出发点。
把 PottsMPNN 加入设计流程后,研究人员有望设计出结构可行、序列却与任何天然蛋白都不同的新蛋白质,用于结合致病分子等场景。Birnbaum 说,一旦能设计任何想要的蛋白质,就可能开展规模可观的生物工程;他也希望模型能针对具体任务微调,以更准确地预测某个突变的后果。Keating 总结,这些方法推动领域朝着设计自然界中不存在的有用蛋白质前进,同时为后续进展打下基础。
原文:https://phys.org/news/2026-08-ai-potentially-stable-protein-sequences.html