深度学习重塑蛋白质从头设计,打通骨架、序列、构象全流程优化
如何从零创造具备特定催化、靶向结合功能的全新蛋白质,一直是合成生物学与蛋白工程领域的核心难题。传统设计手段依赖分子动力学模拟与片段迭代筛选,不仅算力消耗巨大,还极易出现序列最优却折叠跑偏的致命缺陷。哈佛、斯坦福高校学者联合发布综述,完整梳理基于深度学习的结构导向蛋白设计完整技术链条,对比传统方法的固有短板,拆解骨架生成、逆折叠序列设计、构象预判三大核心模型路线,并指明该领域当下瓶颈与未来突破方向。
一、传统蛋白设计存在固有瓶颈
完整蛋白设计分为骨架生成、序列适配、折叠可行性验证三步。传统手段依靠已知蛋白片段重组、能量函数迭代优化,在骨架构建上只能覆盖有限构象空间,难以生成全新折叠;逆折叠阶段依赖固定侧链旋转异构体库,设计出的氨基酸序列多样性极低,难以捕捉催化三联体这类多残基协同相互作用。同时传统方案仅针对目标构象做能量最小化优化,忽略蛋白整体折叠景观,极易出现序列能量最优但易折叠至非目标构象的情况。大规模全原子分子动力学模拟验证折叠可行性算力消耗巨大,批量设计场景难以落地,而深度学习凭借海量蛋白数据习得的统计规律,能够系统性弥补上述缺陷。
图一:传统与深度学习设计工作流程的比较。(引自参考文献)
二、深度学习实现蛋白骨架从头生成
蛋白骨架可转化为一维二面角序列、二维残基距离矩阵两类标准化特征,适配 Transformer、GAN、VAE 等生成模型。二维距离矩阵类模型借鉴图像修复思路,通过掩膜填充完成蛋白环区设计,也可完整生成全新蛋白主链;Ig-VAE 等专用模型能够直接输出三维原子坐标,内置化学键、二面角约束损失,可在隐空间调控抗体 CDR 区柔性构象,相比片段采样法实现连续构象全覆盖。但单纯生成距离矩阵存在几何退化问题,需配套解码网络还原原子坐标。当前模型普遍依赖 PDB 已知结构训练,全新折叠类型的生成泛化能力仍有待提升。
三、基于固定骨架的深度学习逆折叠方案
给定三维骨架设计氨基酸序列(逆折叠)是蛋白改造核心场景。传统 MCMC 优化仅能产出少量收敛序列,深度学习通过图卷积、自回归网络、约束求解三类思路实现高效多样化序列生成。模型将残基局部化学环境作为输入,学习进化层面氨基酸搭配规律,一次性输出多套兼容序列,还可同步预测侧链构象,直接生成可用于晶体验证的完整三维模型。现有少量体外圆二色谱、晶体实验证实,深度学习设计序列二级结构匹配度更高,能精准捕捉多位点协同作用;但绝大多数模型缺少湿实验验证,跨全新骨架的通用设计稳定性仍不足。
四、构象景观建模,规避错折叠风险
传统设计仅优化目标构象能量,无法预判序列是否会折叠至其他低能构象。深度学习提出两种解决方案:一是隐式学习折叠约束,通过大感受野网络捕捉疏水分布、环区特征等决定折叠的序列规则,引导序列向目标构象收敛;二是反向利用蛋白结构预测模型,实现显式构象景观评估,输入序列可瞬时完成 “虚拟折叠”,自动抑制其他竞争构象,相当于同步完成正向折叠检验,大幅省去海量分子模拟开销。该思路能实现负设计,从根源降低错折叠概率,但仍存在生成 “虚假优化序列” 的对抗性缺陷。
五、领域现存局限与未来发展方向
当前深度学习蛋白设计仍存在核心短板。多数模型仅复刻数据库内已知蛋白特征,难以脱离天然序列分布实现完全全新功能蛋白;现有网络更擅长拟合统计规律,未必真正掌握生物分子物理作用机制,类比迷宫模型可看出,简单同源蛋白任务表现优异,多态、无序蛋白等复杂场景效果下滑。后续研究两大重点方向,一是融合强化学习适配多功能、多状态蛋白设计;二是改进几何深度学习架构,不依赖多序列比对即可完成全新折叠、酶活界面、抗体等定制化设计。长远来看,深度学习将大幅降低蛋白工程门槛,在生物医药、工业酶改造等领域形成规模化应用。
参考文献:
[1] Ovchinnikov, S., & Huang, P. S. (2021). Structure-based protein design with deep learning. Current opinion in chemical biology, 65, 136–144. https://doi.org/10.1016/j.cbpa.2021.08.004
1、凡本网所有原始/编译文章及图片、图表的版权均属微生物安全与健康网所有,未经授权,禁止转载,如需转载,请联系取得授权后转载。
2、凡本网未注明"信息来源:(微生物安全与健康网)"的信息,均来源于网络,转载的目的在于传递更多的信息,仅供网友学习参考使用并不代表本网同意观点和对真实性负责,著作权及版权归原作者所有,转载无意侵犯版权,如有侵权,请速来函告知,我们将尽快处理。
3、转载请注明:文章转载自www.mbiosh.com
联系方式:020-87680942



