文章导读
宏基因组测序不断发现大量缺少功能注释的蛋白质,传统依赖序列相似性的方法面对进化距离较远的酶序列时为何失灵?清华大学梁冠翔课题组开发的FEDKEA,以蛋白质大语言模型ESM-2结合分层预测与K近邻算法,提升未知酶功能解析能力,并配套MEnzMap绘制微生物“酶图谱”。它在低相似度蛋白上表现突出,还揭示IBD患者部分抗氧化酶减少,为疾病机制研究带来什么新路径?
— 内容由好学术AI分析文章内容生成,仅供参考。
酶是微生物执行生命活动的重要分子,广泛参与营养代谢、物质合成以及宿主互作等关键生物学过程。准确解析宏基因组中酶的功能,对于理解微生物如何影响人体健康具有重要意义。然而,高通量测序技术产生了海量的微生物基因序列,大量蛋白质仍缺少明确的功能注释,这些被称为微生物功能“暗物质”的未知蛋白,使得传统基于序列相似性的注释方法难以有效识别进化距离较远的酶序列。
8月19日,清华大学基础医学院副教授梁冠翔课题组在《科学·进展》(Science Advances)上发表了一项题为“大语言模型提升宏基因组中酶的注释效果”(Large language models enhance annotation of enzymes in metagenomes)的研究,该研究开发了一款名为FEDKEA(Fine-tuned ESM-2 and Distance-based KNN for Enzyme Annotation)的智能酶注释工具,并设计了基于FEDKEA的宏基因组分析流程MEnzMap。该工具基于蛋白质大语言模型ESM-2,通过微调模型学习蛋白质序列中的复杂规律,结合酶委员会(EC)分类体系的层级结构,采用分层预测策略——首先判断蛋白质是否属于酶,进而预测其对应的EC功能编号;对于样本较少的酶类别,利用K近邻算法辅助识别,从而显著提升了对未知蛋白功能的预测能力。

FEDKEA模型构建流程
在与CLEAN、GraphEC、ECRECer、DeepEC等现有方法的基准测试中,FEDKEA在酶识别任务中准确率(0.9486)、精确率(0.9585)、召回率(0.9387)和F1分数(0.9485)均达到最高水平,在低序列相似度蛋白上的泛化能力尤为突出,这意味着即使面对进化距离较远、传统方法难以识别的蛋白序列,AI模型仍能有效挖掘其中隐藏的功能信息。
此外,研究团队开发的MEnzMap流程能够从宏基因组测序数据出发,经过质量控制、基因组组装、基因预测,再利用FEDKEA完成酶功能分析,从而绘制微生物群落中的“酶图谱”。将该流程应用于iHMP2项目的人体肠道宏基因组数据,研究揭示了健康人与炎症性肠病(IBD)患者之间仍共享大量核心功能酶,主要参与核酸代谢、蛋白质修饰、细胞壁相关活动、能量代谢及信号转导等过程;同时IBD患者表现出明显的酶功能变化,特别是在氧化应激相关功能方面,部分抗氧化酶(如某些来源于常见肠道菌的过氧化氢酶)出现明显减少,提示疾病状态下微生物维持氧化平衡的能力可能受到了影响。
FEDKEA不仅提高了蛋白质功能预测的准确性,也为宏基因组研究中微生物功能生态的解析提供了有力工具,有望推动未知蛋白发现、疾病机制解析以及新型生物技术开发,助力从“看见基因”迈向“理解功能”,逐渐揭开微生物世界的神秘面纱。
清华大学基础医学院梁冠翔副教授为本文通讯作者,清华大学基础医学院2026届博士毕业生郑磊、2022级博士生李博文为该论文的共同第一作者。清华大学基础医学院2020级已毕业博士生许思齐、2023级博士生陈俊楠等也为本研究作出了重要贡献。研究得到国家自然科学基金、清华-北大生命科学联合中心、清华大学启动基金、清华大学笃实基金以及山西医科大学-清华大学医学院前沿医学协同创新基金等支持。
论文链接:
https://www.science.org/doi/10.1126/sciadv.aee4389
供稿:基础医学院
编辑:李华山
审核:王晓霞
© 版权声明
本文由分享者转载或发布,内容仅供学习和交流,版权归原文作者所有。如有侵权,请留言联系更正或删除。














恭喜清华团队,这工具确实是科研刚需