文章导读
宏基因组数据高度混杂,如何从中重建高质量微生物基因组,并追踪与疾病相关的遗传变异?西安交通大学杨铁林团队开发MetaCAT,结合生物学先验、k-mer频率、测序覆盖度等信息,实现更高效、精准的基因组重建,并贯通SNP检测与宿主关联分析。研究鉴定超过936万个微生物SNP,发现6种细菌中的98个SNP与宿主结直肠癌显著相关,为微生物组研究从物种丰度走向菌株和遗传变异解析提供了新路径。
— 内容由好学术AI分析文章内容生成,仅供参考。
宏基因组测序极大拓展了人们认识复杂微生物群落的能力,但从海量混合序列中准确重建微生物基因组,并进一步解析微生物遗传变异与宿主健康和疾病之间的关系,仍是微生物组研究中的重要挑战。一方面,宏基因组数据来源复杂、序列高度混杂,不同微生物丰度差异显著且存在大量近缘菌株,给高质量微生物基因组重建带来挑战。另一方面,目前微生物组疾病研究主要关注物种组成和丰度变化,而同一物种内部的遗传变异及其宿主效应仍缺乏系统解析。因此,如何在复杂宏基因组数据中实现高效、准确的微生物基因组解析,并进一步识别与宿主疾病相关的微生物遗传变异,是推动微生物组研究向更高分辨率发展的关键问题。
近日,西安交通大学杨铁林教授团队在《自然·微生物学》(Nature Microbiology)在线发表题为《MetaCAT实现宏基因组高质量微生物基因组重建及其与宿主性状的关联解析》(MetaCAT enables reconstruction of high-quality microbial genomes and their association with host traits from metagenomic data)的研究论文。团队开发了一种宏基因组分析新方法MetaCAT,不仅提高了复杂宏基因组中高质量微生物基因组的重建能力和计算效率,还进一步整合了微生物SNP检测及宏基因组关联分析,使宏基因组研究能够从传统的物种组成与丰度分析深入到微生物遗传变异与宿主表型关联,为精准解析宿主—微生物互作提供了新的方法基础。

微生物基因组重建的核心是将来自同一微生物的序列片段准确聚类。现有方法在复杂、大规模宏基因组数据中,往往难以同时兼顾准确性和计算效率。研究团队以单拷贝基因等生物学先验为引导,综合利用k-mer频率、测序覆盖度和序列长度信息,并将稀疏加权狄利克雷过程高斯混合模型(SWDPGMM)与半监督聚类策略结合,实现复杂宏基因组数据的高效、高精度重建。MetaCAT在多种不同复杂度的数据集中均表现出优异的基因组重建能力和计算效率。

图1 MetaCAT模型框架示意图
MetaCAT的另一重要突破是将微生物组研究从传统的物种组成和丰度分析进一步推进至基因组变异层面。基于高质量微生物基因组重建,MetaCAT进一步集成代表性基因组筛选、物种丰度分析、微生物SNP检测和宏基因组关联分析,从而形成从“宏基因组序列”到“微生物基因组”、再到“微生物遗传变异”和“宿主表型”的连续分析过程。团队鉴定出超过936万个微生物SNP,并进行宏基因组关联分析,发现分布于6种细菌中的98个微生物SNP与宿主结直肠癌显著相关,表明深入到菌株和遗传变异层面,能够进一步发现传统分析难以捕获的宿主—微生物关联。
该研究的意义不仅在于开发了一种新的宏基因组分析方法,更在于将微生物基因组重建、遗传变异检测与宿主关联分析贯通起来,使微生物组研究从“哪些菌与疾病相关”进一步深入到“微生物基因组中的哪些遗传变异与疾病相关”。这为从菌株和遗传变异层面理解微生物—宿主互作提供了新的研究路径,并推动微生物组研究由群落组成描述向精细机制解析和精准微生物组研究发展。
西安交通大学生命学院刘聪聪助理教授、董珊珊教授、郭婧助理教授和博士生许振为该论文共同第一作者,杨铁林教授、郭燕教授为通讯作者。西安交通大学生物医学信息工程教育部重点实验室和生命学院为该论文第一和通讯单位。该研究得到国家自然科学基金、陕西省杰出青年科学基金、中国博士后科学基金、中央高校基本科研业务费等项目以及西安交通大学高性能计算平台和分析测试共享中心的支持。
原文链接:https://doi.org/10.1038/s41564-026-02472-7
© 版权声明
本文由分享者转载或发布,内容仅供学习和交流,版权归原文作者所有。如有侵权,请留言联系更正或删除。














能做到菌株遗传变异层面,确实很关键