用人工智能判断微生物从哪里来

转载
来源:微生物生态iMcro
2026-08-27 10:17:43
7次浏览
分享:
收藏
核心提示:机器学习特别适合处理高维数据、识别复杂模式和进行预测,所以可以从 16S rRNA 扩增子测序、宏基因组测序等数据中找到能区分来源的微生物特征

微生物来源追踪( microbial source tracking,简称 MST),意思是根据一个样品里的微生物组成,推断这些微生物来自哪里。比如一条河被污染了,研究者想知道污染主要来自农田、养殖池、城市径流、工业废水还是生活污水;一份食品被污染了,管理者想知道污染是在农场、加工厂、运输链还是市场环节发生的;一个城市环境样品来源不明,研究者也可以用微生物群落特征推断它更像来自哪个城市或地点。文章认为,随着高通量测序和微生物组研究发展,MST 已经从过去依赖少数指示菌的检测,转向利用整个微生物群落进行统计推断和机器学习预测。

微生物几乎存在于地球所有环境中,包括冰盖、深海热液、土壤、大气、植物和动物宿主。因为不同环境有不同的温度、盐度、营养、宿主和人为活动压力,所以微生物群落常常带有环境特征。MST 正是利用这种特征,反推微生物来源。早期 MST 主要用于识别水体粪便污染来源,例如判断污染来自人、牛、猪、鸟类还是其他宿主。后来它的应用范围扩大到公共卫生、食品安全、环境污染、地理来源判断和法庭科学。文章特别说明,虽然流行病学应用也很重要,但这篇综述没有详细讨论高度传染性人类病原体的流行病学追踪,而是更关注环境、食品和法医学中的微生物来源推断。

传统 MST 方法有很多局限。培养法可以检测粪大肠菌群、肠球菌等指示菌,但通量低、培养时间长,而且很多目标微生物在环境中数量低或难培养。表型方法可以利用抗生素抗性谱、碳源利用模式、磷脂脂肪酸或化学标志物来推断来源,但通常费时费力,需要庞大的参考库,且容易受到水平基因转移或环境变化影响。基因型方法比表型方法分辨率更高,例如核糖体分型、脉冲场凝胶电泳、AFLPrep-PCRT-RFLP、多位点序列分型以及宿主相关 qPCR 标记等,但有些方法通量低、重复性有限,对参考数据库依赖强,而且目标序列在环境中丰度低或降解速度受温度、盐度影响时,灵敏度会下降。高通量测序让研究者可以直接看整个群落组成,但数据量巨大、维度很高,也带来了新的分析瓶颈。

机器学习特别适合处理高维数据、识别复杂模式和进行预测,所以可以从 16S rRNA 扩增子测序、宏基因组测序等数据中找到能区分来源的微生物特征。与传统方法相比,机器学习不仅可以提高准确率和分辨率,还能把 MST 推向更复杂的应用场景,比如多来源混合污染比例估计、城市级地理定位、食品污染路径重建和法医证据辅助判断。文章也强调,机器学习不是万能的,它的可靠性取决于参考数据库是否完整、训练样本是否代表真实环境、模型是否能解释,以及是否考虑微生物进入新环境后的生长、死亡、竞争、交叉喂养和环境过滤。

文章介绍的机器学习和统计方法主要包括 SourceTrackerFEASTSTENSL、随机森林 RF ONN4MST。这些工具不是做同一件事,而是适合不同问题。SourceTracker 是贝叶斯混合模型,用 MCMC 估计一个汇样品中来自不同已知来源和未知来源的比例,适合做来源比例解析。FEAST 也是来源比例估计工具,但用期望最大化算法,比 SourceTracker 更快,适合大规模数据。STENSL FEAST 的稀疏扩展,用 L1 正则化自动筛掉很多无贡献候选来源,适合候选来源很多、但真正贡献来源较少的场景。随机森林是监督学习分类算法,适合已知来源类别明确、目标是判断样品属于哪一类来源的情况。ONN4MST 是深度学习框架,能结合微生物组成和环境本体层级标签,适合大规模、多层级来源分类。第 4 页表 1 对这些方法的输入、输出、优势和限制做了对比:SourceTrackerFEAST STENSL 主要给出来源比例,RF 主要给出来源类别,ONN4MST 支持层级来源或生境预测。

不同工具的性能和适用场景也不同。文章提到,随机森林在来源分类中表现稳定,因为它通过多个决策树降低过拟合,也能处理噪声、缺失值和不同类型数据;在一项食品来源追踪研究中,RF 对单核细胞增生李斯特菌食物来源追踪的平均准确率为 0.72,高于支持向量机的 0.61,略高于梯度提升模型的 0.70SourceTracker 的优势是灵敏度高,并且能处理未知来源项;一项双盲研究中,它在 34 个混合样品、浓度范围 0.025% 10% 的条件下达到 91% 的识别准确率,但计算成本较高。FEAST 通过 EM 算法把计算速度提高到 SourceTracker 的约 30–300 倍。ONN4MST 在大数据集上准确率达到 0.99AUC 超过 0.97,高于 FEAST SourceTracker  0.89,但它依赖大量带标签数据、预定义本体和有代表性的参考数据库。

在环境污染追踪方面,机器学习 MST 已经比较成熟。文章举例说,有研究用 SourceTracker 量化河流中的 5 类潜在污染源,发现农田和池塘养殖分别贡献 37.3%  21.6%,其他来源平均低于 10%。还有研究用 PhyloChip 16S rRNA 阵列结合 RF SourceTracker,在 Russian River 流域识别人、狗和反刍动物来源信号。污水和饮用水系统也是重要应用场景:有研究用粒子群优化随机森林模型识别企业废水和生物废水指纹,对污染区域识别准确率达到 96.55%,对责任排放企业定位准确率达到 94.25%;还有研究用 SourceTracker 分析供水系统,发现来自处理后出厂水的浮游细菌可占自来水浮游细菌群落的 17.7%–54.1%。这些例子说明,MST 可以帮助污染诊断和靶向管理,而不只是告诉我们水里有细菌

环境监测中,FEAST SourceTracker 的差异也很重要。文章提到,在低粪便污染的环境水体中,SourceTracker 没有检测到粪便贡献,而 FEAST 检测到 0.012% 3.19% 的污染贡献,说明 FEAST 在这种低污染信号下可能更稳定、更敏感。另一个例子是东庭湖沉积物来源分析,FEAST 显示沅江流域沉积物主要来自旱地 35.5% 和城市土地 17.2%。但文章也提醒,环境 MST 的实际应用受到很多因素限制,包括参考来源库不完整、候选来源高度相似、污染信号丰度低、时空变化大,以及微生物进入汇环境后会继续生长、死亡和被环境筛选。因此,ML-based MST 目前更适合作为决策支持工具,不能单独作为污染责任认定的唯一证据。

在地理来源追踪方面,文章总结了一个很有意思的方向:微生物群落可以像地理指纹一样帮助判断样品来自哪里。比如 Cassandra 这个集成学习工具利用来自 60 个城市 的样品,识别城市和大陆特异性微生物指纹,分类准确率超过 95%。中国 4 个城市的 170 个环境尘埃样品 中,FEASTLightGBM RF 模型预测未知样品地理来源的准确率超过 90%MetaSUB 联盟用 RF 分析全球 60 个城市公共交通表面  4728 个样品,把宏基因组样品分配到来源城市的准确率为 88%,并发现城市微生物指纹由全球共享核心群落和明显城市特异信号共同组成。mGPS 框架进一步利用 RF 选择地理信息丰富的分类单元,并采用层级定位策略,在 40 个城市 4070 个公共交通表面样品 中达到 92% 的城市级定位准确率;在香港地铁站点级定位中达到 82% 准确率。

地理来源追踪的价值不只在于猜城市,还可以帮助理解微生物如何沿空间梯度扩散。文章举了温泉流出通道的例子,SourceTracker 分析显示,下游微生物垫中的优势类群主要来自上游高温区沉积物,贡献为 45.5%–80.3%,随后局部水体或沉积物来源也有贡献。这说明水流像传送带一样把微生物带到下游,而环境过滤再决定哪些微生物能在不同位置留下来。文章同时提醒,地理 MST 仍受采样不均、时间变化、批次效应、测序和生信流程差异影响,模型也可能学到城市特定的混杂因素,而不是真正稳定的地理微生物信号;细尺度定位在环境相似、交通网络相连、人类活动相近或季节变化强烈时尤其困难。

在食品安全方面,机器学习 MST 可以用于病原来源归因、污染路线重建和食品产地认证。文章以单核细胞增生李斯特菌为例,说明机器学习可以把临床病例和可能食物来源连接起来。有研究分析 1212  来自不同食物来源的 L. monocytogenes 核心基因组位点序列,比较 RFlogit boost、随机梯度提升和支持向量机,其中 logit boost 表现最好,准确率为 73%。另一项荷兰监测研究分析 756  人类病例分离株和 950  食物或动物来源分离株,用 RF 做来源归因,发现人类 L. monocytogenes 病例主要与牛肉 62.3%、禽肉 19.4% 和海鲜 16.9% 相关,鲜牛肉贡献最大。原奶研究中,SMRT 测序和 SourceTracker 显示地下水可能是 Pseudomonas 等细菌的主要来源,可能通过清洗牛体表面和冷藏罐进入原奶生产链。

食品产地认证是 MST 的另一个应用。文章提到,研究者用 16S rRNA 测序和机器学习建立菲律宾蛤仔的地理来源认证框架,在马尼拉蛤的鳃和消化腺微生物数据上实现超过 95% 的来源归因准确率,并能克服季节波动、年度变化和商业净化处理的干扰。另一个例子是用宏基因组数据和 RF 分析进口大豆中的 24 个真菌和 36 个细菌标志分类单元,推断大豆地理来源的准确率超过 95%。这些应用说明,食品相关 MST 正在从事后疫情调查,扩展到供应链监管、非法捕捞识别、标签造假检测和跨境贸易生物安全风险评估。

在法医学方面,MST 的应用包括地理推断和个体识别。土壤、尘埃、鞋底、触摸物体和皮肤上的微生物群落,可能携带与地点或个人相关的信息。文章提到,DeepSpace 算法利用美国 1300 多个尘埃相关微生物群落样品,仅根据尘埃相关真菌就能以接近 90% 的准确率识别样品地理来源。中国 4 个城市尘埃样品中,SourceTracker 根据真菌 DNA 也能把所有测试样品正确归到对应城市。除了地理推断,皮肤、体液或触摸物体上的微生物也可能帮助连接样品与个人。已有研究用皮肤微生物标志、微生物 SNP 面板、CRISPR spacer 多样性和 Cutibacterium acnes 的物种或 SNP 水平特征进行个体识别探索。不过文章强调,这个方向仍处于早期阶段,很多研究样本量有限、采样条件受控、身体部位单一,在真实法医场景中的混合痕迹、环境暴露、转移、持留、污染和人群尺度差异下,还缺少充分验证。

很多研究报告的高准确率来自来源分类任务,也就是判断样品属于哪个已知类别;如果不同来源本来差异很大,或者实验设计比较理想,模型当然容易表现很好。但来源比例估计更难,因为汇样品不一定只是几个来源样品的线性混合。微生物进入汇环境后,还会继续发生生长、死亡、竞争、交叉喂养、环境过滤和生态演替,最后观测到的群落可能已经不再等比例反映原始来源。

文章的结论集中在未来挑战和发展方向。当前 ML-based MST 的主要问题包括模型可解释性不足、生态动态带来的来源推断偏差,以及缺少有明确真实来源和评价标准的基准数据集。黑箱模型虽然准确率高,但如果无法解释模型到底根据哪些微生物或功能基因做判断,就很难发现输入偏差、验证生物机制或把结果用于实际管理。作者建议未来结合可解释机器学习方法,例如 permutation importanceSHAPLIMEindividual conditional expectation plots,以及稀疏逻辑回归、规则列表、广义加性模型等本身更可解释的方法,用来提高透明度、识别关键分类单元或功能基因、发现样本偏差并增强模型可迁移性。文章还认为,未来 MST 需要从静态来源追踪转向动态时空推断。模型应该纳入时间信息、环境扰动背景和持续更新的参考数据库,更重要的是把微生物生态过程作为先验知识、结构约束或可学习机制模块放进模型。选择、漂变、扩散、物种形成、环境过滤、微生物互作、演替和扩散限制,都可能改变进入汇环境后的群落结构。作者特别提到,process-informed neural networks knowledge-guided ML 是有前景的方向,因为它们可以把生态过程知识和数据驱动模型结合起来,从而更好地处理动态、异质环境中的来源汇推断。

基准数据集也是未来发展的关键。很多真实环境中,来源身份和比例并不知道,因此很难判断模型到底准不准。作者建议未来建立两类基准:一类是已知来源比例的可控合成混合样品,用来评价定量来源估计能力;另一类是带有真实来源身份和时间变化的纵向干预数据集,比如粪菌移植数据和可控微生物群落合并实验,用来检验模型在生态演替和汇环境动态下是否稳健。深度学习是另一个前沿方向,图神经网络可以建模微生物互作网络和时间动态,Transformer 和基础模型可以通过自监督学习获得可迁移的宏基因组表示,对低标签条件下的 MST 可能有帮助。

未来微生物研究中,微生物组数据不仅能描述环境里有什么微生物,还可以反过来推断污染来源、传播路径、空间来源和人为活动影响。但如果只追求模型准确率,而不理解模型依据什么特征、这些特征是否稳定、微生物进入汇环境后是否发生了生态变化,就容易得到看似漂亮但实际不可迁移的结果。未来微生物来源追踪需要把高通量测序、机器学习、可解释 AI、生态过程模型和标准化基准实验结合起来。对环境微生物、食品安全、法医学和公共卫生来说,这意味着微生物组有机会从事后检测工具发展成实时决策支持系统,但前提是模型必须有可靠参考库、明确真实标签、可解释机制和对动态生态过程的处理能力。

 

网站声明

1、凡本网所有原始/编译文章及图片、图表的版权均属微生物安全与健康网所有,未经授权,禁止转载,如需转载,请联系取得授权后转载。

2、凡本网未注明"信息来源:(微生物安全与健康网)"的信息,均来源于网络,转载的目的在于传递更多的信息,仅供网友学习参考使用并不代表本网同意观点和对真实性负责,著作权及版权归原作者所有,转载无意侵犯版权,如有侵权,请速来函告知,我们将尽快处理。

3、转载请注明:文章转载自www.mbiosh.com

联系方式:020-87680942

评论
请先登录后发表评论~
发表评论
热门资讯