布里斯托大学杨曜岭等Nature Communications:高效血统推断算法实现质的飞跃
第一作者:杨曜岭
通讯作者:杨曜岭、Daniel Lawson
通讯单位:布里斯托大学数学院统计系、布里斯托大学人口健康科学 MRC 综合流行病学部
原文链接:https://www.nature.com/articles/s41467-025-57601-3
局部血统推断工具SparsePainter链接:https://github.com/YaolingYang/SparsePainter
全基因组整体血统推断工具PBWTpaint链接:https://github.com/richarddurbin/pbwt
全文速览
随着生物库规模的不断扩大,为了深入了解基因功能和历史,迫切需要更加高效的基因组区域祖先起源推断方法。该研究描述了两种近乎线性时间复杂度的算法,利用PBWT位置变换的优势来推断血统信息。其中,SparsePainter是一种较以往基于模型的“染色体绘画”算法更快速、更稀疏的替代方案,用于识别最近共享的单倍型;而PBWTpaint则通过进一步的近似处理,实现了极快的全基因组相关性估计。这些用于精细的局部血统推断工具在计算效率上的提升,使得可以采用不同方法对大规模基因组数据集进行分析。对UK Biobank的应用表明,单倍型成分(HCs)比传统主成分(PCs)能更好地表示血统信息,同时通过血统的连锁不平衡分析(LDA&LDAS)与血统异常区域分析(AAS)揭示了许多与免疫反应相关基因区域中群体特异性选择近期变化的信号,这为理解病原体与免疫系统在历史时空中的相互作用提供了新途径。
背景介绍
局部血统推断(Local Ancestry Inference, LAI)是指在个体基因组中确定各个区域的血统来源,这一方法对揭示疾病关联、解析人群迁徙历史以及研究进化机制具有重要意义。传统方法主要依赖于基于隐马尔可夫模型(HMM)的染色体绘画技术,尽管精度较高,但当面对如UK Biobank等超大规模数据集时,计算时间长、内存消耗大的问题显得尤为突出。因此,如何在保证推断准确性的前提下,提高计算效率,成为当前遗传学研究中的一大挑战。此外,传统方法主要使用基于单核苷酸多态性(SNP)的主成分来描述血统信息,这往往难以捕捉到细微的局部变异信息,而单倍型信息则更能反映真实的遗传传承关系,这有助于在全基因组相关性研究(GWAS)中更好地控制噪声。
研究出发点
(1)数据规模与计算瓶颈
随着生物库中样本数量的急剧增加,传统的全基因组局部血统推断方法在面对数十万甚至百万样本时,计算复杂度和内存需求呈指数级增长,难以满足实际研究的实时分析需求。
(2)创新算法设计的需求
为了解决上述问题,该研究提出利用“稀疏单倍型匹配”策略,仅保留每个基因组位点上的关键信息,从而在大幅降低计算资源消耗的同时,依然能准确捕捉到局部血统变异。具体而言:
·SparsePainter 通过仅保留各区域上数条匹配长度最大的单倍型,近似实现传统染色体绘画模型,但在数据处理上更加高效、存储要求更低。
·PBWTpaint 利用PBWT数据结构,实现对全基因组范围内快速匹配的提取,适用于基于全基因组相关性估计的血统分析。
(3)传统PC对于血统信息的细节捕捉不足
传统方法在使用基于SNP的主成分(PCs)作为血统信息表征时,往往忽略了单倍型中包含的序列相关性信息,这使得对个体局部血统结构的解析不够细致,难以揭示最近的群体选择信号,尤其是在与免疫功能相关的区域中。该研究提出用单倍型成分(HCs)能够更好的捕获人口之间的关联性。
图文解析
图1:SparsePainter和PBWTpaint的科学应用概述。
PBWTpaint 采用无监督的all-vs-all绘画策略,主要用于精细群体结构的探索,如聚类分析、主成分分析(PCA)、人口历史追溯、全基因组血统推断等。SparsePainter 是有监督学习下的染色体绘画方法,包括参考组内部(reference‑vs‑reference)以及目标样本与参考组之间(target‑vs‑reference)的局部血统推断。SparsePainter 能够推断历史上的种群混合事件,还能通过血统连锁不平衡、血统异常检测等方法推断自然选择。
图2:不同血统推断工具的速度对比
a-b:在reference-vs-reference绘画中,传统的 ChromoPainter 随着参考样本规模增大,其计算复杂度呈二次增长,而 SparsePainter 则呈现近似线性的扩展趋势;PBWTpaint 的速度更是领先数个数量级,且内存需求远低于其他方法。
c-d:在target-vs-reference绘画中,SparsePainter在人口种群数量庞大时有显著优势。
图3:不同血统推断工具的精度对比以及SparsePainter精度与系数策略的平衡
a:在reference-vs-reference 模式下,各方法精度相似。
b:在 target-vs-reference 模式下,SparsePainter的精度很高,且在复杂模型中性能更佳。
d:在SparsePainter中增大参考数据集规模显著提高了预测准确性,而适当控制 Q 值则可以在不牺牲准确度的前提下有效节省计算资源。
图4:单倍型成分(HCs)与传统 SNP 主成分(PCs)的比较
a:通过线性回归模型证明,利用 150 个 HCs 可以预测 UK Biobank 前 16 个 PC,其R²在前 9 个 PC 上超过 80%,说明 HCs 对全基因组血统信息的捕捉能力非常强。
b:用 150 个 PCs 来预测 HCs 时,有多个 HC 的预测效果较差,表明 HCs 包含了 PCs 未能充分表达的额外遗传信息。
c:通过将第 5、8、11 个 HC 映射到英国和爱尔兰的地理分布上,利用红、绿、蓝三色对各地区进行编码,直观地反映出各区域的遗传结构差异,并展示了通过 HCs 进行地理血统预测时所产生的较小误差(例如中位预测误差仅约 40 公里,是用PCs预测误差的一半),进一步证明了 HCs 在精细人群结构分析中的应用价值。
图5:基于 1000 Genomes项目数据的 UK Biobank 样本局部血统建模及自然选择信号检测
本研究基于两种不同的模型,分别为使用26个种群(26-pop)或者5个大洲种群(5-continent)的1000 Genome 项目数据作为参考集,以推断UK Biobank中现代样本的局部血统。
a:展示了各族群个体在不同参考群体上的血统比例分解,每一列代表一名个体,不同颜色对应不同的参考群体,直观地呈现了族群内部的遗传混合情况。
b-c:展示了在UK Biobank的各个种族中血统连锁不平衡得分(LDAS)和血统异常得分(AAS)的显著性检验,显著AAS以及LDAS均表明血统关联性较低,暗示了这些区域在近代发生了自然选择。
图6:免疫相关基因的自然选择信号总结
核心免疫调控基因的共同适应性信号:在采用26-pop和5-continent两种参考模型的分析中,一些核心免疫基因(例如 MRC1、HLA-DRB1 等)始终显示出显著低的LDAS和AAS值。具体来说,这些区域继承的单倍型片段远短于预期,表明它们可能经历了近期的正向选择。这种一致性提示,无论在全球还是局部族群层面,这些基因在应对广泛存在的病原体时都发挥了关键作用,是人类免疫系统演化中的共同适应性反应。
族群特异性适应信号的揭示:图中还发现部分基因在26-pop模型中表现出显著信号,但在5-continent模型中则不明显,这表明这些基因的选择压力可能具有地域或族群特异性。例如,与抗病毒和炎症调控相关的一些基因,在特定族群中(如非洲裔或南亚裔)显示出更显著的低LDAS或低AAS信号,暗示这些区域可能受到局部病原体环境或历史迁徙事件的驱动而快速适应。
单一指标与组合指标的多维选择压力:此外,图6中还区分了仅在LDAS或AAS上表现异常的基因。LDAS仅异常的基因通常涉及对特定感染的响应(例如某些T细胞受体相关基因),而AAS仅异常的基因则往往与多种功能性变化和疾病风险相关。这种现象说明,免疫系统的适应性演化是一个多层次、复杂的过程,不同基因可能在不同生物学功能层面上受到选择压力的驱动。
总结与展望
该研究利用 SparsePainter 与 PBWTpaint 两种高效算法,实现了大规模局部血统推断,在计算效率和内存使用上均显著优于传统方法。该研究提出的新算法采用稀疏单倍型匹配策略,在大幅降低计算复杂度的同时,仍能准确捕捉到精细的局部血统信息。这一点在处理如 UK Biobank 这样数十万样本的数据时尤为突出,为大规模遗传数据分析提供了有力工具。此外,该研究通过利用LDAS和AAS等统计指标,不仅展示了不同族群中核心免疫基因的普遍适应性,还发现了一些族群特异性选择信号。这些发现提示,在人类进化过程中,免疫系统在应对不断变化的病原体环境中发挥了重要作用,部分基因可能因此经历了迅速的正向选择。展望未来,进一步整合功能性基因组数据以及构建更精细的参考群体,将有助于深入解析免疫相关选择信号的分子机制。此外,通过扩展到更多人群和跨区域数据,研究有望构建全球性的适应性进化图谱,进而推动个性化医疗和公共卫生策略的发展。
总体而言,该研究不仅在方法上实现了突破,也为理解病原体与宿主免疫系统相互作用的历史演化提供了新视角。未来的工作将致力于将这些高效算法与多维数据深度融合,进一步揭示复杂遗传背景下的适应性演化机制,为遗传学和医学研究带来更多创新和应用价值。
课题组介绍
杨曜岭主页:https://research-information.bris.ac.uk/en/persons/yaoling-yang
Daniel Lawosn主页:https://people.maths.bris.ac.uk/~madjl/
原文信息
Yang, Y., Durbin, R., Iversen, A.K.N. et al. Sparse haplotype-based fine-scale local ancestry inference at scale reveals recent selection on immune responses. Nat Commun 16, 2742 (2025). https://doi.org/10.1038/s41467-025-57601-3
天玑算·科研服务,提供计算模拟、CPU/GPU租用、服务器定制、超算集群建设、实验检测、免费计算课程等,50+全职计算工程师团队可满足您不同领域的计
评论
天玑智研

顶刊推荐

26.52%效率!重庆大学孙宽/关西大学郭昊轩Advanced Materials:多功能相变盐用于反式钙钛矿太阳能电池
陈沛冬
110 4

AI丨麦吉尔大学Ding Lab课题组 Nat Commun: 通过基于深度生成模型和主动学习的半测序方法推进大规模单细胞研究
王靖韬
310 2

电催化丨王得丽教授/刘旭坡、陈野副教授Angew:配体诱导晶格羟基活化实现高效电合成2,5-呋喃二甲酸
刘旭坡
371 6

中山大学刘川/刘佰全&浙江大学狄大卫Advanced Materials:钙钛矿opto-DRAM开启屏内光学传感显示新篇章
刘佰全
245 6

固态电池丨北理工黄佳琦教授、袁洪教授最新Adv Mater:本质安全不燃的固态金属锂电池
杨世杰
411 7
