顶刊机器学习 顶刊详情

美国西北大学杨仁东课题组Nature Communications: 基因组语言模型消除纳米孔 direct-RNA 测序中的嵌合伪影

天玑智研38
基因组语言模型HyenaDNA模型深度学习计算生物学生物信息学迁移学习零样本泛化纳米孔测序直接RNA测序长读长RNA测序碱基识别接头检测嵌合伪影转录组分析基因融合检测可变剪接分析RNA修饰

第一作者:Yangyang Li (李阳阳)、Ting-You Wang(王廷友)

通讯作者:Rendong Yang (杨仁东)

通讯单位:美国西北大学范伯格医学院,罗伯特·H·卢里综合癌症中心

期刊:Nature Communications (2026)

https://github.com/ylab-hi/DeepChopper

全文速览

纳米孔直接RNA测序 (dRNA-seq) 通过直接测序全长RNA分子,保留天然RNA修饰信息,为转录组学研究提供了前所未有的分辨率。然而,该技术存在一个长期被忽视的关键问题:嵌合伪影(chimera artifacts)的系统性产生。这些伪影由内部接头序列桥接形成,严重影响转录本注释、基因融合检测和可变剪接分析等下游应用的准确性。现有的碱基识别(base-calling)模型无法有效检测或消除这些伪影,限制了dRNA-seq在转录组学研究中的可靠性和实用性。


背景介绍

长读长RNA测序技术正在革新转录组学研究,通过提供前所未有的分辨率来检测复杂的剪接和基因融合事件。在这些技术中,牛津纳米孔技术(ONT)的直接RNA测序(dRNA-seq)脱颖而出,它能够直接测序全长RNA分子,保留天然RNA修饰,并允许对RNA生物学进行更准确和全面的分析。这种方法绕过了基于cDNA测序方法的固有局限性,如逆转录(RT)、模板转换和聚合酶链反应(PCR)扩增产生的伪影。


研究出发点

1) 系统表征dRNA-seq中嵌合伪影的普遍性和特征。虽然已有研究提示这些伪影的存在,但缺乏对其发生率、形成机制以及在不同测序化学试剂下持续性的系统性评估。

2) 开发能够识别内部接头序列的计算方法。嵌合伪影通常含有内部接头序列,但ONT dRNA-seq碱基识别工具在RNA模型下难以正确识别这些DNA接头序列,现有的接头检测工具无法利用这一特征来消除这些接头桥接的嵌合体。


图文解析

1. DeepChopper模型架构与方法学

DeepChopper采用创新的混合架构,结合长上下文基因组语言模型HyenaDNA与专门的质量块来实现单碱基精度的接头检测。原始序列首先被标记化为向量,然后通过HyenaDNA处理生成嵌入特征。这些特征随后与碱基质量信息在质量块中整合,该质量块由多层感知器(MLP)和残差连接组成,能够有效利用测序质量分数来区分真实接头序列与自然出现的相似基序或低质量区域。模型输出每个碱基的概率分数,指示其是否属于接头序列。为进一步优化预测准确性,DeepChopper实施了滑动窗口与多数投票的后处理策略,通过在读段上以步长为1的滑动窗口分析预测的接头位置分布,确保预测的接头序列对应生物学上合理的边界。这种精细化策略使DeepChopper能够准确分割嵌合读段为其组成的子读段,同时最小化虚假碎片化,实现了含有内部接头的读段被拆分为多条记录,3'端接头同时被修剪的功能。

2. DeepChopper检测嵌合读段伪影及跨平台验证

应用于前列腺癌VCaP细胞系的独立dRNA-seq数据集,DeepChopper展现了卓越的伪影检测能力。在9,177,639条长读段中,DeepChopper识别出87%的读段含有接头序列,其中148,452条读段含有内部接头,表明嵌合伪影在dRNA-seq数据中普遍存在。预测的接头序列长度分布峰值约为70 bp,与ONT SQK-RNA002试剂盒中RMX接头的预期长度一致。接头位置分布分析显示,大多数接头位于3'端,而内部接头的存在直接标志着嵌合伪影的形成。与配对的直接cDNA-seq数据集交叉验证显示,DeepChopper将不支持的嵌合比对减少了约95%,同时将cDNA支持的嵌合事件比例从5.8%提高到48.7%,证明其能够精确区分真实生物嵌合体与技术伪影。内部接头区域表现出显著的质量特征:平均Q值仅为9.96(中位数9.80),远低于高质量阈值,且与人类参考基因组的BLAT比对同一性平均仅为0.36,进一步确证其非生物来源。跨多个细胞系(A549、HCT116、HepG2、K562、MCF7)和人类WTC11诱导多能干细胞系的验证一致显示,DeepChopper在0.67-1.25%的读段中检测到内部接头,这些内部接头占所有嵌合读段的63-85%,表明接头桥接的嵌合体是假RNA重排的主要来源。

3. 嵌合伪影的特征及其对下游转录组分析的影响


关键发现

1. DeepChopper模型架构与性能

DeepChopper利用长上下文基因组语言模型HyenaDNA,能够捕获长程依赖关系。通过整合专门的质量块(quality block)来处理测序碱基质量信息,该模型能够有效区分真实接头序列与读段中自然出现的相似基序或低质量区域。这种混合架构结合了广泛的上下文理解和核苷酸级别的精度,使DeepChopper能够准确识别和处理接头序列。在合成测试数据集上,DeepChopper在识别末端和内部接头方面表现出卓越的准确性,召回率、精确度和F1分数均超过0.99。质量块的加入使F1分数从0.97提高到0.99,证明了整合测序质量信息的重要性。

2. 嵌合伪影的系统性检测与表征

应用于前列腺癌VCaP细胞系的独立dRNA-seq数据集,DeepChopper在87%的读段中识别出接头序列,其中148,452条读段含有内部接头,表明嵌合伪影在dRNA-seq数据中普遍存在。与配对的直接cDNA-seq数据集比较验证显示,DeepChopper将不支持的嵌合比对减少了约95%,并将cDNA支持的嵌合事件比例从5.8%提高到48.7%,证明了其区分真实生物嵌合体与技术伪影的能力。内部接头区域表现出较低的碱基质量(平均Q值:9.96)和与参考基因组的低序列同一性(平均BLAT同一性:0.36),进一步支持其非生物来源。

3. 跨平台和跨物种验证

对SG-NEx项目中多个细胞系的分析显示,DeepChopper在0.67-1.25%的读段中检测到内部接头,内部接头占所有嵌合读段的63-85%,表明接头桥接的嵌合体是假RNA重排的主要来源。DeepChopper在不同细胞系中将不支持的嵌合比对减少了62%至84%,同时保留了cDNA支持的嵌合比对。对人类WTC11诱导多能干细胞系和F121-9小鼠胚胎干细胞系的扩展分析证实了DeepChopper的跨物种泛化能力。

4. RNA004化学试剂的零样本泛化与微调

在最新的RNA004化学试剂上,仅使用RNA002训练的DeepChopper模型在零样本设置下检测到0.33%的读段含有内部接头(低于RNA002的1.62%),将嵌合比对减少了21%。经过RNA004数据微调后,模型性能进一步提高,嵌合比对减少了23-25%,较零样本模型提高了3-4%。重要的是,两个模型都保留了所有cDNA支持的嵌合比对,证明DeepChopper特异性靶向接头桥接的伪影而非生物学RNA重排。虽然RNA004中的伪影减少幅度低于RNA002,但这与化学试剂改进减少伪影形成的预期一致。

5. 对下游转录组分析的影响


总结与展望

本研究系统地表征了ONT dRNA-seq中接头桥接的嵌合伪影这一长期被忽视的问题,并开发了DeepChopper作为有效的解决方案。通过利用基因组语言模型的长程上下文理解、迁移学习能力和质量感知预测,DeepChopper实现了以单碱基精度检测内部接头序列,从而能够恢复接头桥接的嵌合体的组成子读段。这种基于接头的方法从根本上不同于简单丢弃问题读段的过滤方法,代表了从过滤到校正的范式转变,在提高准确性的同时保留了有价值的数据。

跨多个细胞系、物种和测序化学试剂的验证证明,内部接头系统性地出现在0.33-1.62%的读段中(每个实验数万到数十万条),每个都会向转录本注释、基因融合检测和表达定量传播错误。DeepChopper在RNA002和RNA004数据上都表现出色,实现了62-91%的伪影减少,同时保留了所有cDNA支持的生物学事件。零样本泛化能力和跨化学试剂的一致性能证明了学习到的概率模式能够实现稳健的泛化,而无需针对特定协议的重新校准。


课题组介绍

Rendong Yang (杨仁东) 教授课题组专注于开发创新的计算生物学工具和方法,应用于癌症基因组学和转录组学研究。课题组在基因组语言模型、长读长测序数据分析和生物信息学工具开发方面具有丰富的经验。


工具与数据可用性

DeepChopper (v1.2.6)采用Rust和Python实现,开源并在GitHub上提供(https://github.com/ylab-hi/DeepChopper),遵循Apache License 2.0。该软件包可通过PyPI (https://pypi.org/project/deepchopper/)使用pip安装,为Windows、Linux和macOS提供wheel发行版以确保跨平台安装便捷。Hugging Face上提供了交互式演示(https://huggingface.co/spaces/yangliz5/deepchopper),允许用户在无需本地安装的情况下测试DeepChopper的功能。对于大规模分析,建议在具有GPU加速的系统上使用DeepChopper。


原文信息

Li, Y., Wang, TY., Guo, Q. et al. Genomic language model mitigates chimera artifacts in nanopore direct RNA sequencing. Nat Commun (2026). https://doi.org/10.1038/s41467-026-68571-5


评论

0/1000发布评论
全部评论

天玑智研

关注
TA的主页

顶刊推荐