SpliceAI2 可帮助研究人员直接从 DNA 序列预测剪接位点、剪接连接和完整转录本异构体。
应对人类遗传学的巨大复杂性
在人类基因组计划启动之前,科学家普遍认为生物复杂性与基因数量相关,并估计人类可能拥有 5 万至 10 万个蛋白编码基因。1. 事实却恰恰相反。人类基因组计划发现,人类仅拥有约 2 万个蛋白编码基因,由此引出了“G 值悖论”——即基因数量与生物体复杂性之间的不匹配。2. 事实上,看似简单的香蕉约拥有 3.6 万个蛋白编码基因,比人类还多约 80%。3.
二十多年后的今天,我们已经认识到,基因数量仅能解释生物学复杂性的一小部分。人类的复杂性源于丰富的调控网络,它决定了基因何时、何地以及如何表达,以及单个基因如何产生多种不同结果。RNA 剪接正是实现这种复杂性的关键机制之一。通过使单个基因生成多种不同的转录本和蛋白质,它大幅扩展了有限基因组所能实现的功能范围。4.
身兼多职:理解单个基因如何发挥多重功能
如今,BioInsight AI Lab 推出了 (查看论文详情), 这是一款经过预训练的 AI 模型,旨在帮助研究人员探索可变剪接。超过 95% 的人类基因会发生可变剪接,这表明其几乎广泛参与各种生物学功能的调控,从蛋白活性的细微变化到截然不同的分子功能均与之相关4。
可变剪接实例
BCL2L1是参与细胞凋亡正常过程的重要基因。然而,先前研究发现,由于剪接作用,BCL2L1 会产生长型(BCL-xL)和短型(BCL-xS)两种异构体,且二者具有相反的功能5。尽管 BCL-xS 具有促进细胞凋亡的作用,但多种癌症更倾向于表达 BCL-xL 异构体。BCL-xL 可通过阻止细胞色素 c 从线粒体释放,并抑制 Bax 等促凋亡蛋白,从而促进细胞存活5。
这种剪接活动是生物发育的基础组成部分,并在整个生命周期中发挥重要作用。在包括癌症在内的多种疾病中,剪接模式也会发生改变5。鉴于可变剪接相关关键调控变化的极大多样性,BioInsight AI Lab 多年来一直致力于开发相关工具,帮助研究人员探索剪接变体如何影响重要生物学过程6。
SpliceAI2:更全面地理解剪接机制
SpliceAI2 是对初代 SpliceAI6 的升级。初代 SpliceAI 由 BioInsight AI Lab 于 2019 年发布,现已成为转化基因组学研究中应用最广泛的工具之一,并在 3,400 余篇论文中被引用。初代 SpliceAI 主要回答一个关键问题:细胞是否会在特定位置发生剪接?
SpliceAI2 可帮助回答三个关键问题:
- 剪接位点 – 基因中的哪些位置被用作剪接位点,以及这些位点被利用的频率是多少?
- 剪接连接 – 在 RNA 剪接过程中,哪些剪接位点彼此连接?
- 完整转录本 – 基于这些剪接位点和剪接连接,会产生哪些全长 RNA 转录本异构体?
初代 SpliceAI 仍然是一款强大的工具,因为识别剪接位点是理解基因调控机制的重要一步。然而,它无法揭示这些位点之间如何连接,也无法预测细胞最终产生哪些 RNA 转录本。为此,SpliceAI2 在剪接位点检测的基础上进一步扩展,能够预测剪接位点如何通过剪接连接相互关联,并重建由 DNA 序列产生的完整转录本异构体。这些能力结合在一起,可更全面地揭示遗传变异如何影响基因功能,为理解基因发挥复杂乃至意想不到的作用提供更深入的视角。
值得注意的是,运行 SpliceAI2 仅需 DNA 序列即可。该模型基于转化研究中 DNA 测序广泛应用的现实需求而开发,旨在帮助研究人员避免自行生成长读长 RNA 数据所需的成本和复杂流程。同时,它还解决了 RNA 研究方法的一项关键局限,即组织样本的可获取性。许多基因在血液中的表达水平不足,难以可靠地评估其剪接情况,因此研究人员往往需要获取难以取得的组织样本中的 RNA,才能分析潜在的剪接改变变异。通过直接从 DNA 序列预测转录本结果,SpliceAI2 无需获取基因实际表达所在组织,即可实现转录本水平的分析。
SpliceAI2 的构建:AI 的价值取决于其训练数据
SpliceAI2 性能的提升很大程度上得益于其训练数据的广度和多样性。与初代 SpliceAI 相比,SpliceAI2 使用的训练数据集规模扩大了 100 多倍。更新后的训练数据包含来自 10 个物种的 314,745 个 RNA 测序样本,经筛选后覆盖超过 4,600 万个实际观测到的剪接连接。通过整合数十万个 RNA 测序实验,模型能够从相当于超深度 RNA-seq 数据集中学习,不仅捕获常见的剪接连接,还涵盖了许多低频使用的剪接连接。这些低频剪接事件在单项研究中往往难以观察,但共同提供了理解剪接生物学全貌的重要信息。
从这一更丰富的剪接位点和剪接连接数据库中学习,显著提升了模型预测剪接结果的能力。这部分训练数据来源于数十万个公开数据集中经过严格筛选的高相关性数据,对 SpliceAI2 的前两项功能至关重要,即剪接位点预测和剪接连接使用预测。
第三项功能,即完整转录本异构体预测,则受益于另一类训练数据。传统短读长测序获取的是片段化的遗传信息,非常适合识别单个剪接位点,但在判断多个剪接事件是否属于同一条完整转录本时存在局限。相比之下,长读长测序能够完整覆盖转录本。为实现转录本水平预测,BioInsight AI Lab 利用公共 ENCODE 项目的 330 个长读长测序样本对 SpliceAI2 进行了训练。这使 SpliceAI2 能够学习单个剪接事件如何组合形成完整转录本,并能够在从未见过的基因中,以 82% 的准确率重建最常见的转录本,而仅使用短读长数据训练时这一比例为 78%。
模型性能:在多项测试中表现稳健
为评估 SpliceAI2 与其他分析工具的性能,BioInsight AI Lab 将其与初代 SpliceAI、Pangolin 以及 Google DeepMind 的 AlphaGenome 在三个独立基准数据集上进行了比较。其中,AlphaGenome 的对比评估由牛津大学的学术合作团队独立完成。
在本次测试所采用的基准数据集中,SpliceAI2 展现出良好的预测性能。具体而言,在识别可产生新剪接位点的变异方面,SpliceAI2 的表现具有竞争力,尤其是在位于内含子深部区域的变异分析中表现突出。此外,它在多个方面展现出较好的性能。首先,相较于仅判断剪接位点是否存在,它能够更准确地评估剪接位点的利用程度。其次,它能够识别与自然人群剪接差异相关的变异。最后,其预测结果与一项大规模实验研究的结果具有较高一致性,该研究直接评估了数十万个突变对剪接的影响(图1)。
图 1. SpliceAI2 在各项基准测试中展现出良好的预测性能。
对遗传病研究的影响:将视野扩展至蛋白编码区之外
SpliceAI2 研究中最具启发性的发现之一来自对英国基因组学 10 万基因组计划(Genomics England 100,000 Genomes Project)的分析。该项目旨在加深对罕见病遗传基础的理解。研究人员分析了 7,504 名具有丰富表型信息个体的样本,并提出了一个简单的问题:如果 SpliceAI2 预测某个变异会影响剪接,那么这些变异是否更有可能出现在与个体表型相关的基因中?
为严谨回答这一问题,研究团队多次随机打乱参与者的表型信息并重复分析,以建立随机情况下的基线预期。结果显示,经 SpliceAI2 优先筛选的变异更倾向于出现在具有生物学相关性的基因中。在相同置信度阈值下,SpliceAI2 识别出的疾病相关变异数量高于其他参与比较的剪接模型。与初代 SpliceAI 相比,在 2 倍置信区间下,SpliceAI2 识别出的疾病相关剪接变异数量增加了 33%;在 4 倍置信区间下,这一增幅达到 66%(图 2)。最明显的富集现象出现在已知对功能缺失高度敏感的基因中,表明该模型能够识别可能具有重要生物学影响的剪接干扰变异。
更值得关注的是,这些变异所在的位置。SpliceAI2 识别出的隐匿性剪接变异中,约有 50% 位于内含子深部区域,通常距离蛋白编码序列数千个碱基。这类变异由于位于基因分析中通常不被重点关注的区域,因此较难被发现和解读。然而,它们可能产生全新的剪接位点、改变转录本组成,并最终影响基因功能。这些发现进一步说明,理解生物学过程不能仅关注约占基因组 2% 的蛋白编码区域,还需要深入研究更广泛的非编码区域。
图 2. SpliceAI2 有助于识别具有生物学相关性的剪接变异。
AI 赋能群体规模研究:SpliceAI2 的预测获得进化与功能证据支持
SpliceAI2 在预测具有重要影响的剪接变异方面表现出良好的能力,这促使 BioInsight AI Lab 进一步评估其在更大规模数据集中的预测表现。研究团队将 SpliceAI2 应用于由 gnomAD、TOPMed 和 UK Biobank 汇总而成的大型队列数据,其中包括 62.7 万份基因组样本和 36,764 份蛋白组样本,并围绕以下两个问题开展研究:
- 在数十万个基因组中,被预测为有害的变异是否在人群中较为罕见?
- 当这些变异存在时,是否会导致蛋白产量下降?
这两个问题基于遗传学领域的共识:真正有害的变异会降低生物适应性,因此在负向选择作用下通常在人群中保持较低频率。换言之,如果模型确实能够识别具有不利影响的变异,那么这些变异无论是在基因型层面还是在相关蛋白丰度层面,都应表现出较低的出现频率。
研究结果为 SpliceAI2 的预测与生物学效应之间的关联提供了独立证据。获得较高 SpliceAI2 评分的变异在超过 62.7 万份基因组样本中出现频率较低,其趋势与功能缺失型蛋白截短变异相似。独立的蛋白组学数据也得出了相同结论:携带较高评分变异的个体通常表现出较低的血浆蛋白水平,且这种相关性强于其他参与比较的预测模型(图 3)。这些结果表明,SpliceAI2 评分能够反映具有生物学意义的影响,而不仅仅是统计学关联,同时也说明该模型可适用于大规模群体遗传学和蛋白组学数据分析。
图 3. 在群体规模数据中,SpliceAI2 识别的变异显示出负向选择特征。─SpliceAI2 被应用于整合自 gnomAD、TOPMed 和 UK Biobank 的队列数据,包括 62.7 万份基因组样本和 36,764 份蛋白组样本,以评估其预测变异的负向选择特征。 A:SpliceAI2 能够有效识别潜在有害变异。B:SpliceAI2 的预测结果与潜在有害变异导致的下游蛋白丰度下降具有较高一致性。
构建组织特异性剪接模型:SpliceAI2 捕捉组织间的剪接差异
SpliceAI2 的另一项重要进展在于,它将剪接变异研究从影响预测推进到机制解析阶段。该模型不仅能够识别可能影响剪接的变异,还能够揭示驱动这些影响的调控因子和序列特征。RNA 结合蛋白的组织特异性表达是细胞实现特定剪接模式的重要机制之一,SpliceAI2 正是在这一关键生物学过程基础上开发而成。SpliceAI2 纳入了 147 种参与调控细胞剪接机制的剪接调控因子的活性数据,因此不仅能够分析 DNA 序列本身,还能够结合其所处的调控环境进行评估。在覆盖 48 种人体组织、近 1,500 万个剪接位点差异利用数据的研究中,SpliceAI2 能够较好地捕捉 RNA 剪接的组织特异性模式。
值得注意的是,模型在预测同一变异在不同组织中的影响差异方面表现相对有限。研究人员发现,预测组织特异性变异效应的最重要因素是各组织本身已有的剪接程序,这进一步凸显了细胞环境的重要性。在分析模型预测依据时,研究团队发现,SpliceAI2 能够自主学习许多真实剪接调控因子识别的序列基序,并根据调控因子的丰度调整其重要性,而这些关系并未被显式写入模型训练过程。
这些结果表明,SpliceAI2 学习的是 RNA 剪接调控规则的部分特征,而不仅仅是记忆既有结果。因此,该框架不仅适用于健康组织研究,也可用于疾病研究,并能够对影响剪接机制的癌症以及强直性肌营养不良等疾病中的剪接异常进行建模。
协同分析:多种专用模型联合使用可提高重要变异识别能力
自人类基因组计划以来,多组学技术、分析方法和具有群体代表性的数据集迅速发展,并不断证明一个事实:复杂生物学现象很少由单一因素决定。因此,BioInsight AI Lab 开发了多种专用预训练 AI 模型,希望结合各模型优势,从多个层面解析影响表型和生物学结果的调控机制。
SpliceAI2 代表了细胞调控研究中重要领域的一项进展。在开发过程中对英国基因组学 10 万基因组计划的分析显示,SpliceAI2 识别出的隐匿性剪接变异,在传统蛋白功能破坏变异之外,额外贡献了约 15% 的候选疾病相关变异。与此同时,结合其他 Illumina 模型所提供的额外机制信息后,相较于传统分析方法,可解析变异数量约提高至原来的 2 倍(图 4)。这些结果表明,更加集成化和统一的分析能力有助于研究人员获取更全面的高级注释工具,从而更深入地理解复杂生物学机制。
图 4. 联合应用 Illumina AI 模型可识别传统方法单独分析可能遗漏的变异。
扩大应用范围:让更多研究人员获得先进的基因组学解读能力
SpliceAI2、PrimateAI-3D、PromoterAI 及其他 Illumina 分析工具旨在广泛服务于基础研究和转化研究领域。为帮助研究人员将这些模型纳入现有分析流程,Illumina 提供了多种访问途径。BioInsight AI Lab 负责开发底层模型,而研究人员可通过 BioInsight 应用和软件产品使用这些创新成果。
点击此处创建免费账户,探索 BioInsight Platform
SpliceAI2 将通过 BioInsight Platform 上的多种工具提供支持,包括:
- DRAGEN Annotation:集成 SpliceAI2 及多种高级注释工具,提供统一且易于使用的分析体验。
- Emedgene:SpliceAI2 进一步增强了 Emedgene 的分析能力。Emedgene 是一个基于可解释人工智能的基因组解读平台,可帮助转化研究人员进行胚系变异优先级分析和结果解释。
- Illumina Connected Insights:SpliceAI2 进一步扩展了 ICI 云端体细胞变异分析、注释及证据审查流程中的 AI 驱动注释能力。
此外,源代码、训练完成的模型,以及覆盖人类基因区域内所有可能单核苷酸变异和人群已观察到插入缺失变异的预计算预测结果,现已在 GitHub 上公开发布 (github.com/Illumina/SpliceAI2)
与 BioInsight 合作
随着 BioInsight AI Lab 持续优化现有高级注释工具并开发新模型,高质量训练数据的重要性愈发凸显。研究表明,各模型通常在与其训练数据特征相近的数据集上表现更佳。因此,进一步丰富和扩展训练数据来源,对于持续提升模型能力至关重要。
为推动这一重要领域的发展,BioInsight 欢迎围绕 SpliceAI2 及其他在研模型开展合作。如需了解队列特异性性能优化、罕见病研究、祖源多样性提升、模型评估、未来疗法研究等相关合作机会,请联系 BioInsight-Info@Illumina.com。
关于 BioInsight AI Lab
BioInsight AI Lab 致力于开发基于序列的全基因组解读模型,包括针对非编码区域的分析能力。目前许多常见解读框架仍主要聚焦于约占基因组 2% 的蛋白编码区域。SpliceAI2 是继 SpliceAI6、PrimateAI-3D7 和 PromoterAI8 之后推出的新一代模型。SpliceAI 已被纳入 ClinGen 临床变异解读建议;PrimateAI-3D 用于蛋白功能改变变异分析;PromoterAI 用于评估影响基因表达的变异。上述模型均公开发布了方法学和基准测试结果,并支持独立评估。本研究中的 AlphaGenome 对比分析即由学术合作团队独立完成,而非由内部团队开展。
致谢
本项目由 Kishore Jaganathan 和 Kyle Kai-How Farh 牵头,Jianbin Chen、Xin Liu 和 Yan Zhang 为共同第一作者,并与 Illumina 同事以及牛津大学、加州大学旧金山分校和纽约基因组中心的合作团队共同完成。本文由 Laurel Mastro、Lisa Eldridge 和 Robert Yamulla 撰写。
感谢 Genomics England National Genomic Research Library 项目参与者,以及 GTEx、gnomAD、TOPMed 和 UK Biobank 的捐赠者和参与者。同时感谢 ENCODE 联盟提供支持转录本预测研究的长读长测序数据。
文献参考
- Salzberg SL. Open questions: How many genes do we have? BMC Biol. 2018 Aug 20;16(1):94. doi: 10.1186/s12915-018-0564-x. PMID: 30124169; PMCID: PMC6100717.
- Hahn, M.W. and Wray, G.A. (2002), The g-value paradox. Evolution & Development, 4: 73-75. https://doi.org/10.1046/j.1525-142X.2002.01069.x
- Droc G, Larivière D, Guignon V, Yahiaoui N, This D, Garsmeur O, Dereeper A, Hamelin C, Argout X, Dufayard JF, Lengelle J, Baurens FC, Cenci A, Pitollat B, D'Hont A, Ruiz M, Rouard M, Bocs S. The banana genome hub. Database (Oxford). 2013 May 23;2013:bat035. doi: 10.1093/database/bat035. PMID: 23707967; PMCID: PMC3662865.
- Wang Y, Liu J, Huang BO, Xu YM, Li J, Huang LF, Lin J, Zhang J, Min QH, Yang WM, Wang XZ. Mechanism of alternative splicing and its regulation. Biomed Rep. 2015 Mar;3(2):152-158. doi: 10.3892/br.2014.407. Epub 2014 Dec 17. PMID: 25798239; PMCID: PMC4360811.
- Kim YJ, Kim HS. Alternative splicing and its impact as a cancer diagnostic marker. Genomics Inform. 2012 Jun;10(2):74-80. doi: 10.5808/GI.2012.10.2.74. Epub 2012 Jun 30. PMID: 23105933; PMCID: PMC3480681.
- Jaganathan K, Kyriazopoulou Panagiotopoulou S, McRae J et al, Predicting Splicing from Primary Sequence with Deep Learning, Cell, 2019; 176, 535-548.e24
- Hong Gao et al. The landscape of tolerated genetic variation in humans and primates. Science 380, eabn8153 (2023). DOI:10.1126/science.abn8197
- Kishore Jaganathan et al. Predicting expression-altering promoter mutations with deep learning. Science 389, eads7373 (2025). DOI:10.1126/science.ads7373