癌症研究, 产品

一所大学如何利用多组学技术变革癌症研究

波兰研究人员正在利用DNA甲基化开发更准确、更标准化的癌症分类方法

一所大学如何利用多组学技术变革癌症研究
Tomasz K. Wojdacz教授,独立临床表观遗传学实验室负责人、波美拉尼亚医科大学区域数字医学中心研究主任;以及Jan Bińkowski,独立临床表观遗传学实验室生物信息学家、博士研究生 | 照片:由PUM提供
2026年8月12日

一份肿瘤样本的表现出乎意料。

这份样本抵达什切青波美拉尼亚医科大学的生物样本库时,被归类为胶质母细胞瘤——一种侵袭性强且高度异质性的脑癌。但当研究团队使用基于因美纳甲基化芯片开发的机器学习模型分析其DNA甲基化谱时,模型将该样本识别为垂体腺瘤——一种大多为良性且生物学特征截然不同的肿瘤。

科学家们追溯了该样本在生物样本库中的流转历程。同一天,两名患者分别接受了手术,一人患有胶质母细胞瘤,另一人患有腺瘤。样本被错误标记了。

"这表明,当我们使用这些基于人工智能的解决方案时,我们不仅可以将其用于支持诊断流程,还可以用于数据完整性检查,"独立临床表观遗传学实验室的生物信息学家、博士研究生Jan Bińkowski表示,"从数据质量保证的角度来看,这绝对令人惊叹。"

这一发现凸显了DNA甲基化模式作为生物指纹的强大威力。由于不同类型的肿瘤携带不同的表观基因组特征,该团队的甲基化分类器能够识别出该样本与其记录诊断不符,最终揭示了一个标签错误。

领导这项工作的是Tomasz K. Wojdacz教授,他是独立临床表观遗传学实验室负责人,也是该校区域数字医学中心的研究主任。Wojdacz教授花了约二十年时间研究DNA甲基化生物标志物及其在医学中的潜在应用。在丹麦及其他欧洲研究机构度过了职业生涯的大部分时光后,他回到波兰并于2019年建立了该实验室。

他的目标是在一个当时大多数表观遗传学研究仍聚焦于基础生物学的国家,推进临床表观遗传学的发展。

"从一开始,我的首要目标就是建立一个团队,从事表观遗传学研究的转化工作,然后着手将波兰和欧洲的科学家团结到临床表观遗传学的理念周围,"Wojdacz说道。

在他的领导下,实验室已发展成为一个跨基因组学、表观基因组学、转录组学、生物信息学和机器学习的多学科团队。它与两家主要地区医院、波兰各地的肿瘤科以及其他大学开展合作,同时建立了一个精心管理的生物样本库,内含数百份肿瘤标本。

从甲基化中学到更多
尽管几乎每个细胞都含有基本相同的DNA序列,但细胞可以以不同方式利用这些信息。DNA甲基化等表观遗传修饰有助于调控基因的活跃或沉默状态。癌症可以破坏这些模式,留下分子特征,这些特征可能揭示肿瘤是否存在、属于哪种类型、起源于何处,或对治疗的反应如何。

Wojdacz的团队最初使用因美纳Infinium HumanMethylation450 BeadChip和Infinium MethylationEPIC芯片构建机器学习模型,开发了一种用于肿瘤分类的研究工具。由此产生的泛癌分类器基于数千份样本开发,旨在检测癌症、区分肿瘤类型,并在转移性疾病中识别可能的原发部位。Bińkowski和Wojdacz在《Genome Medicine》上报告了这项工作。

在一项前瞻性研究中,该分类器展示了甲基化芯片的价值——这种芯片可在基因组上数千个战略性选择的位点提供高度可重复的测量结果。在该团队的胶质母细胞瘤研究中,基于芯片的分析在16份样本中确认了15份的诊断,并为14份样本分配了精确的胶质母细胞瘤分子亚型。这些结果凸显了基于甲基化的分析在提供更准确肿瘤特征描述方面的潜力,使研究人员能够更好地理解疾病生物学并推进转化癌症研究。

芯片仍然是研究大型样本队列甲基化的高效选择。但Wojdacz看到了更进一步的机会。

"看看我们仅用芯片上约80万个CpG位点就做到了什么,"他说,"我们基于这一CpG位点子集建立了肿瘤和组织分类器;我们在破译癌症生物学方面取得了重大进展,甚至能够利用这项技术从液体活检的肿瘤游离循环DNA中检测甲基化变化。这是癌症研究中的一次革命。"

问题是,当研究人员能够在单次实验中同时检测基因组和整个甲基组——即全基因组范围的DNA甲基化模式——时,还有什么可能成为现实。

将5-碱基测序投入测试
为了探索这个问题,该团队成为因美纳5-碱基测序的早期用户。该技术同时生成基因组变异和DNA甲基化信息,使研究人员无需进行单独检测即可研究遗传变化与基因调控之间的关系。

该团队使用16份新鲜冷冻的胶质母细胞瘤样本评估了5-碱基测序,并将其结果与MethylationEPIC v2芯片和牛津纳米孔测序进行了比较。胶质母细胞瘤提供了一个严苛的测试:这些肿瘤具有异质性,常含有坏死区域,且可能产生片段化的DNA。

尽管存在这些挑战,5-碱基测序仍产生了稳定的产出,平均基因组覆盖度达56×。在研究人员的一对一评估中,它似乎提供了最准确、最均匀的组合基因组和表观基因组分析,同时甲基化测量结果与EPIC v2芯片结果表现出高度一致性。

"这里最重要的是可重复性、可扩展性和数据准确性,"Bińkowski表示,"目前,从我的角度来看,5-碱基似乎是组合基因组和表观基因组分析最有效的技术。"

同时生成这两类信息的能力可以帮助研究人员提出此前需要分别研究的问题。单个数据集可能包含关于微小变异、结构变化、拷贝数变异、甲基化模式以及这些信号之间相互作用的信息。

对Wojdacz而言,这种融合代表了一次重大转变。

"现在我们开始使用一种技术,在一次实验中,以极具成本效益的方式,同时为你提供基因组和甲基组,"他说,"整个表观基因组和甲基组变得可及——不仅针对癌症,也针对其他组织——这只是时间问题。"


将可重复性融入工作流程
生成更多数据只是挑战的一部分。要将分子生物标志物从研究转化为可靠工具,研究人员还必须能够在不同实验室、计算环境和人群中重复结果。

什切青团队使用因美纳BioInsight Platform Core(前身为因美纳Connected Analytics)作为数据处理和分析框架的一部分。标准化的云端工作流程可以减少研究组使用不同软件版本、分析流程、计算基础设施或分析参数时引入的变异。

"我们可以在数十个不同的实验室生成数据,并由于工作流程的标准化而获得相同的结果,"Bińkowski表示,"从研究可重复性的角度来看,这绝对至关重要。"

这种一致性对机器学习尤为重要。模型必须在经过可比处理的数据上进行训练、测试和验证;否则,技术差异可能被误认为有意义的生物学信号。

该团队的工作目前仍聚焦于研究,在新的分类器或测序方法能够指导临床诊疗之前,还需要大量的验证和监管审查。尽管如此,研究人员仍展望这样一个未来:全面的分子分析可以帮助评估疾病风险、检测癌症、识别其起源和亚型、预测治疗反应,并监测残留病灶或复发。

对Wojdacz而言,令人兴奋的不仅是收集更多信息,而是通过可重复的过程生成这些信息,这些过程最终可能支持精准医学。

"我们正处于一场革命的边缘,"他说,"我们已经见证了标准化甲基化芯片数据如何改变癌症研究。如今,5-碱基测序首次同时提供标准化的甲基化和基因组测序数据。这为我们提供了一个强大的新视角,以理解疾病生物学并加速精准医学。"

近期文章

因美纳STEM学者项目帮助学生展望未来
因美纳STEM学者项目帮助学生展望未来
因美纳首席执行官Jacob Thaysen:迎接挑战,改善全球健康
因美纳首席执行官Jacob Thaysen:迎接挑战,改善全球健康
艾玛·巴普尔教授谈将全基因组测序引入临床研究
Video: 艾玛·巴普尔教授谈将全基因组测序引入临床研究