Google DeepMind“ Alphagenome” |用于分析非编码区域的最新基因组AI

上次更新于2025-06-27 07:22

2025年6月25日,Google DeepMind宣布了一种新的基因组分析AI模型“ Alphagenome”。

字母型的DNA序列作为输入,最多可达100万个碱基对,并预测了基因调节中涉及的数千种分子特性。尽管传统的字母敏感针对编码蛋白质的2%区域,但字母元组解释了其余98%的非编码区域。

这些模型经过了从编码,GTEX,4D核心和Fantom5的公共财团获得的数百种人和小鼠细胞类型的数据训练。单个字母组模型的训练时间为4个小时,并以传统eNformer模型的计算预算一半实现。

在绩效评估中,在对单个DNA序列预测的24个评估中的22个评估中的22个评估中,结果比最高性能外部模型可比或更好,而在26个评估中,24个对突变调节效应预测的评估中有24个。目前可通过Alphagenome API获得字母肌元,用于非商业研究。纪念斯隆·凯特林癌症中心的卡勒布·拉罗(Caleb Lareau)博士和伦敦大学学院的马克·曼苏尔(Marc Mansour)教授表达了对这项研究的希望。

从: 字母组合:AI可以更好地理解基因组

[编辑部评论]

在基因组分析领域,宣布字母素是一个显着的技术突破。先前的AI模型受到序列长度和分辨率之间的权衡而限制,但是字母组合同时实现了两者,从而实现了全面的基因调节分析,这是以前不可能的。

特别重要的是对非编码区域的反应,该区域占基因组的98%。虽然传统的字母启示专门从事编码蛋白质的2%区域,但字母肌元具有创新性,因为它可以解释其余的被称为“暗物质”的区域。这个非编码区域包含许多与疾病相关的突变,这可以直接导致了解癌症和罕见疾病。

从技术角度来看,它的特征是结合卷积层和变压器的体系结构。这允许有效地处理短模式检测和远程相互作用。训练时间只有4个小时,并且能够用传统enformer模型的一半计算预算实现,这一事实也非常实用。

对医疗领域的影响是多种多样的。预计它将具有广泛的应用,包括提高稀有疾病的诊断准确性,鉴定癌症治疗中的遗传突变以及合成生物学中的人工DNA设计。 T细胞急性淋巴细胞白血病的证明表明,非编码突变可以准确预测非编码突变对癌基因TAL1激活的影响。

预测剪接错误的能力也是一个开创性的进步。尽管许多罕见的疾病,例如脊柱肌肉萎缩和囊性纤维化是由RNA剪接中的错误引起的,但第一次,Alphagenome能够明确模拟剪接连接的位置和表达水平。

另一方面,当前的限制也清楚地显示了。预测超过100,000个碱基对的超长距离调节器的影响并提高细胞组织特异性模式的准确性将是一个挑战。此外,这是一个重要的局限性,即不打算直接应用于单个基因组预测或临床诊断,并且仅限于研究目的。

监管方面包括仔细的方法来提供仅限于非商业研究的API。考虑到技术和社会影响的成熟度,这可以评估为负责任的部署政策。可以预期,将来的完整版本将有更多的广泛使用。

从长期的角度来看,字母型有潜力从根本上改变人类的遗传理解。结合基因组编辑技术,开发更精确的治疗方法并建立预防遗传疾病的策略可能是实际的。但是,这些技术进步也提高了对道德讨论和社会共识形成的需求,与技术发展并行的社会准备至关重要。

[词汇表]

字母内组
Google DeepMind开发的DNA序列分析AI模型。它可以接收长达100万个碱基对的长DNA序列作为输入,并预测基因调节中涉及的数千种分子特性。

非编码区域
一个不编码蛋白质的区域,占基因组的98%。它在调节基因活性中具有重要作用,并包括许多与疾病相关的突变。

基对
组成DNA的基本单元。将四种类型的碱基配对在一起:A(腺嘌呤),T(胸腺素),G(鸟嘌呤)和C(胞嘧啶)。

RNA剪接
去除RNA分子的一部分并结合其余部分的过程。在此过程中的错误会导致罕见的疾病,例如脊柱肌肉萎缩和囊性纤维化。

变压器
自然语言处理中使用的AI架构。字母组合用于传达阵列内所有位置的信息。

T细胞急性リンパ芽球性白血病(T-ALL)
一种血液癌。在字母组的实验实验中,我们成功地预测了TAL1基因激活的机理。

内容丰富
Google DeepMind先前开发的基因组学模型。字母组合基于此模型。

[参考链接]

Google Deepmind(外部)
Google的子公司进行了人工智能研究。他正在开发创新的AI模型,例如Alphafold和Alphagenome。

编码(集成的DNA元素)(外部)
一个国际研究项目旨在全面阐明人类基因组的功能元素。

GTEX门户(外部)
一个阐明人类遗传多态性对每个组织基因表达的影响的项目的门户网站。

4D核心数据门户(外部)
研究3D结构和染色体的时间变化(4D)项目的数据存储库。

[参考文章]

DeepMind的新字母AI在我们的DNA中解决了“暗物质”(外部)
《自然杂志》的文章。本文详细说明了字母组合是一种旨在解决非编码序列的奥秘的工具。

Google的新AI将帮助研究人员了解我们的基因的工作方式(外部)
麻省理工学院技术评论的文章。解释了字母组合如何预测DNA特征变化对基因活性的影响。

DeepMind启动字母型,以预测DNA突变如何影响基因(外部)
Siliconangle文章。引入字母浓度作为预测DNA突变对基因的影响的工具。

[编辑部门的后期笔记]

宣布字母内组后,您看到了什么可能性?作为我们的编辑部门,我们认为这项技术将不仅仅是一种研究工具,并且会根据未来的个体遗传特征实现定制医疗服务。特别是,分析98%的非编码区域的能力可以大大提高以前神秘的遗传机制的阐明。另一方面,我也对提高遗传信息分析的准确性而产生的新道德问题感到好奇。您认为这项技术会想到什么样的未来?请让我们知道您在社交媒体上的诚实意见。

阅读有关Innovatopia的更多医疗保健技术新闻
阅读有关Innovatopia的更多生物技术新闻
阅读有关Innovatopia的更多AI(人工智能)新闻