“大多数单碱基改变不会造成什么影响,但少数意义非凡。”——谷歌AI基因组系统研究团队在论文摘要中写道。
在人类约30亿个碱基对的基因组中,单个碱基的改变可能完全无害,也可能引发致命疾病。如今,谷歌的人工智能系统试图评估每一个这样的改变——就像给整个基因组的所有“单词拼写错误”做一次穷举式检查。
据Ars Technica报道,谷歌研究团队近日发布了一款全新的AI基因组系统,其核心能力是系统化地评估人类基因组中每一种可能的单碱基改变。该系统将遗传变异的预测维度,从已知致病突变扩展到了所有理论上可发生的场景。
这些被评估的“单碱基改变”也被称作点突变。在遗传过程中,碱基的替换大部分位于非关键位置,或属于不改变氨基酸的“沉默突变”,因此不会带来实质性表型影响。但另一些则会扰乱蛋白质结构、基因表达或剪接过程,与遗传病、癌症等密切相关。如何快速找到那些“关键少数”,一直是基因组学的重要难题。
从“已知数据库”到“全变异预测”
传统方法高度依赖ClinVar等既有数据库,只能判断已被临床注释过的变异位点,面对意义不明确的变异(VUS)或新发突变时做得十分有限。谷歌的新系统基于深度学习架构,从进化保守性、人群基因频率、表达调控图谱和功能基因组数据中学习规律,对编码区和非编码区的每处单碱基改变进行功能影响打分。
研究团队将基因组比作一种“语言”,单碱基改变相当于改变语句中的某个字母或标点。系统会根据整个基因座的上下文来判断这种改变是否会破坏“句子”的语义。例如,在一个增强子区域,单碱基改变可能减少转录因子的结合,导致下游基因表达异常;在外显子剪接位点,单个碱基变化则可能造成剪接错误,进而扰乱蛋白质序列。
从编码区到“暗物质”基因组的跨越
此前AI致病突变预测的代表成果——AlphaMissense,主要集中在蛋白质编码区的错义突变,为数千万个可能的蛋白改变提供了参考。但非编码区约占基因组的98%,对基因表达的调控至关重要,一直被称作基因组“暗物质”。谷歌这套新系统最大的亮点,就是将单碱基评估能力扩展到非编码区,从而实现了真正意义上的全基因组覆盖。
这意味着,一个位于基因“开关”处的变异,即使它不改变任何蛋白质的氨基酸,也可能被系统标注为高风险位点;与之相对,一个极其罕见的同义突变也可能获得负面评分。这种更全面的图景,对罕见病分子诊断、产前遗传咨询和药物靶点筛选有直接帮助。
预测之外:验证与技术边界
研究人员同时指出,AI预测始终是“提出假设”而非“给出结论”。单碱基改变的影响往往具有细胞类型特异性,也可能被其他变异或环境因素修饰;训练数据依赖已有的生物学注释,人类对其中的大量知识仍然有限。因此,评分结果只是提供优先级,最终仍需湿实验和临床队列验证。
编者按:这套系统的意义不仅在于它把已知的变异数据库变成了高分辨率预测图,更在于它体现了由AI驱动的“科学假设工厂”已经进入精细尺度——从解剖一颗恒星,到模拟所有拼写错误。对生命科学而言,这样的工具让研究者得以在更广阔的变异空间中快速定位风险;但我们也应认识到,突变并非孤立事件,遗传背景与生命体的变数远比一个“危害分数”复杂。AI越强大,人类对验证的要求就越不能松懈。
目前,该系统仍处于研究阶段,其实际临床价值有待更大规模的患者数据来检验。可以预见的是,在AI与基因组医学结合的道路上,谷歌又迈出了充满想象力的一步。
本文编译自Ars Technica
© 2026 Winzheng.com 赢政天下 | 转载请注明来源并附原文链接