DeepMind 把 90 亿个 DNA 变体全部预计算好了,以后查变体不用再自己跑模型了
直接说结论:DeepMind 把 AlphaGenome 模型跑了一遍全基因组所有可能的单碱基替换(共 90 亿个),把结果做成了 AlphaGenome Atlas 数据库。这意味着生物研究员以后不需要自己写代码、不需要申请高性能算力去跑模型,直接在网页端查某个变体对基因表达的影响就行,而且现在给每个变体配了一个单一数值的冲击分(impact score),一眼就能看出这个变异是不是有意义。
为什么这个 Atlas 数据库比直接用 AlphaGenome 模型有用
之前 2025 年 AlphaGenome 发布时,虽然是公开非商业使用,但有个巨大的坑:它太吃资源了。哪怕你拿到了模型,想要测试某个特定的 DNA 变体,你得自己写脚本、配置环境,然后面对极其缓慢的推理速度。对于大多数没接触过深度学习的基因组学研究员来说,这几乎是不可逾越的门槛。
这次出的 Atlas 实际上是一个一个巨大的预计算结果库。人类基因组大概 30 亿个碱基对,每个位置有 3 种可能的替换,所以总共 90 亿个变体。DeepMind 直接把这 90 亿个结果全算出来存好了,数据集总量达到了 1 PB。
这种做法解决了两个核心痛点:
1. 算力门槛:不用再为了跑个预测去求资源,直接查表。
2. 效率浪费:避免全球成千上万个实验室在重复计算同一个变体,纯属浪费电。
实际使用时需要警惕的局限性
虽然 90 亿个变体听起来很全,但如果你打算用它来指导临床或实验,得注意这两个技术缺陷,否则很容易被误导:
- 视野范围限制(1M bp): AlphaGenome 每次预测参考的 DNA 序列长度是 100 万个碱基对。但在生物学上,很多增强子(enhancers)对基因的调控距离极远,可能会超过这个 1M 的范围。这意味着,如果某个变体是通过超远距离影响基因的,这个模型大概率预测不准。
- 单点 vs 多点: Atlas 记录的是单字母替换(single-nucleotide substitutions)。但现实中很多疾病是多个基因变体共同作用的结果,这种单一变体的预测分数不能直接等同于致病性。
怎么判断这个预测结果靠不靠谱
这次更新最实用的是那个 impact score(冲击分)。以前你跑模型可能得到一堆复杂的表达量变化数据,现在它直接给你一个分值。
如果你在查某个变体时,发现这个分数很低,那么大概率这个变异是中性的,可以直接在筛选实验样本时把它剔除掉。如果你发现分数很高,那么这个点值得进实验室做湿实验验证。它不是最终结论,而是一个高效的过滤筛子。
成本与资源消耗的真实量级
虽然 DeepMind 没有公开具体的电费单,但从 1 PB 的数据集量级和 90 亿次预测来看,这绝对不是普通公司能随随便便跑出来的。内部提到为了在合理时间内完成这个 Atlas,他们的计算速度提升了 80 倍。
对于普通研究者,目前的获取方式是:
- 非商业研究: 免费使用。
- 商业用途: 需要单独申请授权。
总结来看,AlphaGenome Atlas 把一个「极高门槛的 AI 工具」变成了一个「低门槛的查询数据库」。如果你在做基因变异分析,现在不需要去折腾 Python 环境和 GPU 驱动了,直接去查分值就行。

太爽了,我上次用那个 impact score 筛突变,直接把 200 个候选给砍到 3 个,省得在实验室里浪费试剂了。
这筛选率也太离谱了,你用的是哪个版本的 score?