跳到主要內容
Lab Grimoire
TW EN
請喝咖啡
LLM 原理

九〇億個 DNA 字母改動先畫成地圖:AlphaGenome Atlas 在排什麼

DeepMind 的 AlphaGenome Atlas 把人類基因組約 90 億個可能單字母改動的分子效應預先算成地圖,並用 AVI 分數排序。它是研究用的路況圖,不是臨床診斷書。

作者
CY
發表
更新
九〇億個 DNA 字母改動先畫成地圖:AlphaGenome Atlas 在排什麼

改一個字母,實驗室測不完

想像一下,你要查一座塞車城市的超大路網。城市就像一盤棋,改一個字母就換一版。

人類基因組大約 30 億 個 DNA 字母,每個位置還能換另外三種,加起來接近 90 億 種單字母改動。

巷子一改,號誌全亂。測一種,就要重新鋪一條路。

Google DeepMind 在 2026 年 9 月釋出 AlphaGenome Atlas,把這些改動的分子效應預先算成約 1 PB 的地圖,並附上可排序的 AVI 分數。 先印好地圖與圖例,不叫你每次出門都重鋪路面。

地圖比每次重測路況划算

編碼區大概只佔 2%,比較像藍圖上的結構柱。其餘約 98% 比較像控制台,管著基因何時開工。

控制台決定何時開燈、開多大、剪接成哪種零件。多數性狀相關變體落這裡。你若只盯結構柱,會漏掉大半開關。

Coding DNA is the blueprint; non-coding DNA is the control panel

AlphaGenome 讀最長 1 Mb 的 DNA,並以單鹼基解析度預測表達、剪接、染色質可及性等多條分子軌道。

2026 年 Nature 寫到,變體效應評測 26 項裡有 25 項達到或超過當時最強外部模型。不過候選太多了,即時重算太貴。

Nature News 提到,模型釋出後約有 9000 人用過 API。全基因組仍吃不消。

於是 Atlas 在 hg38 上先算完,讓人改成查表。這份資料比 AlphaFold 結構庫還大 30 倍以上,也納入 biobank 觀察到的 1 億 級短插入缺失。

你打開的是公開路況板,不必自備測速槍。對小實驗室,這就像維修隊先看熱點圖。

模型、分數與真實案型

分子軌道一堆,所以你需要圖例。AVI 就是圖例。

團隊把多模態預測與 AlphaMissense 等特徵收成 AVI(AlphaGenome Variant Impact) 分數,再用 SHAP 拆回剪接、可及性、保育等項目。

技術報告寫,每個變體平均約有 27000 個實驗條件向的標量預測;訓練則用等位基因頻率 0.1% 上下當近似標籤。

分數高,值得先查。不是判決。

AVI score acts like a map legend for molecular impact

合作團隊已用它縮短尋針時間。

Broad 與 GREGoR 脈絡下,AVI 協助把未解罕見病候選排到 DNM1 相關變體。模型好比剪接路口接錯一樣,蛋白被異常拉長,實驗也對上方向。

Exeter 團隊在 54000 人以上的 UK Biobank 全基因組資料裡,依預測分子效應分組,多抓到約 22% 的非編碼關聯;只看 top 1% 最有衝擊的非編碼變體,與 BMI 相關區域可收到 19 個。

它如同先把塞車熱點標紅,再派維修隊去堆積路口。

From variant haystack to ranked hypothesis and lab check

流程是候選清單、AVI 排序、機制假說、實驗核對。 中間少不了你自己的表型與家系脈絡。

地圖能縮程。現場仍要維修。

地圖不是診斷書

你不該把 AVI 高分讀成已證實致病,研究限制比標題刺眼。

帶走一句:全基因組單字母改動可以被預先畫成研究用地圖,排序與分子圖例能加速假說。別帶走個人化基因報告或用藥依據。

官方寫明未通過臨床驗證;AVI 的頻率標籤是近似;訓練資料在細胞類型與某些 RNA 類型上仍有缺口,研究範圍仍有邊界;超遠端調控與跨分子通路的因果也還蓋不全。

商用與學術條款不同,可識別序列外送前還有同意問題。

下次看到「AI 讀懂基因組」的新聞,你知道嗎?它給的常常是路況排序。你為什麼還要確認實驗是否把那條改道封街驗證過?

常見問題

AlphaGenome Atlas 跟 AlphaGenome 模型差在哪?

AlphaGenome 是讀 DNA 序列、預測多種分子軌道的 AI 模型。Atlas 是把模型在人類參考基因組上預先算好的變體效應資料庫,附 AVI 分數與圖形介面,讓你比較像查地圖,而不是每次都重新跑完整推論。

AVI 分數高是否就代表這個變異會致病?

不是。AVI 是把多種分子預測與部分蛋白、保育特徵收成可排序的分數,訓練時用頻率門檻當近似標籤。它適合排出「值得先查」的候選,不能當臨床診斷或個人報告結論。致病與否仍要看家系、表型與實驗,也要記得模型仍有限制與研究範圍邊界。

一般研究者現在能怎麼用?有沒有臨床用途?

學術研究可經官方 portal 或 API 查非商用資源,商用另走雲端授權。官方與報導都寫明:未通過臨床驗證,不可替代專業醫療判斷。可識別的臨床序列送外前,還要處理同意與資料契約。

覺得這篇有幫助?

追蹤以收到新的 AI × 生醫研究筆記:

或請我喝杯咖啡,讓新內容持續產出。

☕ 請我喝杯咖啡