CASP14 到底量了什麼
總覽說 AlphaFold2 被接受是因為 CASP。這篇把那句話底下的測量攤開:r.m.s.d.95 是什麼、論文自己領頭的兩個數字、它們領先其他方法多少,以及信賴區間唯一不會告訴你的那件事。
「與實驗結構相當」是所有人都會引的那句話1。這句話承擔了很多,值得知道到底是什麼東西被放上秤,才換到它。
CASP 把答案藏起來:已經解出但尚未公開的結構,只發布序列,期限內收預測,截止後才對答案2。所以下面這組比較不是某個實驗室自己挑的基準測試,是 87 個參賽者都沒看過的蛋白質 domain,由別人評分。
單位:r.m.s.d.95
均方根偏差是把你的結構和真實結構疊合之後,原子之間的平均距離,單位是埃(Å)。越小越好。至於這個尺度有多小,論文自己給了一把尺:一個碳原子的寬度大約是 1.4 Å1。所以中位誤差落在 1 Å 附近,不是「整體來說很接近」——是比一個原子還小。
那個 95 有意義。r.m.s.d.95 是在 95% 殘基覆蓋率下算的偏差——平均之前先丟掉最差的 5% 殘基。蛋白質有鬆散的尾巴,單一段無序的 loop 就能主導整個 r.m.s.d.,讓一個其實摺對了的結構看起來很糟。切掉尾巴,量的才是模型,不是那段無序。
這也代表 0.96 Å 不等於「每個原子都在 1 Å 以內」,而是「把最差的二十分之一擱在一旁之後,典型的那個原子是」。
論文領頭的兩個數字
兩個都是 CASP14 domain 集合上的中位數,附 95% 信賴區間,對手是參賽方法中的次佳者1。
Backbone
AlphaFold20.960.85–1.16次佳方法2.82.7–4.0All-atom
AlphaFold21.51.2–1.6次佳方法3.53.1–4.201.22.43.64.8Å · lower is better
這個形狀裡有兩件事,是那句引言帶不出來的。
差距不是漸進的。 主鏈準確度的中位數是 0.96 Å 對 2.8 Å。那不是同一個級別裡比較好的模型,那是換了一個級別——這也是為什麼整個領域的反應是改變工作方式,而不是多引一篇文獻。
兩組區間沒有碰到。 AlphaFold 的主鏈區間是 0.85–1.16 Å,次佳方法是 2.7–4.0 Å。無論 87 個 domain 之間的抽樣雜訊有多大,兩者不相交。誤差線跟對照重疊的結果是一個論點;這個不是。
信賴區間不會告訴你的事
信賴區間描述的是「被測量的那個集合之內」的抽樣變異。它完全不談那個集合選得對不對。
這就是為什麼載重的是 CASP14 這個場合,不是那個數字。同樣的 0.96 Å,如果算在模型訓練時看過的結構上,毫無意義——而且在這張圖上會長得一模一樣。這種事在機器學習進入科學研究後有多常發生,正是 Kapoor 與 Narayanan 跨 17 個領域、329 篇受影響論文所整理的5:沒有東西會壞掉,數字只是變好看。
CASP 是對這件事的防線,而且是一條社會性的防線,不是統計上的——一個期限、一份還沒公開的答案,以及一個不是你的評分者。
區間量的是模型。場合量的是這個測量到底算不算數。
這篇細看略過了什麼
論文報告的遠不只這兩個中位數。對其餘 145 個參賽項目的逐題散佈、顯示哪些架構元件真正撐起結果的消融實驗、recycling 的行為、依 MSA 深度切分的準確度——都在論文裡,這裡一張都沒重畫。這一頁只拿兩個頭條數字問它們是什麼意思,這比評論整篇工作窄得多。
有一個流傳很廣的數字是刻意不在這裡的:CASP14 的 GDT_TS 中位數 92.4,幾乎每個講這件事的地方都會引,包括這一頁所屬的那篇總覽的初稿。它不是論文領頭的那個數字,而且無法回溯到這篇論文自己的正文,所以不列。
同樣不在這裡的,是任何關於 AlphaFold 在 CASP14 以外表現的宣稱。論文對近期 PDB 結構另有處理,而後續的資料庫覆蓋超過兩億一千四百萬條序列4,每個殘基的可信度差異極大。前一代的 CASP13 結果可以當作「這件事推進得多快」的基準3,但那是另一個集合上的另一個測量。
回到總覽
總覽的主張是:一個領域會動起來,需要既有資料、一個事前藏起答案的評估制度,以及一條不經過模型的驗證路徑。上面那張圖,是第二個條件在 2020 年、在 87 個 domain 上做了一次它該做的事——也是為什麼這個系列的第一句話講的是評估制度,不是架構。
參考文獻
- [1]Jumper, J., Evans, R., Pritzel, A. et al. (2021). Highly accurate protein structure prediction with AlphaFold. Nature 596, 583–589. doi:10.1038/s41586-021-03819-2
- [2]Moult, J., Pedersen, J. T., Judson, R. & Fidelis, K. (1995). A large-scale experiment to assess protein structure prediction methods. Proteins: Structure, Function, and Bioinformatics 23(3). doi:10.1002/prot.340230303
- [3]Senior, A. W., Evans, R., Jumper, J. et al. (2020). Improved protein structure prediction using potentials from deep learning. Nature 577, 706–710. doi:10.1038/s41586-019-1923-7
- [4]Varadi, M., Bertoni, D., Magana, P. et al. (2024). AlphaFold Protein Structure Database in 2024: providing structure coverage for over 214 million protein sequences. Nucleic Acids Research 52(D1), D368–D375. doi:10.1093/nar/gkad1011
- [5]Kapoor, S. & Narayanan, A. (2023). Leakage and the reproducibility crisis in machine-learning-based science. Patterns 4(9), 100804. doi:10.1016/j.patter.2023.100804