结构预测的进步并没有让实验消失,而是把问题推向了数据分布、置信度解释和长尾蛋白。

论文里的高分不等于所有蛋白都可靠

评测集通常经过严格筛选。阅读结果时,需要同时看序列长度、同源信息、无序区域以及训练集与测试集之间的时间切分。

结构预测可视化

复现清单

  1. 锁定数据库版本和随机种子。
  2. 记录 GPU 型号、显存与推理批大小。
  3. 把置信度分数与真实实验结构分开讨论。

$$\mathrm{pLDDT} = \mathbb{E}[\text{local accuracy}]$$

真正困难的不是跑出一个结构,而是知道什么时候不该相信它。