α3 Paper / Motion
原始 PDF ↗

NATURE · 2024 · INTERACTIVE READING

AlphaFold 3把整个分子世界,放进同一个预测框架。

AlphaFold 2 大幅推进了从序列预测蛋白质结构。AlphaFold 3 把问题扩展为: 蛋白、DNA、RNA、配体、离子和修饰残基相遇时,所有原子会怎样共同排列?

开始解读 预计阅读 12 分钟
多种生物分子汇聚成复合物 蛋白质、核酸与小分子沿轨道移动并形成一个联合结构。
PROTEIN
RNA / DNA
LIGAND

ONE JOINT STRUCTURE

24正文 PDF 页数
5张主图
1个统一框架
多类PDB 中多类分子与相互作用
01

THE QUESTION

从单体折叠到分子相遇

AF3 的真正跃迁,不只是“更准”。
而是把不同任务改写成同一个任务。

过去,蛋白折叠、分子对接、RNA 结构和抗体–抗原预测往往由不同工具处理。 AF3 选择了一条更激进的路线:把所有实体拆成统一的 token 与原子表示, 然后直接生成整个复合物的三维坐标。

蛋白质

氨基酸残基作为 token

DNA / RNA

核苷酸作为 token

小分子

重原子作为 token

离子与修饰

进入同一张关系图

02

THE MACHINE

从线索到坐标

四步看懂 AF3

点击模块查看它在整个推理链中的职责。

INPUT EMBEDDER PAIRFORMER × 48 DIFFUSION CONFIDENCE

STEP 01 / 04

先统一“语言”,再讨论结构

序列、配体、共价键信息、模板和 MSA 被编码为 single 与 pair 表示。小分子不再需要被硬塞进氨基酸专用框架。

  • 蛋白与核酸:残基级 token
  • 配体:重原子级 token
  • 原子级特征仍被保留,用于最后生成坐标

动手理解扩散

结构不是“一次算出”,而是从噪声里逐步雕出来。

左侧是随机原子坐标,右侧用 RNA 发卡结构表示成形后的几何。中间的流动箭头代表反复去噪;这是原理示意,不是 AF3 内部轨迹的逐帧复现。

从随机原子坐标到 RNA 发卡结构的去噪示意 左侧原子随机散布,中间箭头指向右侧形成碱基配对的 RNA 发卡结构。 随机原子坐标 反复去噪 RNA 发卡结构 概念示意 · 非真实轨迹
ORIGINAL FIGURE 2 Architecture & training
AlphaFold 3 论文图 2,展示 Pairformer、扩散模块和训练曲线

读图重点

a:Pairformer 让 pair 表示承担主要信息流;b:扩散模块在原子与 token 两个尺度间往返;c:训练时对同一结构生成多份加噪拷贝;d:不同交互类型在训练过程中逐步提升。

03

THE EVIDENCE

论文拿什么证明它有效?

不是一项 benchmark,
而是一组跨模态压力测试。

01 / LIGANDS

蛋白–配体

在 PoseBusters 集合上,AF3 对配体姿态的成功率显著超过 AutoDock Vina 与 RoseTTAFold All-Atom。

指标:pocket-aligned ligand RMSD < 2 Å
02 / NUCLEIC ACIDS

蛋白–核酸与 RNA

对蛋白–RNA、蛋白–DNA和 CASP15 RNA,统一模型仍能超过专用预测器。

指标:interface LDDT / nucleic-acid LDDT
03 / PROTEINS

复合物与抗体

蛋白–蛋白和抗体–抗原预测均改善;但抗体任务使用了远多于常规设置的采样。

常规:5 seeds × 5 diffusion samples;抗体:1,000 seeds
ORIGINAL FIGURE 1Cross-domain performance
AlphaFold 3 论文图 1,展示跨生物分子复合物的预测性能与整体架构
这张图怎样读?

上半部分不是在比较同一个统一指标:配体、核酸、修饰和蛋白任务使用各自适合的评价标准。因此,蓝色柱普遍更高说明“在各自任务上领先”,不能把不同分组的柱高直接横向解释成难度或绝对精度。

ORIGINAL FIGURE 3Predicted complexes
AlphaFold 3 论文图 3,多个预测复合物与实验结构对比

样例不是装饰

论文用具体复合物展示“统一”意味着什么。

同一个模型可以同时处理药物样小分子、DNA、RNA、糖基化、离子和大型蛋白复合物。真正的新能力,是减少为每类化学实体单独设计结构模块的需求。

但个别漂亮样例不能替代数据集统计;它们更适合说明能力边界,而不是估计总体成功率。

04

KNOWING WHEN TO TRUST

模型不仅给答案,也给“不确定性地图”

置信度不是正确性的证明,
但它能帮助你排序和筛选。

pLDDT

模型估计的局部原子准确度

PAE / PDE

对齐误差与距离矩阵误差的预测

Ranking score

多次采样后选择哪个候选

ORIGINAL FIGURE 4Confidence tracks accuracy
AlphaFold 3 论文图 4,模型置信度与实际准确度之间的关系
05

THE EDGES

一篇强论文,必须读它自己承认的失败

AF3 统一了任务,
没有统一现实。

ORIGINAL FIGURE 5Model limitations
AlphaFold 3 论文图 5,展示抗体预测、立体化学和构象覆盖的局限
01

立体化学错误

直接生成原子坐标带来自由度,也可能产生手性错误和原子碰撞。论文通过排序惩罚缓解,而不是从根本上消除。

02

幻觉与无序区域

模型可能为本来无序的区域“画出”有序结构;低 pLDDT 是警告,但不是完美检测器。

03

构象覆盖有限

重复扩散采样并不自动得到热力学权重正确的构象系综,常见状态仍可能被偏好。

04

采样换性能

抗体–抗原等困难任务使用大量 seeds 才达到最佳结果。准确度之外,还要看计算预算和筛选方式。

THE ONE-SCREEN TAKEAWAY

AF3 的创新,不是给 AF2 加一个配体模块。

统一表示Pairformer 关系推理原子级扩散置信度排序

它把结构预测重新定义为一个条件生成问题:给定分子身份与有限线索,生成联合三维坐标。这个重构扩大了适用范围,也把新的风险带到原子几何、构象多样性和采样解释上。

READ NEXT

继续深挖