2×1DIFFUSION × FORCE FIELD
JCTC ↗下载 v3 ↓

JOURNAL OF CHEMICAL THEORY AND COMPUTATION · 2023 · ARTS, SATORRAS ET AL.

一个扩散模型,为什么能变成力场?因为在平衡态里,概率密度的上坡方向,就是自由能的下坡方向。

这篇论文把同一个去噪网络用了两次:完整反向扩散产生彼此独立的平衡构象;低噪声处的 score 则被换算成粗粒化平均力,放进 Langevin 方程生成连续轨迹。真正的核心不是网络结构,而是一条从玻尔兹曼分布到力的公式链。

概率地形同时产生生成方向和力场上方是三个蛋白构象样本,中间是概率密度与自由能地形,下方从 score 分叉到独立采样和 Langevin 动力学。 score = ∇ log q高概率 ⇄ 低自由能 完整反向扩散noise → i.i.d. equilibrium samples生成器 固定低噪声 scoreforce → Langevin trajectory力场

ORIGINAL EXPLANATORY GRAPHIC · NOT A PAPER FIGURE

0训练所需原子力标签
2同一网络的用途
5–56粗粒化 beads
6测试分子系统
00

THE WHOLE PAPER IN ONE CHAIN

先建立全局地图

五个等号,串起整篇论文。

如果训练构象来自温度为 T 的平衡分布,那么结构出现得越频繁,自由能越低。对 log density 求坐标梯度,就得到指向高概率区域的 score;乘上热能尺度 kBT,它正是平均力。

平衡分布q(z) ∝ exp[−V(z)/(kBT)]构象 z 出现的概率
自由能V(z) = −kBT log q(z) + C概率的负对数
平均力F(z) = kBT ∇z log q(z)概率上坡就是能量下坡
扩散 scorekBT sθ(z,i)低噪声时逼近真实 score
=
DFF−kBT εθ(z,i) / √(1−ᾱi)从 noise predictor 直接读力
01

FROM ATOMS TO A DISTRIBUTION

粗粒化真正要保留什么

少掉的原子没有消失,它们被积分进平均力。

全原子坐标 x 有 3N 个自由度;粗粒化坐标 z = Ξx 只保留 3n 个自由度。论文对每个残基只保留一个 Cα bead。任务不是复原每个被删原子,而是让保留下来的 beads 仍访问正确的平衡构象分布。

拖动粗粒化程度

24 atoms → 8 beads

每个 bead 代表一组被积分掉的快速自由度。自由度变少使模拟更便宜,却让有效相互作用变成复杂的多体平均力。

CORE FORMULA 1

粗粒化边缘分布

把所有会映射到同一个 z 的原子构象权重加起来。

q(z) = ∫ exp[−U(x)/(kBT)] δ(Ξx−z) dx∫ exp[−U(x′)/(kBT)] dx′
x所有原子的三维坐标
z = Ξx保留下来的 CG 坐标
U(x)全原子势能
δ(Ξx−z)只收集映射到该 z 的构象
展开:从边缘分布到平均力

第一步,把分母记为与 z 无关的配分函数 Z。第二步定义势均力,也就是粗粒化自由能:

V(z) = −kBT log q(z) + C

第三步对坐标取负梯度。常数消失:

F(z) = −∇zV(z) = kBT ∇zlog q(z)

因此只要能学到平衡密度的 log-gradient,就能得到热力学一致的平均力。困难在于上面的高维积分通常不可计算。

02

WHY SCORE IS FORCE

密度不是力,密度的梯度才是

score 告诉你“往哪走,概率增长最快”。

score 定义为 s(z) = ∇ log q(z)。它没有告诉你概率的绝对大小,却给出每个坐标方向上的局部斜率。玻尔兹曼关系把这个无量纲方向乘上 kBT,变成具有能量每长度单位的力。

构象坐标 zq(z)

移动当前构象

概率 q0.42
score ∂ log q/∂z+1.36
力方向向右 →

在概率峰顶,score 为零,对应平均力平衡;在概率谷底两侧,score 指向不同的高概率盆地。

log 的作用

把乘法权重变成可加能量。

玻尔兹曼概率是指数形式;取负对数后得到自由能,求梯度后归一化常数自动消失。

score 的限制

它只在数据覆盖处可信。

训练数据没有访问过的构象区,网络仍会输出向量,但没有证据保证这是正确的物理力。

“平均”的含义

被删除自由度留下了熵。

粗粒化力不是简单删掉原子后的真空力,而是条件于 z 后对所有微观构象求平均产生的势均力。

03

THE DIFFUSION MODEL

先忘掉动力学,只学习静态分布

训练数据可以打乱,因为模型首先学的是平衡密度。

这里的扩散时间 i 仍然只是噪声等级,不是分子动力学时间。作者把平衡 MD 轨迹投影到 CG 坐标后打乱成构象样本;DDPM 学习怎样把被扰动的构象拉回这些样本形成的分布。

扩散索引 i干净结构 → 高斯噪声

训练用的人工破坏过程;决定 score 的平滑尺度。

动力学时间 t构象 → 下一时刻构象

Langevin 方程中的真实积分变量;产生相关轨迹。

改变噪声等级 i

低噪声:保留局部力

噪声越大,模型看到的分布越平滑。完整反向扩散需要跨过所有等级;提取力场时只固定选择其中一个等级。

zᵢ = √ᾱᵢ z₀ + √(1−ᾱᵢ) ε
CORE FORMULA 2

闭式加噪与训练目标

无需真的逐步加噪;任意等级的带噪构象可以一步采样。

zi = √ᾱi z0 + √(1−ᾱi) ε, ε ∼ 𝒩(0,I)
noise = 𝔼 ‖ ε − εθ(zi, i) ‖2

网络不是直接预测能量或力,而是预测“这次把干净构象推到 zi 的高斯噪声”。论文采用通常更实用的等权重版本 Ki = 1。

04

THE CENTRAL DERIVATION

从预测噪声到预测力

最关键的负号,来自高斯分布的导数。

论文真正的创新论证集中在下面五步。前两步是 DDPM;第三步是 denoising score matching;第四步调用平衡统计力学;第五步才得到 DFF。

STEP 01 / 05

带噪构象围绕缩放后的干净构象呈高斯分布。

CORE FORMULA 3

Denoising Force Field

训练时没有使用原子力标签,推理时却可以从 noise predictor 读取平均力。

FDFF(z;i) = − kBT√(1−ᾱi) εθ*(z,i)
θ* 模型已充分训练低噪声 qi ≈ q0平衡样本 q0 为 Boltzmann 边缘分布覆盖域内 不保证外推力正确
完整推导:不跳过中间三行

1. 条件分布是均值 μ = √ᾱiz0、方差 σ² = 1−ᾱi 的高斯:

log q(zi|z0) = C − ‖zi−√ᾱiz0‖² / [2(1−ᾱi)]

2. 对 zi 求梯度。平方项的导数给出 2(zi−μ),与分母的 2 抵消:

zᵢ log q(zi|z0) = −(zi−√ᾱiz0) / (1−ᾱi)

3. 由加噪式,括号内正好等于 √(1−ᾱi)ε:

zᵢ log q(zi|z0) = −ε / √(1−ᾱi)

4. 因而预测 ε 等价于预测条件 score。平方误差的最优解不是记住某一个 z0,而是对所有可能产生当前 zi 的干净构象取后验平均:

εθ*(zi,i) = 𝔼[ε | zi]

把条件 score 也按同一个后验平均,利用 Fisher identity,就得到带噪边缘分布 qi 的 score:

∇ log qi(zi) = 𝔼[∇ log q(zi|z0) | zi] = −εθ*(zi,i)/√(1−ᾱi)

5. 当 i 足够小,qi 只比数据分布稍微平滑,因此 qi ≈ q0。再用 F = kBT∇log q,得到 DFF。

05

TWO OUTPUTS FROM ONE NETWORK

“Two for One” 到底是哪两个

一个学密度,一个沿密度运动。

两种使用方式共享 εθ,但算法和产物完全不同。第一种跨越所有扩散等级,输出没有物理时间顺序的独立样本;第二种固定一个低噪声等级,只把网络当作每一步动力学所需的力函数。

noisei=Li≈L/2

    06

    FROM FORCE TO TRAJECTORY

    扩散时间终于退出舞台

    真正推进构象的是 Langevin 方程。

    提取 DFF 后,作者不再运行完整反向扩散,而是把 FDFF 当作普通粗粒化力场,使用质量、摩擦和热噪声推进 CG beads。这样得到的相邻帧才具有动力学相关性。

    CORE FORMULA 4

    欠阻尼 Langevin 方程

    确定性平均力、摩擦耗散与随机热碰撞共同决定轨迹。

    M d²z/dt² = FDFF(z) − γM dz/dt + √(2MγkBT) w(t)
    M z̈惯性

    粗粒化 beads 的加速度。

    FDFF平均力

    来自扩散 score,而非力标签。

    −γM ż摩擦

    把动能耗散给未显式表示的环境。

    √(2MγkBT)w热噪声

    与摩擦配对,维持目标温度。

    DERIVATION ROOM

    为什么“扩散一步 + 去噪一步”近似 Brownian dynamics

    这是补充材料中最值得保留的推导,也直接回应生成时间与物理时间是否相同。

    展开四步推导

    1. 在第一个低噪声等级做一次前向扰动:

    z′ = √(1−β1) z + √β1 wa

    2. 再做一次去噪。把两次独立高斯噪声合并,并对很小的 β1 作一阶近似:

    zt+1 ≈ zt − √β1 εθ(zt,1) + √(2β1) w

    3. 过阻尼 Langevin 的 Euler–Maruyama 离散式为:

    zt+1 = zt + [Δt/(Mγ)]F(zt) + √[2kBTΔt/(Mγ)] w

    4. 代入 FDFF = −kBT εθ/√β1,两式在下面的尺度对应下相同:

    β1 = Δt · kBT/(Mγ)

    这不是说完整 DDPM 的所有噪声等级都等于真实 MD 时间。它只说明在低噪声、小步长和过阻尼近似下,局部 diffuse–denoise 更新与 Brownian 积分器具有相同形式。

    论文自己的限定

    2 fs 的 CG time step 不能直接解释为 2 fs 的全原子时间。

    粗粒化删除了快速自由度,也改变了摩擦和动力学尺度。论文比较状态转移结构与相对概率,但没有建立严格的 coarse-to-fine 时间映射。

    07

    PHYSICS BUILT INTO THE NETWORK

    不是任意 vector field 都能当力场

    生成样本看起来对,不代表长时间积分会稳定。

    作者让 graph transformer 输出一个标量,再对坐标求梯度得到 εθ。这保证最终 DFF 是保守力。补充实验显示,非保守模型对 i.i.d. 采样影响有限,却会显著破坏连续模拟。

    01

    保守性

    εθ(z,i) = ∇z Eθ(z,i)

    力来自标量势的梯度,闭合路径总功为零。Chignolin 模拟 TIC JS 从非保守的 0.3216 降到 0.0335。

    02

    平移不变

    input: za − zb

    整体搬动蛋白不改变内部能量,也不改变相对力。

    03

    旋转等变

    F(Rz) ≈ R F(z)

    训练时用旋转增强近似 SO(3) 等变;补充材料报告验证误差小于 10−6

    04

    不允许镜像

    SO(3), not O(3)

    镜像会改变蛋白手性,因此不能把反射当作合法对称操作。

    08

    WHAT THE EXPERIMENTS ESTABLISH

    从五个原子到五十六个 beads

    论文检验的是分布、全局接触和状态转移,不只是单张结构。

    Alanine dipeptide 用四折交叉验证和 10K–500K 训练样本检验数据效率;五种 fast folders 用慢模态、成对距离、RMSD 自由能、接触图和状态转移概率检验更复杂的平衡与动力学。

    ALA25backbone beads
    Chignolin10residues
    Trp-cage20residues
    BBA28residues
    Villin35residues
    Protein G56largest test

    切换论文 Table 1 指标

    JS divergence,越低越好

    Figure 2

    Alanine:低数据区优势最明显。

    DFF simulation 明显优于 CGNet 和 Flow-CGNet;DFF i.i.d. 接近训练集与测试集之间的参考下界。四次运行给出 95% 置信区间。

    Figures 3–4

    全局接触比局部外观更重要。

    DFF 在非对角 contact map 区域更接近参考 MD,说明它更好地捕捉远序列残基之间的全局结构;BBA 的 β-sheet 仍较困难。

    Figure 5 + Table 2

    轨迹出现折叠与解折叠事件。

    DFF 的状态转移概率 JS 在四个 fast folders 上低于 Flow-CGNet。不过 CG 时间不能直接映射为全原子时间,因此这支持动力学结构,不等于精确动力学速率。

    09

    CRITICAL READING

    最强结论与最弱结论

    它可靠地学到了平衡平均力,但没有证明真实动力学时间被恢复。

    论文最扎实的贡献是从仅含构象的平衡数据中训练 conservative score,并把它变成可稳定积分的 CG force field。最需要收窄的是“保留动力学”这句话:作者复现了慢状态和转移结构,却明确承认 CG 与全原子时间没有直接映射。

    证据强

    一个网络确实完成两个任务。

    代码提供完整 DDPM sampling 和 Langevin sampling,预训练模型覆盖六个系统;平衡分布指标在多个分子和多个数据规模上优于相应 baseline。

    条件成立

    score 近似的是被噪声平滑的密度。

    噪声等级太低时估计方差大,太高时自由能盆地被抹平。最佳 i 依赖蛋白和网络容量,需要用模拟交叉验证。

    未解决

    训练不需要力,不等于训练便宜。

    仍需要足够覆盖折叠与解折叠盆地的长时间全原子 MD 构象。缺失状态不会凭空从 score matching 中恢复。

    泛化边界

    模型基本按系统单独训练。

    最大示例为 56-residue Protein G;论文没有建立跨蛋白、跨温度或跨粗粒化映射的统一可转移力场。

    比较限制

    baseline 代表 2022 年特定 flow-CG 管线。

    文中的“Flow-matching”是 augmented normalizing flow 加 teacher–student 力场蒸馏,不是后来流行的 probability-path ODE Flow Matching。

    决定性实验

    留出一个亚稳态,而不是随机留出帧。

    按构象盆地划分训练和测试,检查模型能否发现未见盆地;再用独立长轨迹测首次通过时间与详细平衡。这会区分插值复现和真正的能量地形泛化。

    10

    WHAT CAME AFTER

    到 2026 年怎样看这篇论文

    后续工作没有否定这条桥,而是在两端补信息。

    2026 年的后续同行评议工作把原子力监督与 denoising 结合,在 Trp-cage 和 NTL9 上把数据需求最多降低两个数量级。这反过来说明纯构象 DFF 的关键短板正是最低噪声处的力估计;构象密度和真实力标签可以互补。

    2023 · THIS PAPER

    只用平衡构象

    证明 score 可以读作平均力;一个模型兼任生成器和 DFF。

    2026 · NATURE COMMUNICATIONS

    构象 + 原子力 + 噪声

    把 force matching 与 denoising 统一,报告最多 100× 数据效率提升。

    OPEN QUESTION

    跨系统与真实时间

    可转移力场、未见亚稳态、动力学时间标定仍没有被这条路线彻底解决。

    11

    SOURCES & REPRODUCTION

    原文、补充材料、代码和后续证据

    公式以 arXiv v3 与正式 JCTC 版本交叉核对。

    arXiv v3 把主文和补充推导合在 32 页中,最适合阅读;正式论文为 JCTC 19(18), 6151–6159。本站图形均为基于论文公式和数据的原创解释图,不是论文图版复制。