返回
查看原链接原链接
Bilibili19分49秒 · —

拉格朗日神经网络(Lagrangian Neural Network):将欧拉–拉格朗日结构嵌入神经网络以建模力学系统

拉格朗日神经网络(Lagrangian Neural Network):将欧拉–拉格朗日结构嵌入神经网络以建模力学系统

核心结论:拉格朗日神经网络并非直接学习系统状态的时间导数,而是通过一个中间函数(拉格朗日量 L)结合自动微分与自定义损失函数,迫使神经网络满足欧拉–拉格朗日方程(Euler-Lagrange equations),从而在建模力学系统(如双摆)时有效保持系统的能量守恒与对称性,并且相比哈密顿神经网络,它不要求提前得知正则共轭坐标。


核心要点

  • 视频介绍了一种名为拉格朗日神经网络(Lagrangian Neural Network,简称 LNN)的神经网络架构,其核心思想是将经典力学中的欧拉–拉格朗日方程结构“烘焙”进神经网络的架构与损失函数中。
  • LNN 是哈密顿神经网络(Hamiltonian Neural Network,HNN)的一种延伸或变体,但具有若干关键优势,尤其是在处理难以求得正则共轭变量的系统时更为灵活。
  • 其核心机制是:神经网络学习一个中间拉格朗日函数 L,再利用自动微分计算偏导数,并通过损失函数项强制欧拉–拉格朗日方程得到满足——即学习一个可以使欧拉–拉格朗日方程成立的拉格朗日量。
  • 与朴素的直接学习微分方程的方法相比,LNN 能更好地保存已知的系统对称性与守恒量(如能量),同时适用于像双摆(double pendulum)这类难以用传统数值积分方法精确求解的混沌系统。
  • 视频还明确指出,LNN 本质上是一种带有特定结构的神经微分方程(neural ODE)变体,其实施代码并不复杂,在 JAX 中可实现为几行代码。

详细解析

1. 背景:经典力学中的两种等价视角

在描述力学系统(例如牛顿经典力学范围内的系统)时,存在两种本质上等价的理论框架:

  • 拉格朗日视角(Lagrangian perspective):通过写出系统的拉格朗日量 L(通常为动能减势能)并应用欧拉–拉格朗日方程,从变分原理的角度推导运动方程。
  • 哈密顿视角(Hamiltonian perspective):通过哈密顿量 H 和哈密顿方程(Hamilton's equations)描述系统,其中状态变量为位置 q 与动量 p。

这两种视角在大多数场景下互补等价,被视为对同一物理图景的“对偶表达”。两者之间也存在一些细微的区别,但视频并未详细展开这些差异。

重要性依据:欧拉–拉格朗日方程是物理学中“最基础且普遍”的方程式之一,它汇总了最小作用量原理(principle of least action),这一原理不仅适用于经典力学,它反复出现在量子力学、广义相对论、狭义相对论、光学与电磁学等更广泛的物理领域。即使人类发现新的基本力,最小作用量原理依然能持续作为有用的理论框架。

2. 朴素方法及其缺陷

朴素神经网络方法(naive approach):直接构建一个前馈神经网络,使其学习状态向量 q(位置)与 q̇(速度/广义速度)的动力学方程。若有系统已知具有能量守恒或某种对称性,朴素的方式通常无法使这些性质在网络预测中保持——例如随时间推演,能量会逐渐发散(blow up)或耗散(bleed out)。这种对称性会被“破坏”。

对称性与守恒律的理论支撑:诺特定理(Noether's theorem)是数学物理领域最基础的概念之一,提出在哈密顿或拉格朗日系统中,对称性对应着守恒量。LNN 利用拉格朗日视角以系统的方式封装并理解这些对称性。

3. 哈密顿神经网络(HNN)作为前身

  • 哈密顿神经网络的思想是:不直接学习状态量 q 和 p 的导数 q̇、ṗ,而是学习一个中间函数——哈密顿函数 H(即系统能量),再以正确方式对其求偏导,从而得到 q̇ 和 ṗ。
  • 这样就强制在运动方程中加入了哈密顿(辛)结构。
  • HNN 的一个主要局限:它需要提前知道正确的变量选择 q 和 p。如果给出的是构型/形状/位置变量 q,还必须知道对应的共轭动量变量 p
  • 某些简单情况下(如弹簧上的质量块)较容易求出共轭动量;但在拉格朗日动力学或哈密顿动力学中,某些情况下求出正确的 p 非常麻烦/棘手。
  • 这意味着 HNN 要求事先拥有正确类型的内在坐标(即正则坐标 canonical coordinates),在难以计算共轭动量的复杂情形下不适用。

4. 拉格朗日神经网络:架构与原理

LNN 采取拉格朗日视角,避开 HNN 对共轭动量的依赖需求:

  • 架构特点:LNN 学习一个神经网络模型,用于表达中间函数——拉格朗日量 L。
  • 实现机制:对学习到的 L 以正确方式取偏导数后,即可恢复欧拉–拉格朗日方程的结构,并在损失函数中强制要求该方程在给定 L 时成立:
  1. 神经网络学习拉格朗日量 L;
  2. 使用自动微分(在 JAX 或 PyTorch 等现代机器学习框架中)计算所需偏导数;
  3. 损失函数中加上一个项:令 q̈(由网络推算)与从 L 导出的欧拉–拉格朗日方程的右端项相等(即两者之差的范数趋近于零)。
  4. 当该项很小时即意味着网络所学 L 正在满足欧拉–拉格朗日方程。
  • 不是直接学 q̈:视频强调,LNN 不是朴素的把 q̈ 当成 q 与 q̇ 的函数用前馈网络来学,而是通过拉格朗日 L 这一中间层来实现。
  • 可视为带结构的神经 ODE:神经 ODE 是 ResNet 的连续时间形式,即学习微分方程的右端项 ẋ = f(x)。LNN 在原理上与神经 ODE 相似,但多了一个中间步骤:先学习拉格朗日量 L,再通过微分将其映射到动力学。

5. 与传统数值积分器的对照

视频用双摆系统的数值求解来说明相同逻辑在古代/传统数值分析中同样成立:

  • 理想化的双摆系统若无摩擦,能量应当严格守恒。
  • 朴素 ODE 40/45 积分器(四阶龙格–库塔法):在能量应当恒定的情况下,数值解很快发散,能量最终爆炸,守恒量不守恒是严重问题。
  • 变分积分器(variational integrators)被专门设计为在给定拉格朗日的条件下尊重欧拉–拉格朗日方程的结构。使用拉格朗日推导并定制变分积分器时,能量曲线远优于朴素方法,能很好保持恒定。
  • 变分积分器在科学计算广泛应用。如预测小行星、行星、卫星等运动时,若要知道 500 年后是否有小行星靠近地球,必须用此类结构保持方法做精确模拟。
  • 在神经网络建模中逻辑完全一致:将欧拉–拉格朗日结构内嵌进网络中,就能更大可能地保持对称性与守恒量。

底层根源文献:变分积分器思想来源马修·韦斯特(Matt West)于 2004 年的博士论文《变分积分器(Variational Integrators)》,约 150 页长,讨论了经典积分格式如何作为变分积分器思想的特殊情况。文中还推荐了 Marsden 与 Ratu 的著作《力学与对称性导论》(Introduction to Mechanics and Symmetry),说明它是很高级的“导论”,系统讨论拉格朗日动力学、哈密顿动力学、对称性处理、大量实例。拉格朗日动力学本身已有二三百年历史,是牛顿力学体系在力学系统中的自然演化。

6. LNN 相对 HNN 的关键优势

  • 不需要正则坐标:拉格朗日神经网络对 q 和 q̇ 可以任意选取,适用于难以计算共轭动量的棘手情况。
  • 更加灵活:只要给出任意你认为合适的变量,即可工作。
  • 比较对象包括标准朴素神经网络、神经 ODE、哈密顿神经网络等。

7. 具体代码与操作细节

视频展示了一份可在 GitHub 上获取/下载的代码实现。其中的核心结构是一个“较大的前馈神经网络”来学习拉格朗日量,具体为三个带激活函数的稠密层(three dense layers with activation functions),然后用 JAX 计算相对 q 和 q̇ 的全部偏导数,以确认欧拉–拉格朗日方程实现。

关键代码引述:讨论中提到“perhaps surprisingly though, we can implement this operation in a few lines of JAX. See appendix. We publish our code on GitHub.”视频强调,虽然欧拉–拉格朗日的展开式可能看起来非常杂乱/复杂,但在 JAX/Torch 等现代机器学习工具中相对容易实现。


案例与数据

双摆系统(Double Pendulum)

  • 双摆与单摆不同。单摆(简单的力学系统,如单摆)可以写出欧拉–拉格朗日方程,然后用龙格–库塔等数值方法轻易而准确地向时间正向积分。
  • 添加一根摆动臂后,仍可同样写出拉格朗日方程,但系统变得非常难以数值积分——双摆是已知的混沌系统,使用传统方法极难精确积分。
  • 视频中对比数据:
  • 黄色曲线为基准(benchmark solution),能量应为恒定值(“常量值 60”,即初始能量 60,整个模拟过程应保持这一恒定值)。
  • 蓝色曲线为 ode45(四阶/五阶龙格–库塔)朴素积分结果——能量迅速发散、爆炸(蓝色曲线质量不佳)。
  • 粉色曲线为自定义变分积分器结果——保持能量方面表现远优(能有效保持能量恒定)。

LNN 的意义:LNN 正是神经网络建模中的“变分积分器”——把欧拉–拉格朗日结构嵌入学习中,从而在系统预测/建模中更可能保住能量的守恒和系统的对称性。

论文作者与出处

  • 视频指出“great donus was from the original paper”,随后列出作者:Cranmer, Houyer, Bataliia, Spurgel 与 Ho(名称来源于视频口述,拼写可能存在口语化偏差;建议核对原论文作者列表)。
  • 视频特别认可 Miles Cranmer 与 Shirley Ho 的工作。
  • LNN 与哈密顿神经网络原论文(HNN)的不同:HNN 原论文仅围绕简单玩具问题(toy problems),而 Cranmer 等人审视了双摆这一更具挑战性的实例

限制与待确认问题

  • 视频明确说明该架构是为已知存在某种对称性/守恒量/拉格朗日结构的系统设计的高效方案;若系统并不具备这些特性,此方法的优势无从体现。
  • 对 HNN 局限的讨论提及的是其需要正则坐标的问题;LNN 克服了这一点,但视频未展开说明 LNN 是否存在自身特有的弱点或受约束条件(如对非确定性系统的扩展是否可行未见实例验证)。
  • 作者姓名中的若干拼写(Houyer/Bataliia/Spurgel)在口述中难以确定,应参考原始论文确认。
  • 视频未披露 LNN 在不遵守经典拉格朗日动力学的非力学系统中的测试结论;只建议读者自己尝试扩展(例如非确定系统或奇异物理情形)。
  • 具体网络训练细节(学习率、数据量、训练集构成、噪声添加方式、超参数选择、与基线方法误差的定量对比数)未在视频中详述。
  • 虽指出 JAX 中可几行代码实现,但视频并未展示完整代码或逐行解释;仅提到大致结构(三层稠密网络、auto-diff 计算偏导数、损失函数的构造方式)。

行动清单 / 尝试方向

  • 下载 GitHub 上的开源代码并自行运行/测试;尝试为不同系统或不同欧拉–拉格朗日方程进行实验。
  • 尝试给数据加噪声,观察 LNN 在何种噪声水平下仍能正常工作。
  • 尝试将该方法扩展到非确定性系统(non-deterministic)或非经典力学系统。
  • 尝试将其应用于已知欧拉–拉格朗日方程仍然适用的“新鲜物理/奇异物理”领域。
  • 也可以查阅原始论文与附录(附录说明如何在 JAX 中实现式中的关键运算),以及下述拓展阅读:
  • Marsden 与 Ratu(Ratiu)联合作者的《 Introduction to Mechanics and Symmetry》——关于拉格朗日+哈密顿动力学、对称性的系统处理方法,书中含大量实例。
  • Matt West 的《Variational Integrators》(约 150 页博士论文)——经典积分方式作为变分积分器特例的完整阐述。
  • 前序视频中讲解的哈密顿神经网络(HNN)。

总结

拉格朗日神经网络是一种创新的“物理工程化”神经网络设计,它以拉格朗日函数 L 作为网络的中间学习对象,将欧拉–拉格朗日方程通过损失函数项明确嵌入训练过程,在有效采用自动微分工具的前提下,实现了对系统动力学进行物理一致性地学习。对比哈密顿神经网络,其最吸引人的特点是在不必知道共轭动量/正则坐标的前提下完成建模,尤其适用于双摆这类混沌、数值积分困难但原则上仍遵循欧拉–拉格朗日方程的物理系统。该思路的建模逻辑与经典变分积分器在数值分析领域中“尊重欧拉–拉格朗日结构”的设计哲学相呼应,代表了在现代机器学习时代将物理学结构“炼丹”入数据驱动模型的一种值得推广的实践路径。