返回
查看原链接原链接
Bilibili33分36秒 · —

物理信息机器学习(Physics-Informed Machine Learning):第五阶段——优化算法中的物理嵌入

物理信息机器学习(Physics-Informed Machine Learning):第五阶段——优化算法中的物理嵌入

核心结论: 在机器学习流水线的五个阶段中,优化阶段是嵌入物理知识的最终且最严格的手段——通过设计或选择约束优化算法,可以直接将模型搜索空间限制在满足物理定律(如能量守恒、厄米对称性)的子空间或流形上,从而实现比单纯添加损失函数惩罚项更强、更精确的物理一致性。


引言与背景:优化阶段在机器学习流水线中的定位

本讲座属于"物理信息机器学习"系列导论部分,重点探讨物理科学与机器学习优化的交叉领域。系列讲座已系统梳理了机器学习的五个阶段,并逐一分析了每个阶段嵌入物理知识的可能性。本讲聚焦第五阶段——实际执行优化算法以训练机器学习模型,讨论如何将物理约束直接嵌入优化过程本身。

机器学习流水线的紧密耦合结构

一旦确定了建模对象(问题定义)和训练数据,后续三个阶段便高度耦合、紧密关联:

  1. 架构选择:选择一个预期能产生良好模型表现的架构,可以是深度神经网络、广义线性模型,或符号回归中的组合函数树等。
  2. 损失函数设计:定义量化模型好坏的标准——模型在训练数据上根据该损失函数的得分来判断优劣。
  3. 优化算法执行:调整架构参数,使损失函数在数据上的平均值最小化。

本讲的核心议题即为:在所有可能的优化步骤中,有哪些机会可以将物理知识直接嵌入进去

讲座定位说明

本讲属于高层次的概览性介绍,后续将有更深入、更详细的跟进讲座(包括专门的优化训练营和对称性专题),本讲旨在建立整体框架和直觉。


核心理念:从"物理"到"约束"再到"优化"

讲座反复强调一个通用的三层递进框架,这是理解全部分支内容的主线:

  1. 将物理诠释为数学表达:物理知识(如平移不变性、旋转不变性、量子力学对称性、能量守恒)首先要被转化为明确的数学条件。
  2. 将数学条件映射为模型结构约束:这些数学条件对应于模型必须满足的特定结构,例如属于某一类矩阵流形,或满足一系列等式约束。
  3. 设计优化算法在约束下求解:设计或选用一个优化算法,在满足上述结构约束的前提下最小化损失函数。

这个框架的适用范围远超流体力学或动态系统分解,对于神经网络和各种机器学习架构同样适用。


第一类方法:线性等式约束与能量守恒(SINDy 案例)

背景:SINDy 建模流程

SINDy(Sparse Identification of Nonlinear Dynamics,稀疏非线性动力学识别)是一种用于建立复杂系统(如流体流动)低阶机器学习模型的标准化流程。其核心思想是:在候选函数库(矩阵 Θ)中,寻找最少的列(即最少的候选函数项),使其线性组合等于系统的状态导数(ẋ、ẏ、ż)。这一目标通过某种稀疏优化程序求解一个稀疏系数向量 c 来实现。

标准的朴素 SINDy 方法仅最小化模型误差,可能在损失函数中附带一个稀疏性正则项以促进系数 c 的稀疏性。但这种方法完全忽略了已知的物理定律。

核心洞察:从第一性原理推导约束方程

合作者 Jean-Christophe Loiseau(巴黎) 做出了一个关键观察(该合作始于他在 KTH(瑞典皇家理工学院)做博士后期间):

  • 对于不可压缩流体,从第一性原理出发可以推导出一组约束方程
  • 任何对不可压缩流体建立的模型,若要满足能量守恒,这 十个约束方程 必须全部成立。

这是一个重要且普适的观察:任何我们处理的不可压缩流体,都会产生此类等式约束集合。

方法演进:从损失函数惩罚到精确约束优化

Loiseau 没有止步于将约束作为惩罚项加入损失函数,而是更进一步:

方法层面具体做法局限性
软约束(损失函数项)在损失函数中加入量化约束违反程度的项两个目标相互冲突,最终模型既不精确能量守恒,模型误差也可能不理想
硬约束(约束最小二乘)通过 KKT(Karush-Kuhn-Tucker)约束最小二乘,在精确满足约束的前提下最小化模型误差需要已知精确的等式约束且问题适合最小二乘框架;但结果是精确

关键评价: 当已知精确的等式约束并以最小二乘方式进行模型误差拟合时,约束优化方法远比软约束更有力——它确保约束被精确满足,而非"近似"或"促进"被满足。该团队已将此方法扩展至多种流体模型、SINDy 模型和稀疏模型场景中。


第二类方法:流形约束与物理信息动态模式分解(piDMD)

背景与动机

Peter Baddoo 等人发展了物理信息动态模式分解(physics-informed Dynamic Mode Decomposition, piDMD)。(讲座提示:Peter 已录制了关于该主题的完整视频,本讲仅做概要回顾。)

以六方势阱中的量子振荡为例:我们根据物理知识知道该动力系统模型应当具备厄米性(Hermitian property)——这是一种由控制方程形式决定的特定对称性。即使采用数据驱动的机器学习模型,也应当保留这一基本对称性。

方法原理:改变搜索空间的约束优化

经典 DMD 的本质:寻找一个最佳拟合线性模型(矩阵 A),将状态 x 映射到其导数 ẋ。值得注意的是,经典 DMD 本身已经是一种约束优化——它将搜索空间限制在低秩矩阵(秩为 r 的矩阵)上,这本身就是一种物理信息的初步嵌入。

piDMD 的改进:实质上改变了算法搜索的矩阵空间——将搜索约束到特定的矩阵流形 ℳ 上。这是数学意义上的"流形约束优化"(后续讲座将深入介绍矩阵流形和约束优化的实际算法)。

效果对比

  • 真实情况(第一行):系统的特征模态。
  • 标准 DMD(底部):未在优化中嵌入对称性,结果噪声较大、效果不佳
  • piDMD(中间):直接约束优化仅搜索厄米矩阵,显著更好地捕捉了系统的特征结构

结论: 将对称性直接嵌入优化算法,可以大幅提升模型性能

可扩展的约束类型

piDMD 框架可以适配多种物理对称性和结构约束:

  • 自伴(self-adjoint) 性质
  • 平移不变性(shift-invariant):物理规律在平移后保持不变(如平移不变性在许多系统中普遍存在)
  • 保守或酉动力学(conservative/unitary dynamics)

针对每种约束类型,可以设计精确的最优化程序:在满足特定条件的矩阵空间(自伴矩阵、三对角矩阵、循环矩阵或对称矩阵的子流形)上最小化代价函数。

数学基础:Procrustes 问题

将解限制在特定矩阵流形上的数学优化问题称为 Procrustes 问题。名称源自希腊神话中的强盗普罗克鲁斯特斯(Procrustes)——他将受害者强行困在一张特定长度的床上,过长则砍腿,过短则拉伸。这一卡通意象隐喻了优化过程"扭曲"解以使其落在目标流形上的本质。Peter 在其视频中对此有更详尽的解释。

关键结论:

  • 通过将模型约束到物理信息流形上,可以嵌入已知物理知识。
  • Peter 论文的核心观点是:在许多情况下,这些优化问题可以被精确求解;当无法精确求解时,可退而求其次在损失函数中添加惩罚项来促进对称性。
  • 线性约束(如 SINDy 的等式约束)通常容易获得精确的闭式解(如 KKT 优化)。
  • 出乎许多人意料的是,子流形约束(如 Procrustes 问题)也常常存在精确解

约束 vs. 惩罚:两种嵌入方式的机制对比

讲座对"硬约束"与"软惩罚"两种路径做了系统比较:

软约束(损失函数惩罚项)

  • 实现方式:在标准损失函数(如典型的 L2 误差:ŷ 为模型预测,y 为训练数据输出)中加入一项,计算模型预测与该预测投影到目标流形上的距离。
  • 本质:通过损失项"促进"解向流形靠近,相当于"收缩包裹"解到流形上。
  • 局限:只鼓励模型接近流形,无法保证精确落在流形上;损失函数中的多个目标可能相互冲突。

硬约束(约束优化)

  • 实现方式:直接修改最小化算法,将解限制在流形/子空间内部搜索。
  • 优点保证解一定满足约束,这是比软约束"严格得多"的物理嵌入方式。
  • 代价:通常更耗费人力——设计或寻找专门针对特定约束定制的优化算法需要更多工作量。

讲座立场(第一人称表述): "只要我能做到,我更喜欢硬约束。这是我从 Jean-Christophe Loiseau 和 Peter Baddoo 等人那里学到的重要一课——这些约束问题实际上是可以借助优化算法求解的。"

对称性的三种操作(基于 Sam Otto 与 Nathan Kutz 合作的论文):

  • 执行(Enforce):通过直接约束实现。
  • 促进(Promote):通过添加损失函数实现。
  • 发现(Discover):有时可以从数据中发现系统先前未知的对称性——这是完全不同的目标。

注:Sam Otto 在录制时是该 AI 研究所的博士后,与 Nathan Kutz 和讲座人合作。讲座承诺将提供相关论文和视频链接。


第三类方法:符号回归与进化优化

符号回归概述

符号回归是机器学习研究中一个重要的领域(历史文献中常称为遗传编程进化算法)。其核心功能:

  • 输入实验或模拟数据,程序学习描述该数据的微分方程或守恒定律
  • 学到的表达式通常比神经网络更可解释
  • 历史脉络:Bongard 和 Haon、Lipson 和 Schmidt 等人已使用遗传编程和符号回归进行模型发现至少二十余年。
  • 当前最新工具:PySR——由 Miles Cranmer 开发的 Python 符号回归包,是目前遗传编程用于模型发现的最先进版本

视角:符号回归作为优化算法的特殊性

在"物理信息机器学习"的框架下审视符号回归:

  • 架构层面:符号回归使用组合函数树(compositional function trees) 来表示函数——这是架构的选择。
  • 损失函数层面:确实存在一个被最小化的损失函数来训练这些遗传编程树。
  • 优化层面(核心关注点):获得模型的方式是通过一种独特的进化优化算法——一种引导式试错搜索
  • 尝试大量候选函数树
  • 表现优异的树通过交叉(crossover)变异(mutation)克隆(cloning) 等遗传操作被"繁殖"或"进化"为后代

关键洞察: 遗传编程、遗传算法和符号回归本质上基于一种与常规机器学习优化(最小二乘、随机梯度下降等)截然不同的优化算法体系。这个优化算法刻意通过选择"功能模块"来引导架构找到正确模型,从而将物理知识(如对表达式简单性的偏好)融入优化过程。


第四类方法:稀疏性与低维性作为物理先验

物理中的节俭原则

爱因斯坦有一句名言(讲座引用):物理模型"应当尽可能简单来描述数据,但不能更简单"(*as simple as possible to describe the data, and no simpler*)。这是物理学中的节俭原则(principle of parsimony),同样也是机器学习中的重要原则。

要让机器学习模型可解释、可泛化、捕捉系统物理本质,通常需要通过两条路径实现:

  1. 低维性(low-dimensional):模型不应有过多的自由参数。
  2. 稀疏性(sparse):若机器学习一个微分方程来描述时间序列数据,希望该方程只包含尽量少的项。

范数、正则化与对应优化算法

这两种性质分别由 L2 范数(衡量低维性/能量)和 L0/L1 范数(衡量稀疏性)量化。这些范数的区别和几何性质在教科书(第三章)中有详细讨论。

关键观点:这些范数各自有明确的优化算法和程序来最小化

方法损失函数/正则优化算法特点
最小二乘L2 损失有已知的闭式解(计算 SVD、伪逆)
岭回归(Ridge)L2 损失 + L2 惩罚正则化最小二乘
LassoL2 损失 + L1 惩罚迭代优化算法求稀疏解
Elastic NetL2 损失 + L1 + L2 惩罚组合优化
自定义稀疏优化(如 SR3)自定义稀疏损失需要定制算法,有时效率远超通用算法

具体案例:SINDy 中的稀疏回归与 SR3 算法

在 SINDy 稀疏模型识别中,优化目标是找到最少的 Θ 列(候选微分方程项)使组合等于 Ẋ、ẏ、ż,即系数矩阵 c 尽可能稀疏(最小化 L0 或 L1 范数)。讲座人团队与 Zachary G. Nicolaou(P.-G. Zang?)、Travis Askham、Nathan Kutz 和 Sasha Aravkin 合作开发了一种新的优化算法(名为 SR3,图中有示意),其亮点在于:

  • 传统方法需要大量优化迭代才能达到稀疏解(图中蓝色小点表示迭代过程)。
  • SR3 算法几乎立即收敛到最优解,且条件数更好(better conditioned)。
  • 结论:当求解稀疏模型时,隐含的假设是需要一个专门针对特定损失函数定制的优化算法——不是简单的随机梯度下降或最小二乘,而可能是专门为解决 L0/L1 稀疏问题设计的定制算法。

超参数扫描与 Pareto 曲线

模型复杂度通过超参数 λ 控制(λ 越大鼓励越稀疏):

  • λ → ∞:模型退化为无项模型(欠拟合),误差极大。
  • λ = 0:模型非常复杂(过拟合)。
  • 扫描 λ 得到 Pareto 曲线(误差-复杂度权衡曲线)。
  • 在保留的测试集上交叉验证这些模型,会得到典型的学习曲线,希望选择的模型位于验证误差最小的位置。

总结与核心要点

优化的角色:从"抽象化的黑箱"到"物理嵌入的金标准"

  • 一切机器学习归根结底是优化问题:我们都在寻找最小化损失函数的解。
  • 多数情况下的优化可被抽象化:最小二乘(伪逆)或神经网络训练(如 Adam 等随机梯度下降算法)已被优化得很好,使用者无需关心底层细节。
  • 但有时需要定制算法:为了促进特定约束或处理特定损失函数(如 L0 稀疏损失),或为了扫描超参数以找到最佳交叉验证模型。

本讲的核心信息

  1. 约束优化是比损失函数惩罚更强、更严格的物理嵌入方式
  • 损失函数:促进物理约束被满足。
  • 约束优化:执行/保证物理约束被满足。
  1. 线性约束(如 SINDy 能量守恒的十约束条件)定义子空间,通常有闭式解(KKT)。
  2. 流形约束(如 piDMD 的厄米流形)定义子流形,也常存在精确解(Procrustes 问题)。
  3. 对称性是编码已知物理的主要途径之一,观察数据本身也常能揭示对称性线索。
  4. 符号回归/遗传编程代表了一套完全不同的优化范式,通过进化操作搜索模型空间。
  5. 稀疏性和低维性是物理模型中重要的先验,各有专门的优化算法(Lasso、SR3 等)。
  6. 物理嵌入优化阶段通常最耗费人力——设计一个新优化算法可能相当于一个博士论文的工作量,但它是强制执行物理的最可靠途径(金标准)

各类方法对比一览

方法/工具物理先验类型约束方式优化算法是否精确
SINDy + KKT 约束能量守恒(十个等式约束)硬约束(等式约束)KKT 约束最小二乘精确
标准 DMD低秩结构硬约束(秩约束)低秩矩阵最小二乘精确
piDMD厄米性、平移不变性等硬约束(流形约束)Procrustes 问题精确求解通常可精确
损失函数惩罚项任意可量化约束软约束常规优化算法不精确,仅近似
符号回归(PySR)构成模型的函数模块通过遗传操作引导进化算法(交叉、变异、克隆)非精确保证
Lasso / SR3稀疏性算法特有定制稀疏优化对稀疏性有保证

在五个阶段中的定位

本讲讨论的优化阶段是五个阶段中物理嵌入难度最高、但效果最严格的一个:一个精心设计的约束优化算法可以直接保证模型在结构层面满足物理定律,这是修改损失函数或架构所无法取代的优势。


限制与待确认问题

以下问题在讲座中提及将在后续深入,本讲未给出完整答案:

  • 矩阵流形上约束优化的具体算法实现:讲座明确说"我们之后会深入探讨数学细节",包括矩阵流形和约束优化的实际算法。
  • piDMD 中哪些流形约束可以精确求解、哪些不能:讲座提及"在很多情况下可以精确求解",但未给出完整的可能性分类。
  • "发现"对称性的具体方法和案例:Sam Otto 的论文被引用,但具体发现机制未展开。
  • SR3 算法的详细推导与理论保证:仅展示了效率提升的直观对比。
  • Sam Otto 关于对称性的视频内容:仅预告,未提供内容。
  • 遗传编程/符号回归的数学性质:讲座提到将"稍后讨论更多",但未在本讲展开。

行动清单(为后续学习做准备)

根据讲座内容,听众可预期后续深入学习以下主题:

  • Peter Baddoo 关于物理信息 DMD 的完整视频。
  • Sam Otto 关于对称性执行、促进与发现的论文及系列视频。
  • 专门的大型优化"训练营"课程(讲座明确预告)。
  • 教科书第三章关于范数几何与稀疏优化算法的内容。
  • 对设计自定义优化算法感兴趣的听众,可关注 SR3 算法的后续介绍。