物理信息机器学习(Physics-Informed Machine Learning)课程总结与回顾
物理信息机器学习是将物理知识嵌入机器学习流程的各个环节,用优化方法从数据中构建物理模型,其核心价值在于显著降低对训练数据量的需求,并提升模型在外推场景下的泛化能力,最终服务于科学发现与工程设计与控制。
本笔记对课程中关于物理信息机器学习的总览性回顾进行了详细整理,内容包括:物理信息机器学习的定义、构建机器学习模型的五个标准阶段、在每个阶段嵌入物理知识的方法、嵌入物理的两大核心动机与实践中的关键特性、相关典型案例以及未来方向。
一、物理信息机器学习的定义
1.1 什么是物理信息机器学习
物理信息机器学习特指这样一类过程:使用优化方法从数据中构建物理模型。
- 输入是来自物理系统的数据,例如:
- 摆锤运动的视频;
- 机械设备运转的测量数据;
- 脑电波(brain wave)等生物信号数据。
- 目标是从这些数据中学习出能够描述该物理系统的模型,包括:
- 发现描述系统所需的低维坐标;
- 学习在这组坐标下系统演化的动力学方程。
1.2 “物理”在机器学习语境中的含义
在课程框架下,“物理”通常意味着两件事:
- 发现好的坐标(discovering good coordinates) —— 找到能够简洁描述系统状态的变量,例如从高维视频中提取出摆锤的角度和角速度。
- 发现方程(discovering equations) —— 找到描述系统在这些坐标下如何随时间演化的数学表达式。
需要强调的是,这只是“物理”最典型的含义,但并非唯一含义;在不同工程或科学问题中,“物理”的具体内涵会有差异。
二、机器学习模型的五个标准阶段与物理嵌入总览
讲师将构建任何机器学习模型的过程划分为五个标准阶段,并指出在每一个阶段都有嵌入物理知识的可能性。
阶段一:决定要建模的问题(Problem Statement)
- 内容:明确建模对象与目标,例如:
- 建模翼型(airfoil)的升力(lift)作为其几何形状的函数。
- 物理嵌入方式:
- 选择某个物理问题进行建模本身,就已经是向机器学习流程中嵌入了物理概念。
- 问题陈述可以预设“我关心的是坐标与动力学”,这本身就是一种物理先验。
阶段二:数据整理(Data Curation)
- 内容:解决如何获取训练数据的问题,包括:
- 是否实际制造一批不同几何形状的机翼并测量升力(风洞实验);
- 是否运行仿真模拟来生成数据;
- 这些数据的质量与可信程度如何(“我信任仿真结果吗?”)。
- 物理嵌入方式:
- 如果已知系统应具有某种对称性或属性,可以通过数据增强(data augmentation)的方式让模型更符合物理规律。
阶段三:设计架构(Architecture design)
- 内容:选择或设计模型可表达函数的空间,这是五个阶段中自由度最高、最富创意的一步。
- 常见的神经网络架构:循环神经网络(RNN)、自编码器(autoencoder)、卷积神经网络(CNN)。
- 并非所有机器学习架构都是神经网络,还包括:
- 线性模型;
- 广义线性模型(generalized linear models);
- 高斯混合模型(Gaussian mixture models);
- 决策树(decision trees)。
- 当加入物理要素时,某些架构具有特殊重要性,因为:
- 部分架构在数据较少时更容易训练;
- 许多物理系统只能获得有限数量的数据。
- 物理嵌入方式:
- 设计定制化架构,使其在结构上更倾向于输出物理模型。
阶段四:设计损失函数(Loss Function)
- 内容:损失函数在模型表现良好时应取小值。
- 例如在翼型升力建模问题中,损失函数度量的是预测升力与实际测量升力之间的误差。
- 训练过程就是通过调整架构参数(如神经网络权重)来最小化这个损失函数。
- 物理嵌入方式:
- 在损失函数中添加额外的特殊项(special terms),促使模型更符合物理规律。
阶段五:优化(Optimization)
- 内容:所有机器学习底层都运行着一种优化算法,用于:
- 调整架构中的自由参数;
- 最小化在所有训练数据上平均的损失函数。
- 当损失函数足够小时,模型被认为解决了目标问题。
- 物理嵌入方式:
- 采用约束优化(constrained optimization) ,将模型限制在满足已知物理约束的范围内,例如:
- 能量守恒(energy conservation);
- 对称性(symmetry)。
实践中的分布:物理嵌入主要集中在底部三个阶段
讲师指出,在实际操作中,物理知识主要通过以下三个底层阶段嵌入:
- 架构的选择;
- 损失函数的选择;
- 优化算法的选择。
这一观察贯穿整个课程,但讲师特别强调:这三个阶段之间的界限在实践中非常模糊。
三、为什么要在机器学习中嵌入物理?
讲师指出,观众可能会问“嵌入物理听起来很困难,为什么不直接构建一个足够大的神经网络让它自己学到物理?”——他称之为“谷歌式方法”(the Google approach)。这种方法的可行条件是大科技公司拥有:
- 近乎无限的训练数据;
- 庞大的计算资源;
- 可以并行训练大量模型并筛选出符合要求的架构的能力。
然而,科学家和大多数工程师通常不具备这样的条件,因此嵌入物理是必要且有效的替代路径。以下两大理由是最核心的动机。
动机一:显著降低训练数据需求量
- 背景:在许多实际工程问题中,获取物理数据的成本极其高昂。以翼型设计为例:
- 对不同翼型几何进行风洞测试非常昂贵——需要花费大量时间和金钱;
- 流体仿真(CFD)测试所有几何形状的成本可能高达数百万美元。
- 问题:在数据有限的情况下,没有足够的数据来训练一个大型神经网络以准确预测翼型性能。
- 解决方案:在机器学习过程中嵌入物理知识,将模型空间限制在一个由已知物理规律(如对称性、能量守恒、质量守恒)约束的子集之中。这种约束能够显著减少训练一个好模型所需的数据量。
动机二:提升模型的外推(泛化)能力
- 背景:
- 大多数机器学习算法,尤其是神经网络,在插值(interpolation) 方面表现出色——能够通过巧妙的方式在训练数据集的凸包内部进行插值。
- 但工程师在设计中往往需要将设计变量推到训练数据范围之外(外推,extrapolation)。
- 关键论点:实现外推的唯一途径通常是捕捉系统背后的物理规律。讲师提出一个工作定义:
- “物理就是让模型具备泛化能力的部分”(the bits of the model that generalize)。
- 示例:如果流体模型内建了能量守恒,那么模型在远离训练数据的区域仍然有效的可能性远高于未内建物理的模型。
- 极端情况说明:如果有近乎无限多的数据,插值与外推的界限会变得模糊。例如,拥有谷歌级图像库时,几乎所有可能看到的图像都可以视为训练数据之间的插值。但对于真实的物理世界,数据是有限的,因此更依赖于外推,也就更需要物理。
其他收益
- 帮助进行科学发现:物理模型有助于从数据中发现未知规律。
- 支持主动学习(active learning) :物理模型可以协助提出假设,指导在“采样更多数据”的循环中更高效地获取新数据,从而构建数字孪生(digital twin) 等系统。
四、物理嵌入的三个关键环节及其相互耦合关系
4.1 三大环节界限模糊,实操中难以完全分开
讲师反复强调:架构、损失函数、优化算法三者在实践中高度耦合、难以拆解。
- 大多数定制化架构(为了更“物理”而设计的)需要配套的定制化损失函数才能训练。
- 定制化的损失函数通常无法直接使用现成(off-the-shelf)的标准优化算法(如普通的随机梯度下降或最小二乘法),需要定制化优化算法。
- 如果细化来看,问题定义(problem statement)本身也可以视为一种物理嵌入,例如决定“我要寻找坐标和动力学”就已经预设了物理观念。
下表直观地总结了三者间的关系:
| 环节 | 功能 | 物理嵌入方式 | 典型定制化表现 |
|---|---|---|---|
| 架构 | 定义搜索的函数空间 | 选择带有物理结构的模型族 | 自编码器、广义线性模型、LNN、函数树等 |
| 损失函数 | 度量模型好坏 | 添加物理约束项 | 自编码重建+稀疏回归误差;Euler-Lagrange方程残差 |
| 优化算法 | 调节参数最小化损失 | 专门的算法处理定制损失 | SINDy的稀疏回归(SR3);基因编程的进化算法 |
4.2 案例一:坐标系统与动力学发现
该问题尝试同时解决两个子任务:
- 从高维观测(如摆锤视频)中学习低维坐标表示(以潜在空间中的红色节点示意);
- 学习一个微分方程,描述系统在该坐标下的动态演化。
其实现涉及的三个层面:
- 架构选择:
- 坐标发现采用自编码器(神经网络架构,擅长压缩数据到低维坐标);
- 动力学发现采用SINDy(稀疏库回归),本质上是广义线性模型架构,适合表示动力学。
- 定制化损失函数:
- 需要Kathleen Champion等人专门设计定制损失函数才能使模型成功训练。
- 定制化优化算法:
- 由于损失函数中包含促进稀疏性的项,不能使用普通的Adam或SGD优化器,而是使用专门为此设计的稀疏松弛正则化回归(Sparse Relaxed Regularized Regression,SR3) 等定制回归/优化算法。
4.3 案例二:基于遗传编程的符号回归(Symbolic Regression via Genetic Programming)
- 代表人物:
- Miles Cranmer(相关工作广受认可);
- Holibson、Bguard、Schmidt等人在符号回归与模型发现方面也做出过重要贡献。
- 三个层面分析:
- 架构:采用组合函数树(compositional function tree)——这本身就是一种架构,定义了用于表示模型的函数空间。
- 损失函数:依然需要定义损失函数来判断建模任务完成得好坏。
- 优化算法:使用进化算法(evolutionary algorithm) ——通过变异(mutation)和交叉(crossover)对函数树进行“繁殖”以搜索最优函数,这是非标准的优化手段。
4.4 案例三:拉格朗日神经网络(Lagrangian Neural Network, LNN)
- 提出者:Miles Cranmer及合作者。
- 物理基础:
- 许多力学系统(如双摆,double pendulum)的方程具有额外结构,如对称性和微分方程的特有结构。
- 欧拉与拉格朗日、哈密顿、牛顿建立的深层物理框架表明,这类系统守恒能量并满足Euler-Lagrange方程。
- 如何嵌入物理:
- 架构层面:选择以拉格朗日量 L 为建模对象,设定明确的输入与输出的神经网络结构——这一选择本身是架构层面的物理嵌入。
- 损失函数层面:训练方式是基于该架构、利用反向传播/自动微分计算所需偏导数,然后构建损失函数,强制要求该函数 L 必须满足Euler-Lagrange方程。
- 性质:本质上是一个带有拉格朗日结构的定制化神经常微分方程(Neural ODE),效果非常好。
- 意义:说明通过架构和损失函数两个途径可以同时嵌入物理,二者相辅相成。
4.5 对称性作为嵌入物理的通用手段
- 物理规律经常表现为系统的对称性(symmetry)。
- 对称性可以嵌入到以下一个或多个层面:
- 架构中:将对称性内建到网络结构;
- 损失函数中:添加约束项促使对称性被满足;
- 约束优化中:强制模型必须遵守对称性。
- 实际使用中往往是以上几种方式的组合。
五、工程应用场景与数据特点
5.1 工程应用的领域与动态过程
课程后续深入探讨将围绕以下工程领域展开:
- 流体力学(fluid mechanics);
- 材料科学(material science);
- 机器人学(robotics);
- 自主系统(autonomy);
- 数字孪生(digital twins);
- 制造(manufacturing)。
讲师强调,虽然展示的静态图像(如合金材料)看似静态,但实际上这些过程都随时间演化:
- 制造合金的退火(annealing)过程;
- 合金随时间老化的过程。
5.2 不同应用领域在“物理”含义、数据与约束上的差异
每个工程应用领域在以下方面存在微妙差别,设计机器学习模型时必须加以考虑:
- “物理”在这一语境下的具体含义不同;
- 可获得的数据类型不同;
- 对模型性能的评判标准和严格程度不同;
- 模型的最终使用方式不同。
示例:超合金(super alloy)制造
- 测试一种新合金的成本极其高昂,可达数万美元(tens of thousands of dollars);
- 训练数据非常有限,不可能拥有数百万个样本;
- 因此,该问题的数据约束、物理嵌入方式和模型要求,与设计新飞机或构建自主机器人的问题截然不同。
5.3 数字孪生(Digital Twin)作为核心框架
- 物理信息机器学习模型在工程上最有用的方向之一,是工程设计与工程过程优化。
- 数字孪生是整合以下要素的新框架:
- 机器学习模型;
- 物理模型;
- 实时或历史数据;
- 用于设计和优化工程系统。
- 后续课程将对数字孪生进行深入探讨。
六、对基准测试问题(Benchmarks)的新需求
6.1 与传统机器学习的差异导致需要新基准
- 经典机器学习领域的进步主要由以下要素驱动:数据可得性、算法开发、开源代码与计算资源。
- 但最终,经典机器学习的大部分进展是通过基准数据集与基准问题来加速和验证的。
- 如果要将机器学习算法真正应用于科学、工程、发现与设计,就需要面向物理系统的新型基准问题。
6.2 已有尝试与方向
- 讲师所在的AI Institute与动力系统团队提出了共同任务框架(Common Task Framework, CTF) ,由Nathan Kutz领导,这是一个正在积极推进的项目。
- 其他形式的基准包括:
- 闭环流动控制环境(closed-loop flow control environments);
- 用于测试算法的实验室硬件。
6.3 两个相辅相成的大问题
课程覆盖的“物理”与“机器学习”交叉领域,本质上存在着两个方向相反的核心问题:
- 在机器学习算法中强制执行物理规律,以提升性能(这是课程主要侧重的内容);
- 使用机器学习算法从数据中发现新的物理规律,例如:
- 脑科学领域:大脑测量技术日益先进,但缺乏描述大脑工作原理的方程,可否发现类似流体/材料力学那样的偏微分方程?能否发现复杂系统(如鱼群集体运动、疾病传播)中未知的物理规则?
总结
本次课程回顾了物理信息机器学习的全貌,强调以下关键结论:
- 物理信息机器学习就是用优化方法从数据中构建物理模型。
- 机器学习建模的五个标准阶段(问题定义、数据整理、架构设计、损失函数、优化)中的每一个阶段都可以嵌入物理。
- 在实践中,物理嵌入主要集中在架构、损失函数、优化算法三个环节,但这三个环节高度耦合、界限模糊,通常需要同时定制。
- 嵌入物理的两大核心动机分别是:降低训练数据需求和提升模型外推泛化能力;广义上,“物理”可以被视为让模型具备泛化能力的部分。
- 对称性、能量守恒等物理规律可以通过多种途径嵌入模型(架构、损失、约束优化,或其组合)。
- 工程应用(如超合金制造、流体力学、机器人学、数字孪生)对物理信息机器学习提出了与经典机器学习不同的数据、验证与约束条件,每个领域各有特殊问题需要针对性设计。
- 为推进物理信息机器学习,需要开发专门面向物理系统的新基准问题(如共同任务框架CTF),以规范研究和验证算法进步。