物理信息机器学习第三阶段:设计架构(Architecture Design)
本讲核心结论:在物理信息机器学习中,选择架构的本质是约束可用于描述输入-输出映射的函数空间,通过将物理先验(如低维性、稀疏性、对称性、不变性、守恒律)内建于架构中,可以显著减少所需数据并提升模型的泛化能力。
一、引言:从数据到物理的桥梁
本讲是物理信息机器学习流水线的第三阶段——设计架构。在此之前已经讨论了数据表示与特征工程等问题。架构设计是作者最喜欢的环节之一,后续会有大量时间深入介绍各种可用于发现物理规律或嵌入物理约束的机器学习架构。
在进入具体内容前,需要明确本讲中“物理”的含义。作者借用维基百科的定义(涉及物质、能量和变化),但认为这不足以作为工作定义。在机器学习语境下,物理具有以下三个关键特征:
- 可解释性与泛化性(Interpretability & Generalizability):经典物理定律(如 F=ma,E=mc²)通常非常简洁、可解释,并且能够适用于极其广泛的情境(例如同一物理定律既描述苹果下落,也描述火箭登月)。这种泛化能力是物理的标志性特征,不仅限于物质和能量,也适用于大脑工作方式、蚁群或蜜蜂群体的行为等复杂系统。
- 简约性与稀疏性(Parsimony & Simplicity):爱因斯坦的名言——“一切事物都应尽可能简单,但不能更简单”(Everything should be made as simple as possible, but not simpler)——是物理学两千多年来的黄金标准(从亚里士多德到爱因斯坦)。简约的模型更美、更可解释,且由于避免过度拟合而倾向于更好地泛化。在科学史上,从天文学取代占星术、化学取代炼金术,每一次重大进展都伴随着描述变得更简单、更普遍。
- 对称性、不变性与守恒律(Symmetries, Invariances & Conservation Laws):几乎所有的偏微分方程(PDE)都源于某个量的守恒(如质量、动量、能量守恒)。宇宙中还存在基本的不变量,它们带来数据中的对称性。这些对称性和守恒律是物理的核心原则,可以嵌入机器学习算法,或通过机器学习算法进行学习。例如,钟摆的物理规律不会因为空间平移而改变,流体流动不会因为旋转而改变。
本讲聚焦于“架构”这一环节,但相同的原则也适用于后续的损失函数设计和优化算法选择。好的模型应同时追求可解释性、泛化性、简约性,并尽量内置已知的对称性和守恒律。
二、架构的本质:约束函数空间
2.1 从数据到函数映射的一般框架
任何机器学习模型通常都试图学习一个函数 *f*,将输入 *x* 映射到输出 *y*:
- 对于神经网络,*y = f<sub>θ</sub>(x)*,其中 *θ* 是可调的权重参数。
- 对于稀疏识别非线性动力学(SINDy),输入是系统状态,输出是状态的时间导数,而 *θ* 是所选择库中各项的系数。
本质上,机器学习架构定义了可供搜索的函数空间。未约束的函数空间(如希尔伯特空间,由傅里叶基展开)过于庞大,充满了无限多种可能的函数。架构的作用就是通过特定的结构设计,将可表示的函数限制在一个有意义的子集内,这个子集通常具有某些期望的属性(如物理合理性)。
2.2 架构与损失函数的耦合
架构和损失函数密不可分:很多架构需要配套的定制损失函数来训练,而有些损失函数又依赖特定的架构实现(如自动微分)。例如,自动编码器需要自定义损失函数来促进低维表示;物理信息神经网络(PINNs)主要依赖损失函数,但其架构必须支持自动求导以计算PDE残差。
2.3 神经网络动物园(Neural Network Zoo)
来自 Nathan Kutz 和书籍《Data-Driven Science and Engineering》中的经典图(灵感源自艾萨克·阿西莫夫研究所),展示了各种常见架构的卡通示意,包括自编码器(Autoencoder)、生成对抗网络(GAN)、深度循环网络等。该图已过时五年,仅代表当时架构的一小部分。如今架构种类极其繁多。
2.4 神经科学对架构的启发
许多现代架构受到大脑和神经系统结构的启发。例如,圣地亚哥·拉蒙·卡哈尔手绘的海马体神经元结构图展示了多尺度、跨区域连接、不同计算模块等复杂特征。视觉皮层启发了卷积神经网络,而神经科学和机器学习正共同演化,未来会出现更多神经启发计算的内容。
三、本课程将覆盖的物理信息架构概览
本课程后续将深入讲解十余种重要的架构,每种都会配合代码和案例。这里列出主要类别,并非完整目录:
| 架构名称 | 类型 | 关键物理先验/优点 |
|---|---|---|
| ResNet(残差网络) | 深度神经网络 | 跳跃连接使其近似于数值积分器(如欧拉积分),适合时间序列和动态系统 |
| UNet | 编码器-解码器 | 隐式多尺度结构,适合自然图像、超分辨率、图像分割,也用于扩散模型 |
| 算子网络(Operator Networks) | 傅里叶神经算子等 | 基于物理世界多尺度且常在傅里叶域中紧凑表示的事实,加速训练、减少数据 |
| SINDy(稀疏非线性动力学识别) | 广义线性回归(非神经网络) | 通过构建候选函数库,使用稀疏优化找到最简洁的微分方程,体现简约性 |
| PINNs(物理信息神经网络) | 神经网络 + 物理约束损失 | 通过自动微分计算PDE残差并加入损失,强制满足守恒律等物理规律 |
| 拉格朗日 / 哈密顿神经网络 | 神经网络 | 将能量守恒和力学结构(拉格朗日/哈密顿形式)内置到架构和损失中 |
| 图神经网络(GNN) | 图结构网络 | 假设局部物理相似,适合多体系统、分子动力学、流体模拟等 |
| 等变神经网络 | 一般架构 | 通过对称群构造,使模型对旋转/平移等变换具有不变性或等变性 |
这些架构都隐含了某种物理假设:低维性、稀疏性、多尺度性、对称性等。本讲只做概览,后续每类都有专门的深入课程(例如 SINDy 有约5小时的材料)。
四、架构促进物理性的经典案例
4.1 案例:自动编码器 + SINDy 用于钟摆
问题背景:一个钟摆的原始数据是视频,即高维像素时间序列(可能上百万像素)。人类能够轻易从中提取出一个角度 θ 和角速度 θ̇ 这样低维的关键变量。
架构选择:
- 自动编码器(Autoencoder):通过压缩瓶颈层,强制将高维数据压缩到低维潜变量,假设物理本质是低维的。
- SINDy:在潜空间学习控制动力学演化的微分方程(如钟摆的 F=ma 形式),使用候选函数库和稀疏回归(如 Lasso)寻找最简洁的右端项。
关键贡献:华盛顿大学的 Kathleen Champion(与 Nathan Kutz 和 Steve Brunton 合作)在名为“Combining autoencoders and SINDy”的论文中,将深度自动编码器与 SINDy 结合,共同学习低维坐标和对应的动力学模型。这种方法同时促进了物理学的两个核心属性:低维性与稀疏性(简约性)。
注意:虽然这是架构层面的推动,但仍需配套的定制损失函数(如重构误差 + SINDy 误差)来训练模型。
4.2 案例:基于张量输入层实现伽利略不变性的湍流闭合模型
背景:工业流体模拟(如汽车、飞机外部流场)因计算量巨大,常采用雷诺平均纳维-斯托克斯(RANS)方程,但其中关键的雷诺应力需要闭合模型。精确预测雷诺应力是困扰领域超过半个世纪(实际更久)的开放问题。
方法:Julia Ling 等人在论文中设计了一个专门的深度神经网络(见论文中的 panel b),使用了定制张量输入层。通过这种架构选择,所有可表示的函数天然满足伽利略不变性(Galilean invariance)——即物理规律在任何惯性参考系下保持不变(无论是静止的湍流箱还是匀速运动的湍流箱,闭合项形式不变)。
优势:由于不变性被建筑性保证,模型无需通过数据增强来学习这种不变性,因此训练所需数据更少,且泛化能力更强。这是“将物理内建到架构”的典型范例。
4.3 案例:图神经网络模拟复杂流体与弹性体
核心思想:假设局部物理规律相似——一个微小流体元胞的物理行为与另一个元胞类似。因此不需要用巨大的网络模拟整个体素,而可以用一个较小规模的图神经网络来学习局部的相互作用规则。这能够高效准确地模拟多种流体、弹性体及复杂的偏微分方程系统。这是作者本人也希望深入研究的方向。
五、对称性、不变性与等变性:物理信息架构的核心数学工具
5.1 不变性(Invariance)
定义:若对输入 *x* 施加一个对称变换 *g*(例如旋转、平移、缩放),然后输入给模型 *f*,得到的输出与先让模型处理原始输入再变换输出的结果相同,即: *f(g·x) = f(x)* 例如,将一张狗的图像旋转30度,图像分类器仍然输出“狗”。物理规律不因旋转、平移而改变。
5.2 等变性(Equivariance)
定义:若对输入施加对称变换 *g* 后再通过模型,得到的输出等于先通过模型再对输出施加相同的变换,即: *f(g·x) = g·f(x)* 此时变换 *g* 与模型 *f* 可交换(commute),在数学上称为可交换图(commutative diagram)。适合输出与输入空间保持几何关系的问题,如图像分割、坐标回归等。
5.3 群论与李群框架
对称变换构成对称群(或李群)。群论和李群理论提供了何时函数与对称群可交换的充分必要条件,从而指导我们设计满足特定等变性的神经网络。
5.4 实际意义与效果
- 卷积神经网络天然促进平移不变性。
- 现代研究(如 Max Welling、Tess Smidt 等)已经展示如何为自编码器等架构构建任意的对称群等变性。
- 若模型通过架构自动满足等变性,则无需通过数据增强(旋转/平移样本)来学习不变性,可大幅减少所需数据量,并显著提升泛化能力。
六、架构选择的原则与总结
6.1 架构选择的总体原则
- 架构不是万能的银弹,而是对函数空间的约束。
- 选择架构时,应尽可能内置已知的物理规律:低维性(如自动编码器)、稀疏性(如SINDy)、对称性(如等变网络)、多尺度性(如UNet)、时间步进性(如ResNet)、局部交互性(如图神经网络)等。
- 架构与损失函数、优化算法紧密耦合,往往需要联合设计。
6.2 本讲提到的相关研究者
- Kathleen Champion(华盛顿大学博士生,与 Nathan Kutz 和 Steve Brunton 合作)
- Julia Ling(湍流闭合模型)
- Max Welling(等变网络)
- Tess Smidt(等变网络)
6.3 后续课程预告
接下来将讨论损失函数与优化(第四阶段),并深入各类架构的详细案例。如果观众有兴趣了解特定架构,很可能在课程中得到覆盖。
七、行动清单
- 回顾传统物理中“物理”的定义,明确本讲义中物理的三个关键属性(可解释/泛化、简约/稀疏、对称/守恒)。
- 理解“架构 = 约束函数空间”的观点,并尝试用此框架分析一个简单模型。
- 阅读 Kathleen Champion 论文,了解自动编码器 + SINDy 的组合流程。
- 阅读 Julia Ling 论文,理解张量输入层如何实现伽利略不变性。
- 区分不变性与等变性的数学定义及实际应用场景。
- 关注后续关于损失函数和具体架构的深度讲解(尤其 SINDy、PINNs、等变网络)。