返回
查看原链接原链接
Bilibili48分55秒 · —

物理信息机器学习 · 课程精华笔记

物理信息机器学习(Physics-Informed Machine Learning)讲座概述

物理信息机器学习位于物理知识与机器学习系统的交叉点,一方面将已知物理规律融入机器学习模型以提升性能,另一方面利用机器学习从数据中发现人类尚未写下的全新物理规律,是当前机器学习领域最重要的话题之一。

核心要点

讲座基本信息

  • 主讲人:Steve Brunton,华盛顿大学(University of Washington)教授
  • 系列定位:隶属于更大规模的训练营和短期课程体系,主题为物理信息机器学习
  • 本讲性质:该系列课程的概述性讲座(overview lecture)
  • 配套资源:由 Nathan Kutz 与 Steve Brunton 合著的教材 *Data-Driven Science and Engineering*(可免费下载PDF);视频描述中提供更多资源链接

物理信息机器学习的双重主题

  1. 将物理融入机器学习(Enforce physics into ML models):利用已知物理或部分已知物理(如对称性、守恒律、不变量)并将其"烘焙"到机器学习模型中,使模型性能大幅提升——以更少的训练数据学习更好的模型、获得更好的泛化能力。
  2. 用机器学习发现新物理(Discover new physics):利用测量数据(如星系运动、等离子体、生物系统的数据),借助计算机科学领域开发的机器学习方法,发现人类此前因系统复杂性而无法用经典方法写下的全新物理模型,如描述复杂系统的常微分方程和偏微分方程。

这两个方向本质上是对偶问题(dual problems)

为什么物理信息机器学习重要

  • 经典机器学习的进展速度惊人:曾经只存在于科幻中的事物已成为科学事实(如 Mona Lisa 从静态图像中"活过来"、DALL·E 2 根据提示词生成图像)。
  • 机器学习研究者在构建模型时常常忽视人类数百年来积累的物理知识,但过去五到十年间,人们越来越清楚地认识到:要在工程、自然科学、生物学等复杂系统上获得先进性能,必须将物理融入机器学习过程。
  • 实际应用场景包括:设计全新飞行器或超材料(用于发动机、机翼、机身)、预测和建模流体流动与湍流(对飞行器、赛车、运输船、风力涡轮机设计至关重要)、理解气候变化与天气、机器人学与自主系统的数字孪生等。
  • 对研究者的价值:物理信息机器学习将成为未来解决真实世界问题的必备工具。

机器学习本质的回顾

  • 机器学习本质上是从数据构建模型的过程,使用优化和回归技术。
  • 人类从数据构建模型的实践历史悠久(如早期行星模型就是从观测数据拟合而来),但如今数据规模更大、优化算法更先进,这解释了机器学习快速进步的原因。

详细解析

示例:钟摆的物理信息机器学习

实验室墙上安装了一个钟摆,摆尖装有加速度计和LED灯,可以通过视频记录摆动过程。

  • 传统机器学习做法:拍摄钟摆视频,使用自编码器神经网络将视频降维到最小潜状态(latent state,图中红色向量表示),再从这些极少量变量重建视频。由于系统是低维的(可能由角度θ及其角速度描述),朴素的机器学习只是寻找能压缩数据的坐标。
  • 物理信息机器学习做法:不仅要学习压缩视频的坐标,还要学习描述这些坐标如何随时间演化的微分方程——例如阻尼摆方程。具体有两种途径:
  • 若已知方程,可将其"烘焙"到潜状态中,帮助学习正确的坐标;
  • 或者纯粹从测量数据中学习这个微分方程。

两个关键要素(教科书方法视角):

  1. 学习一个良好的坐标系(θ),用于表示钟摆运动——θ远优于摆尖的x、y位置坐标;
  2. 在学习坐标后,学习运动方程(描述系统随时间演化的微分方程)。

因此,物理信息机器学习通常意味着:学习正确的坐标 + 学习控制方程或物理定律,这两种元素可以来自数据,也可以预先融入模型中。

机器学习的五个阶段(本研究系列的组织框架)

讲座提出,构建经典机器学习模型的过程可分为五个阶段(作者强调这个划分约80-90%准确,并非完美,但作为组织课程的指导方针非常有效)。每个阶段都为嵌入物理或发现物理提供了独特机会。

阶段一:确定问题(Problem Formulation)
  • 是什么:决定要建模什么——定义输入和输出,明确要建模的关系。
  • 例子:有猫和狗的图片,构建分类器将它们标记为猫或狗。
  • 如何嵌入物理:如果要建模的对象本质上是物理系统(如熔岩灯、钟摆、流体流动、材料加工过程),在问题设定阶段就已经在进行"基于物理的机器学习"。通过巧妙设置问题本身即可嵌入物理,例如:
  • 学习钟摆上的力(F=ma 已蕴含在问题中);
  • 学习哈密顿量(Hamiltonian)或拉格朗日量(Lagrangian);
  • 学习自由能势(free energy potential)。
阶段二:收集与整理数据(Data Curation)
  • 是什么:收集用于训练模型的训练数据,决定什么数据能提供信息、如何收集。
  • 成本考量:数据整理通常是流程中最昂贵的环节之一——数据集的获取成本有时可达数百万甚至数千万美元。
  • 如何嵌入物理
  • 数据本身来自物理系统,收集过程天然嵌入了物理。讲座称之为"Google式的物理嵌入方式"——如果收集了足够多的自然世界数据,模型"必须"学会 F=ma,甚至最终学会 E=mc² 来解释所有数据。但这依赖于近乎无限的数据量(非常昂贵),而科学家和工程师通常没有这种奢侈,更多的是目标明确、有限、狭窄的数据集。
  • 数据增强(Data Augmentation):如果认为物理不依赖于旋转或平移角度(即系统对某种对称性不变),可以按该对称性变换生成额外副本加入数据。例如,构建分类 Prius 和 Ford 皮卡的模型时,可以对图像进行旋转、平移和缩放,因为这些变换不应影响分类结果。这是将对称性和不变性(另一种物理形式)嵌入数据整理过程的常见方法。
  • 坐标系的选择:坐标对物理系统的机器学习影响巨大。以 Kutz 和 Brunton 的经典卡通图为例:右图是地心视角(geocentric view),从地球中心视角看行星运动,在这个坐标系中很难学习物理和模型;而将太阳放在中心的坐标系(日心视角)中,数据更有意义,更容易从数据构建模型。因此,整理数据往往意味着找到正确的坐标系——有时是学习出来的,有时通过物理先验知识来强制设定。
阶段三:设计架构(Architecture Design)
  • 是什么:选择一种架构(如特定类型的神经网络、SINDy 模型、自编码器等),期望它能很好地表示输入与输出之间的函数关系。
  • 领域惯例:图像分类用卷积神经网络,时间序列用循环神经网络等。
  • 架构的"动物园":讲座强调两点:
  1. 并非所有机器学习都是神经网络——大量其他非神经网络架构也可用于从数据学习模型;
  2. 即使仅在神经网络领域内,也存在大量架构选择。
  • 如何嵌入物理
  • 拉格朗日神经网络(Lagrangian Neural Networks):如果系统具有欧拉-拉格朗日方程框架(如双摆等机械系统),可使用此类特定架构使系统保持能量守恒。
  • 简约性(Parsimony)原则:物理模型应尽可能简单以描述数据,但不更简单——SINDy 自编码器(SINDy Autoencoder)即用自编码器学习良好坐标系,再用某种模型类中的稀疏模型描述数据。这一原则从亚里士多德到爱因斯坦传承了两千年,是判断系统是否"物理"的重要标准。
  • Julia Ling 及其合作者的湍流闭合模型:这是现代物理信息机器学习时代较早且最受喜爱的架构之一。他们使用神经网络构建湍流流体流动的闭合模型,架构不同于标准深度神经网络——增加了一个辅助张量输入层,使网络对伽利略变换(Galilean transformations)不变。因为在某些旋转和平移下流体流动应保持不变,通过架构选择使模型必须具有这种不变性,效果远超未融入该性质的模型。
  • 重要评论:Brunton 提及与妻子 Bing 的对话——选择使系统更"物理"的架构被称为归纳偏置(inductive bias),是一种不直说但强烈引导或影响下游机器学习过程的偏向。讲座后续会进一步讨论。
阶段四:构建损失函数(Loss Function Design)
  • 是什么:设计某种目标函数,评判模型是否做得好。通常包含模型输入输出预测与实际训练数据之间的误差项,也可添加各式正则化项使模型更稀疏或更平滑。
  • 研究现状:阶段三和四集中了当今机器学习及物理信息机器学习的大部分现代研究。
  • 如何嵌入物理
  • 通过额外的正则化项或损失函数项促进物理性质——例如 L1 范数或 L0 范数量化稀疏性和简约性。
  • 物理学信息神经网络(Physics-Informed Neural Networks, PINNs):最著名的例子。这是一个标准的前馈深度神经网络,将输入(如空间和时间)映射到输出(如流体流场)。通常只做平均训练数据上的预测精度损失;PINN 的做法是从输出数据计算偏微分方程中的各项,将系统应满足的实际偏微分方程作为另一个损失项加入损失函数。如果已知物理(如系统散度为零、满足 Navier-Stokes 方程或弹性梁方程),将其加入损失函数可显著提升学习性能——用更少的数据获得更好的模型性能。系列将用整个讲座专门讨论此主题(含代码、示例、案例研究)。
  • 注意:几乎所有前述架构都有对应的自定义损失函数用于训练,阶段三和四有时会混合在一起。
阶段五:优化(Optimization)
  • 是什么:选定架构和损失函数后,选择某种优化算法(如 Adam 优化器、随机梯度下降类方法)来调整架构参数,以最小化损失函数在训练数据上的平均值。
  • 关键重申:架构是可用于表示所需输入输出关系的函数类别,其参数在神经网络中就是所有连接的权重;训练即使用优化调整这些参数以学习某种输入输出函数。
  • 如何嵌入物理——促进(promote)与执行(enforce)的对比
  • 损失函数方案的局限:在损失函数中加物理项只是"建议"或"促进"物理被满足,但它始终在"对抗"低模型误差的目标——这是两个有时互相冲突的目标(dueling objectives),优化过程中损失函数中的物理项不会归零。
  • 约束优化方案:通过优化可以约束和强制物理以更高精度、更严格的方式被满足。例:在可压缩流体流动的机器学习建模中,已知某些对称性和性质(如不可压缩流中能量守恒),可以用约束最小二乘(constrained least squares)拉格朗日乘子(Lagrange multipliers) 改变优化问题,使这些约束在每次优化时都精确满足到数值精度。
  • 权衡:这种方法更复杂、能更好地确保物理满足,但需要更多人为工作来构建优化函数。
  • 物理信息 DMD(Physics-Informed DMD):另一示例——方法将解约束在满足某种对称性(如量子势阱的六角势具有旋转和反射对称群)的解流形上。系列将有专门短期课程讨论对称性及如何将对称性融入机器学习、如何从数据中提取对称性。

核心概念:什么是"物理"

  • 讲座反复强调要讨论的问题:物理到底是什么?为什么要把物理烤进系统?从数据学习物理意味着什么?
  • 对称性与不变量:物理经常通过对称性体现——例如人体是双侧对称的(镜像翻转不变);大量物理系统具有平移对称性、旋转对称性等。在药物发现与蛋白质折叠、流体流动与机械系统、材料系统、量子系统中都存在对称性。对称性、守恒律和不变量是封装物理的方式,在系列中将反复出现。
  • 简约性(Parsimony):模型应尽可能简单以描述数据,但不更简单。
  • 科学史视角:从占星术与天文学的分野、炼金术与化学的分野中可以看到与现代机器学习阶段的平行——通过将机器学习应用于已知答案的物理系统,可能从"炼金术"(现代机器学习中的直觉+试错)走向更接近"化学"的原理化阶段。

机器学习研究的"炼金术"现状与原理化愿景

  • 大量研究者在选择神经网络架构时类似于现代炼金术(modern-day alchemy):通过直觉、阅读Reddit帖子、观察朋友的做法等形成对何种架构可能有效的想法,然后尝试大量架构,有时成功有时失败("有时能把铅变成金子,有时不能")。
  • 重要洞见:将机器学习应用于已知答案的物理系统,可以学到关于机器学习算法和模型本身的更多原理——何时、如何针对特定问题使用合适的构建块。这是从"炼金术"走向"化学"的路径,也是 NSF 资助的 AI Institute in Dynamic Systems 的主要目标之一。
  • 该研究所致力于理解:如何将物理嵌入机器学习?如何用机器学习学习新物理?如何在各种应用领域解决工程任务?如何将猜测-检查的炼金术模式转变为更原理化的方法?这是一个多单位合作项目,且比该单一研究所更广泛。

应用领域概览

  • 流体流动与湍流建模:飞行器、赛车、运输船、风力涡轮机等设计的关键。
  • 形状优化(Shape Optimization):设计具有正确升阻比和结构特性的机翼——这是一个大规模多目标优化问题,与训练机器学习模型本身(也是多目标优化问题)天然契合。
  • 材料设计:设计用于航空等下游应用的复合材料或合金——同样是多目标优化、超高维设计空间。
  • 数字孪生(Digital Twins):对物理资产(如飞行器、工厂车间、复合材料烘烤过程)的"活的"数据驱动模型,具有混合物理与数据驱动特征。要求:模型尽可能准确;随新数据收集而更新;具有不确定性估计以知晓模型优劣及最不确定处(从而知道如何采集更多数据改进)。原则上可实现更便宜、更快、更安全的工程设计。引用 Kaptin 等人发表在 *Nature Computational Science* 上的论文图示(展示物理资产与数字孪生的双重性)。系列将有完整短期课程讲解数字孪生工程——如何构建数字孪生模型、如何用于设计、测试和评估。
  • 机器人学与自主系统:快速发展的领域,数字孪生是重要概念。
  • 药物发现与蛋白质设计:蛋白质折叠和化学过程受物理控制。
  • 气候科学:理解天气现象、模式和气候趋势——与湍流相关但背景不同。
  • 基准系统(Benchmark Systems):经典机器学习(图像、自然语言处理)的进步很大程度上归功于社区共享的优质基准问题和数据集,研究者无需每次创建基准即可专注算法本身。物理信息机器学习同样需要:
  • 动力学系统的静态数据集(系统随时间演化,但收集后数据不变;可来自模拟或实验);
  • 交互式控制框架的基准问题(需要能与模拟交互、用机器学习模型闭环控制流体等);
  • 真实的生活网络物理系统(cyber-physical systems,如实际实验室设备),可实时训练机器学习模型,更接近数字孪生概念。

系列将提供完整短期课程,讨论现有基准、物理信息机器学习基准所需特征、如何测试模型、是否存在真值(ground truth)等问题。


方法与步骤

用五阶段框架实现物理信息机器学习的通用流程

  1. 阶段一——设定问题:明确要建模的输入、输出和关系。若系统是物理的,通过问题陈述(如学习力、哈密顿量、拉格朗日量、自由能势)即可嵌入物理。
  2. 阶段二——整理数据:收集训练数据;如果系统具有已知对称性/不变性,通过数据增强(旋转、平移、缩放等变换)将对称性嵌入数据;选择或学习合适的坐标系以简化建模。
  3. 阶段三——选择架构:根据已知的物理性质选择具有相应归纳偏置的架构(如守恒系统选 Lagrangian 神经网络、流体流动选具有伽利略不变性的架构、追求简约模型可用 SINDy 自编码器)。
  4. 阶段四——设计损失函数:除数据拟合误差外,将已知物理方程(如 PDE)作为正则化损失项加入损失函数(PINN 方法);用 L1/L0 范数量化简约性。
  5. 阶段五——优化训练:用优化算法调整架构参数最小化损失函数;如需要严格满足物理约束,可采用约束最小二乘或拉格朗日乘子方法,使物理约束在每次优化中都精确满足。

讲述中的例子:流体流动的模型降阶

  • 问题:将复杂流体模型简化为更简单的模型,运行更快、可在较小的计算机上运行。
  • 数据:收集高维测量数据(如全复杂度数值模拟的输出)。
  • 架构:自编码器架构——从高维降到低维,学习低维潜状态 z 使高维状态能被重建;同时学习潜状态上的动力学系统(微分方程)。这样比运行完整模拟快得多(可能实时运行),同时保留系统中大部分物理。
  • 损失函数:三个神经网络各有参数 θ₁、θ₂、θ₃,损失函数量化模型对数据的拟合程度。
  • 优化:调整所有 θ 使损失函数在训练数据上的平均值最小化。

案例与数据

流体流动案例(阶段二)

  • 数据示例:加迪斯岛(Guadalupe Island)上方的云层形成(地球物理流体流动)。
  • 若物理不依赖于旋转角度或平移,可在数据整理过程中通过变换增加额外数据副本——旋转、平移等。

Julia Ling 等人的湍流闭合模型(阶段三)

  • 使用神经网络构建湍流流体流动的闭合模型。
  • 在标准深度神经网络架构基础上增加辅助张量输入层。
  • 使网络对伽利略变换不变(流体在旋转和平移下应保持不变)。
  • 效果:远比未加入该性质的模型表现好。

PINN 的物理信息损失(阶段四)

  • 标准深度前馈神经网络将输入(空间和时间)映射到输出(如流体流场)。
  • 从输出数据计算偏微分方程中的各项,将系统应满足的偏微分方程作为额外损失项。
  • 若已知物理(散度为零、满足Navier-Stokes方程或弹性梁方程等),加入损失函数可显著提升学习性能、减少所需数据量。

优化强制物理的案例(阶段五)

  • 流体流动建模:已知不可压缩流中能量守恒等对称性和性质。
  • 方案A:构建包含模型误差和能量守恒必要约束的损失函数。
  • 方案B:使用约束最小二乘使约束在每次优化时精确满足到数值精度。

量子势阱案例(阶段五)

  • 六角势的量子势阱具有旋转和反射的对称群。
  • 物理信息 DMD 方法将解约束在满足该对称性的解流形上。

美国国家科学基金会(NSF)AI Institute in Dynamic Systems

  • 由 NSF 资助的 AI 研究所,聚焦理解如何将物理嵌入机器学习系统、如何用机器学习学习新物理、如何解决各类应用领域的工程任务。
  • 目标是推动从"炼金术"模式(猜测+试错)走向更原理化的方法。
  • 这是一个多方合作项目,规模超出该研究所本身。

限制与待确认问题

  • 作者对五阶段框架的局限性声明:该划分并非100%准确,作者估计最多80-90%准确,更适合作为组织课程和思考流程的指导方针。
  • 损失函数方案的局限:将物理作为损失函数项只是"促进"物理,而非"强制"物理——物理项与模型误差项是相互竞争的目标,在优化过程中不会归零。若要严格保证物理满足,需要使用约束优化方法(但需要更多人为工作量)。
  • 数据成本限制:通过大量数据"隐含"学习物理的方法("Google方式")依赖近乎无限的数据量,科学家和工程师通常没有这种条件,更多需要目标明确、有限、狭窄的数据集。
  • 课程进度不确定性:讲座提及的配套资源讲义和笔记"在视频发布时"预计可用,具体取决于当时进展。
  • 未来计划不确定:讲座表示希望未来在华盛顿大学提供可获学分的正式课程,属于计划而非已确定事实。

行动清单(本系列后续内容预告)

  • 深入研究五阶段中的每个阶段:每个子问题将有完整视频,讲述如何在阶段一、阶段二及后续各阶段嵌入物理。
  • 架构专题:将花费约5-10小时讲解市场上各种架构及其相应损失函数,重点包括:
  • SINDy 与库回归(library regression)及简约符号回归建模;
  • 物理信息神经网络(PINNs);
  • 深度算子网络(Deep Operator Networks);
  • Fourier 神经算子(Fourier Neural Operators)与通用算子方法;
  • ResNets 和 UNets 等。
  • 每个主题将有完整视频或系列,覆盖损失函数构建、训练方法、适用应用、代码实现。
  • 对称性专题:预计有完整短期课程,讨论对称性及如何将对称性融入机器学习、如何从数据中提取对称性。
  • 基准问题专题:完整短期课程讨论现有基准、物理信息机器学习基准的特征需求、如何测试模型、真值问题。
  • 数字孪生工程专题:完整短期课程讲解如何构建数字孪生模型并用于更好的设计、测试和评估。
  • 应用案例研究:覆盖流体流动、湍流、形状优化、材料设计、数字孪生、机器人学、药物发现、蛋白质设计、气候科学等。
  • 历史视角的融入:从占星术与天文学、炼金术与化学的分野中学习现代物理信息机器学习的方法论启示。

总结

物理信息机器学习的核心观点可概括为:物理知识不应在构建机器学习模型时被丢弃,而应通过五阶段流程(问题设定、数据整理、架构设计、损失函数、优化)中的任何一个或全部环节嵌入模型;反过来,机器学习也能从测量数据中发现人类尚未发现的物理规律。这两个方向互为对偶。

  • 生产力的提升:嵌入已知物理可以大幅减少所需训练数据量、提高模型性能与泛化能力;约束优化方法可以在更高精度上"强制"物理满足,而损失函数方法只能"促进"。
  • 对称性、守恒律和不变量 是反复出现的物理封装形式;简约性是衡量物理模型的核心原则。
  • 科学史视角:当前机器学习研究中类似"炼金术"的尝试-纠错模式,有望通过物理信息方法走向更"化学"的原理化阶段——前提是使用已知答案的物理系统作为测试平台,以学习机器学习方法本身的底层原理。
  • 这是一个充满开放问题和未解决挑战的领域,大量价值数十亿美元的行业有望在未来几年被这些技术转型——"现在是进入这一领域的最佳时机"。