物理与机器学习混合课程:后续深度模块概览
本课程的核心宗旨是:机器学习并非魔法,它只是用优化方法从数据中构建模型的过程,而物理学可以嵌入这个过程的每一个环节,从而在数据更少的情况下获得泛化能力更强、更符合物理规律的模型。
课程整体背景与定位
- 本次内容属于“物理与机器学习”大型课程的介绍性速成营,预计是整个课程的前四到五小时部分。
- 这一部分旨在展示课程未来的走向,为后续深度模块进行预告和框架铺陈。
- 后续每个深度模块的时长从1小时到10小时不等,目标时长大致为4至5小时,有些模块可能扩展为完整课程。
- 课程的总体框架建立在这样的观念上:物理信息机器学习涉及两个对偶问题——将已知或部分已知的物理规律烘焙/强制加入机器学习算法中,以及从复杂系统的测量数据中发现新的物理规律。
核心要点
物理知识融入机器学习的两种路径
| 方向 | 含义 | 应用场景 |
|---|---|---|
| 强制/促进已知物理 | 将已知的偏微分方程、守恒定律、对称性或系统不变量嵌入机器学习模型 | 工程设计中需要模型推广到从未见过的新设计(如设计全新机翼)时,保证模型包含已知的流体动力学知识 |
| 发现新物理 | 从丰富测量数据中发掘尚未能写出方程的复杂系统的物理规律 | 神经科学、人类代谢等难以写出控制方程的系统,可能借助机器学习发现类似 F=ma 的新物理 |
- 已知物理知识的形式可以多种多样:偏微分方程、守恒律、对称性、系统不变量。
- 将已知物理规律嵌入模型的收益:通常能用更少的数据获得更好的模型,且模型往往泛化能力更强——这对工程设计尤为关键。
物理与机器学习的六个规划中模块
- 简约模型(Parsimonious Models)
- 物理信息神经网络(PINNs)
- 算子方法(Operator Methods)
- 对称性(Symmetry)
- 数字孪生(Digital Twins)
- 案例研究与基准(Case Studies and Benchmarks)
每个模块将深入探讨物理信息机器学习过程中不同阶段或多种阶段的嵌入方式。
详细解析
一、简约模型与模型发现
- 核心定义:大多数随时间演化的动态系统(包括流体、大脑、金融市场、气候、流行病学等几乎所有复杂系统)都由常微分方程或偏微分方程控制。这些方程可能具备高维、随机、非线性等特征。简约模型模块的核心在于如何利用机器学习和日益丰富的测量数据,纯粹从数据中学习微分方程。
- 关键问题:
- 是否能从行星运动数据中学到开普勒定律?
- 能否学到 F=ma?
- 能否根据水星近日点进动的偏差学到爱因斯坦的相对论修正?
- 现实意义:将这些原则应用到无人知晓答案的新问题上——能否从测量数据中为等离子体系统、颗粒材料或大脑构建模型?
二、物理信息神经网络(PINNs)
- 基本机制:在训练神经网络的标准损失函数之外,如果知道网络试图预测或重建的物理场(如流体速度场或随空间、时间变化的物理场)受偏微分方程控制,可以添加一个自定义损失函数,在训练过程中捕获并封装该物理规律。
- 主要优势:
- 添加物理信息损失非常容易;
- 通常可以用较少的数据完成训练。
- 典型应用案例:在聚变反应堆中,探测器只能放在等离子体表面(因为放入内部会融化或干扰等离子体)。有了表面点测量数据和控制系统的偏微分方程后,可以同时使用两类损失函数,从而在远离测量点的位置更准确地重建等离子体场、速度场或电磁场。
- 课程涉及内容:PINNs 的设计方式、训练方法、何时有效、何时失效、以及众多变体。作者表示这需要深入文献并亲自学习。
三、算子方法
- 核心转变:神经网络通常被视为万能函数逼近器——只要网络足够大、训练数据足够多,就能逼近任意函数。而算子方法将这一概念推广为:神经网络不仅能逼近输入-输出函数,还能逼近作用于函数的算子。
- 关键例子:微分方程的解就是一个算子,作用于初始条件或边界条件。
- 代表性架构:
- 深度算子网络(DeepONet);
- 傅里叶神经算子(Fourier Neural Operator);
- 神经隐式流(Neural Implicit Flow)。
- 待解答问题:这些方法在插值(interpolation)中有效吗?在外推(extrapolation)中是否会失败?需要多少训练数据?有哪些推广和扩展方向?
- 趋势判断:作者预计未来5到10年内算子方法的使用将显著增长。
四、对称性
- 为何重要:对称性是现实世界中编码物理规律的基础方式,是引导、偏置或约束机器学习模型使其更具物理性的重要方法。
- 数学基础:涉及等变性(equivariance) 概念——若神经网络 f 将数据 x 映射到 y,则网络关于对称群 G 等变的条件是:先应用 G 再应用 f,与先应用 f 再应用 G 的结果相同。
- 物理对应:平移不变性、旋转不变性等性质都适用于该数学框架中特定类型的对称群。
- 理论深度:涉及流形理论、李群等优美数学,大量数学物理历史建立在对称性之上——爱因斯坦深入思考过对称性;埃米·诺特(Emmy Noether)给出了关于对称性、不变性和系统简化的重要定理,如今可用于机器学习和数字孪生。
- 作者个人背景:作者本科在加州理工学院的第一间实验室导师是 Jerry Marsden,他是理解物理系统和数学/计算建模中对称性的先驱之一。许多在计算与分析物理时代发展的思想在当前机器学习时代同等甚至更加重要。
五、数字孪生
- 核心定义:构建“模型的模型”——其中一些模型基于物理,一些是机器学习模型,一些是混合模型。
- 关键功能:
- 用新数据更新模型;
- 用模型设计和优化新的工程系统;
- 构建主动学习和不确定性量化,以判断孪生模型应与物理资产保持一致还是可能产生分歧。
- 工程价值:整合多保真度(multi-fidelity)数据,构建可优化的替代模型(surrogate models),从不同数据来源中同时获得更低成本和更低误差,从而实现更快的设计周期、更低成本的设计流程,设计出更好的材料、火箭、风力涡轮机和飞行器。
- 作者观点:这正在改变工程设计的执行方式,而很大一部分建立在物理与机器学习的基础上。
六、案例研究与基准
- 案例研究:深入流体力学、材料发现、机器人学、制造系统等领域,观察理论(对称性、PINNs 等)如何在真实系统中产生差异。研究内容涵盖各种方法的细微差别、数据类型与数量、不同场景下“物理”的含义、哪些方法适用于数字孪生模型、哪些不适用。
- 参与方式:不只由作者一人讲授,将邀请拥有优秀案例研究的专家同事共同参与,内容介于教学与研究水平之间。
- 基准问题:迫切需要用于测试物理信息机器学习算法的基准问题。课程将投入时间梳理文献中现有基准,评估哪些基准适用于哪些类型的问题,并探讨五年后需要什么样的新基准。
方法与框架
机器学习建模的标准流程与物理嵌入
物理信息机器学习在建模各阶段的嵌入方式
- 总体框架基于一个核心观念:机器学习 = 用优化从数据构建模型。
- 构建机器学习模型存在若干标准阶段,物理可以在每个阶段嵌入,有时可以在多个阶段同时嵌入(前序课程中已展示)。
- 具体对应关系:
- PINNs 主要涉及损失函数的设计;
- 算子网络 更多涉及架构设计;
- 大多数模块会涉及机器学习建模过程中的多个要素。
课程参考资料
- 许多讨论内容与教材《Data-Driven Science and Engineering》(作者本人与 Nathan Kutz 合著)的章节相关。
- 该教材涵盖大量数学基础,是入门这些方法的良好起点。
- 其他内容将分散在课程讲义中,讲义完成后会在视频描述中提供链接。
总结
- 本视频是物理与机器学习大型课程的导入和路线图预览,属于最初级的概述模块。
- 已规划了六个深度模块(简约模型、PINNs、算子方法、对称性、数字孪生、案例研究与基准),每个模块时长不等,有些可能发展为独立完整课程。
- 作者强调这些是“正在筹备中”的主题,未来可能会有超出这六个模块的更多内容出现。
- 所有规划中的模块都服务于共同的目标:如何将物理与机器学习中的思想应用于实际工程、科学发现、设计和优化。
- 作者表达了高度的热情,很多主题是他过去深入研究过或一直希望学习的内容,并期待与学习者共同探索。
限制与待确认问题
- 当前内容仅为规划和预告,六个模块尚未完成制作,具体上线时间未说明。
- 每个模块的确切时长仍是浮动值(4-5小时的“目标”,某些模块可能达到10小时或扩展为完整课程)。
- 对称性模块可能独立发展为完整课程,并可能邀请外部专家参与(具体合作人选未确定)。
- 案例研究模块计划邀请专家同事贡献内容,具体讲师名单和案例内容尚未确认。
- 除上述六个模块外,作者预计会有更多未提及的模块,但具体内容没有透露。