返回
查看原链接原链接
Bilibili44分47秒 · —

物理信息机器学习:第一讲笔记

物理信息机器学习(Physics-Informed Machine Learning)第一讲:如何定义问题(Deciding on the Problem)

核心结论: 在物理信息机器学习的整个流程中,“决定要建模什么问题”(即问题定义阶段)是最基础、也最重要的一步——决定模型的目的、用途与物理约束,决定了后续所有数据、架构、损失函数与优化选择的走向;机器学习并非无所不能的“魔法”,必须结合对物理系统的已有认知来判断哪些问题可解、值得解,并避免用复杂模型解决简单问题。


核心要点

  • 本讲聚焦于机器学习流程的第一阶段——决定问题(Deciding on the Problem),即明确“我们到底要建模什么、模型的目标是什么”。
  • 机器学习的构建不能脱离科学方法与工程设计流程——设计机器学习实验,与设计物理实验或数值模拟实验在原则上是同构的。
  • 一个糟糕的问题定义会导致整个流程的浪费;一个清晰、物理上合理的问题定义会让后续训练变得相对简单。
  • 人类必须负责决定“什么是对的模型、什么保真度是有用的、如何在下游使用它”;模型本身只能“给出答案”。
  • 引用毕加索名言:“Computers are useless. They can only give you answers.(计算机是无用的,它们只能给出答案。)”——机器学习模型同样如此,它们只能拟合数据,提出正确问题是人类的任务。

详细解析

一、问题定义在机器学习流程中的地位

  • 机器学习包含五个主要阶段,全部阶段都可能受益于嵌入物理知识,同时也可以借助这些阶段来学习物理规律。五个阶段包括:决定问题、获取数据、选择架构、设计损失函数、优化求解。本讲只深入探讨第一阶段。
  • 问题定义不是一次性完成的线性步骤:实际上,研究者经常沿着流程向下推进(明确问题→获取数据→选择架构→训练模型),在训练后发现模型行为不符合预期或性能不足,从而返回并修正问题定义。这是一个反复迭代的过程。
  • 数据可用性(哪些数据便宜、哪些昂贵、数据量多少)与架构选择都可能迫使你重新定义问题。例如发现缺少高分辨率训练数据时,可能需要把超分辨率任务改为其他可行目标。
  • 与经典工程和科学流程的类比:在设计新系统(如iPhone、赛车、飞行器)时,我们用实验和数值模拟来指导设计;机器学习实验的设计逻辑与此完全相同——先有假设,再设计数据获取与模型构建,验证后调整。

二、为什么需要机器学习模型:四大动机

在决定是否用机器学习时,首先要回答:为什么要用机器学习模型? 训练模型耗时且数据昂贵,必须明确其必要性。物理信息机器学习主要针对由物理规律支配的系统(如材料设计、飞行器设计、湍流建模等),适用动机可分为四类:

动机说明典型场景
未知物理人类尚未掌握系统的控制方程神经科学、流行病学、气候系统中缺失的物理
昂贵物理物理原理已知,但第一性原理模拟成本过高流体模拟、全尺度材料模拟、蛋白质折叠
复杂多物理多尺度、多物理耦合超出传统解析或仿真能力云物理、多相流、行星系统(含潮汐力)
系统随时间变化模型需要随新数据持续更新数字孪生、设备老化跟踪
2.1 发现新物理(Learning New Physics)
  • 是什么:用机器学习从大量观测数据中提炼出尚未被人类发现或写出的物理规律。
  • 为什么重要:许多系统(大脑、流行病、气候)缺乏第一性原理控制方程,但拥有海量数据;机器学习可以弥补人类尚未能推导出的物理。
  • 案例:从天文观测数据中发现开普勒定律甚至牛顿第二定律(F = ma);在聚变反应堆等场景中,用数据发现现有模型无法解释的新物理,从而改进模型。
  • 说明:本讲作者(讲座者)的实验室及合作者团队的主要研究方向即为此领域。
2.2 加速已知但昂贵的物理(Expensive Physics)
  • 是什么:当物理原理已知且可以模拟,但代价极高时,用机器学习构建替代模型(surrogate model),在保证足够精度的前提下大幅提速。
  • 典型应用:加速药物发现、材料设计、流体模拟;用于设计优化和参数扫描等需要反复调用的场景。
  • 关键判断:如果物理已知且模拟便宜,就不需要机器学习。
2.3 捕捉多物理相互作用(Multiphysics Interactions)
  • 是什么:系统涉及多种物理过程和多尺度耦合,单凭解析方法或传统仿真难以全部覆盖。可用机器学习来建模已理解的部分之外的偏差(discrepancy) ,或连接不同保真度的模型。
  • 案例(云物理) :本讲引用加州理工学院 Tao Schneider 研究组的工作——云的形成涉及冰晶、凝结、降水等极其复杂的多尺度多物理过程,人类远未从第一性原理完整建模。机器学习可以帮助捕捉这类复杂性。
  • 方法:对已理解的部分保留物理模型,用机器学习来建模“剩余误差或差距”。
2.4 更新模型以适应变化(Changing Systems / Digital Twins)
  • 是什么:物理规律(如 F = ma)不变,但现实系统的行为随时间变化(轴承润滑下降、温度变化、环境扰动等)。机器学习模型可用新数据持续更新。
  • 典型应用数字孪生(Digital Twin) 建模——对随时间变化的物理资产建立并更新其数字表示。
  • 为什么重要:传统物理模型无法自动适应系统状态的变化;机器学习模型具备持续学习与更新的能力。

三、常见的物理信息机器学习问题类型

3.1 超分辨率(Super Resolution)
  • 是什么:从低分辨率图像/数据中,利用大量高低分辨率配对数据的统计信息,学习填充出高分辨率结果。
  • 物理应用价值
  • 提升实验测量技术的精度(如有限测量保真度下的分辨率增强)。
  • 加速数值计算(粗网格模拟 + 超分辨率增强,用于高保真模拟)。
  • 已用于气候模拟和流体模拟。
  • 关键考量
  • 训练需要大量高低分辨率配对数据——若没有高分辨率数据则无法训练。
  • 物理系统(如流体射流)的超分辨率应尊重物理规律(质量守恒、动量守恒)。若将图像切块做守恒计算,结果应在物理上自洽。
  • 理想情况下,超分辨率得到的流场应实际满足 Navier-Stokes 方程,这对工程师下游使用至关重要。
  • 本讲指出:社区仍在探索如何在超分辨率中嵌入物理。
3.2 发现新物理(Discovering New Physics)
  • 可从观测数据中发现可解释的物理模型(如开普勒定律、牛顿第二定律)。
  • 不只是重新发现已知规律,更重要是发现解释数据差异的新物理
  • 历史案例:水星近日点进动——观测数据与 F = ma 预测存在微小偏差,爱因斯坦广义相对论给出的修正解释了这一偏差。
  • 现代应用:聚变反应堆中等离子体模型不完美但数据丰富,机器学习可帮助发现改进模型的新物理,从而改善控制与设计。
3.3 材料发现(Materials Discovery)
  • 是什么:利用机器学习加速材料发现、表征材料、优化设计参数空间。
  • 为什么是机器学习的机会:材料设计是极高维的优化问题(可供调整的参数很多),机器学习可以学习低维模式,简化人类的搜索。
  • 注意:时间依赖性——即使是制造复合材料(如高压釜烘烤)也是一个随时间变化的动力学过程。
3.4 计算生物化学与计算化学
  • 典型任务:理解蛋白质折叠、药物设计、燃烧过程和其他化学反应。
  • 核心目标:加速现有高保真代码——这些代码通常需要在极快/极长的时间尺度上模拟大分子。用机器学习构建替代模型以加快计算,从而实现更快的药物发现和蛋白质设计。
  • 成功案例新冠疫苗开发依赖于这类加速计算框架。
  • 物理约束:这些系统受守恒定律和量子力学规则支配,机器学习模型应尊重相应物理规律。
3.5 数字孪生与差异建模(Digital Twins & Discrepancy Modeling)
  • 数字孪生:对物理资产(physical asset)建立行为模型,用于多种目的:
  • 模型预测控制:需要可用于控制的模型。
  • 老化跟踪:了解资产如何随时间退化,并用数据更新模型。
  • 差异建模(Discrepancy Modeling) :当第一性原理物理模型与实际设备存在偏差时(如轴承的非线性抖动、风阻等),用机器学习建模此偏差并闭环校正,提高数字孪生的精度。
  • 数字孪生的结构:通常由多个不同保真度的模型层级(hierarchy of models) 组成——有粗略的传统模拟代码、高保真的昂贵模拟,以及机器学习模型(用于拼接不同保真度)。这是一种混合物理 + 机器学习模型
  • 机器学习模型在数字孪生中的关键要求:必须满足物理规律,必须能与物理模型协同工作。
3.6 形状优化(Shape Optimization)
  • 是什么:优化物体形状以达到特定目标(如最大化升力、最小化阻力、最大化下压力等)。
  • 应用领域:人工心脏/心血管流动的手术干预、飞行器机翼设计、F1 赛车车身、跨太平洋航运的燃料效率优化、风力涡轮机、子弹头列车。
  • 问题复杂度:真实世界的形状优化是多目标优化问题——除了气动/流体性能,还要考虑材料、重量、可靠性、维护便捷性等因素。
  • 机器学习如何帮助
  • 构建可同时输出多个品质因数(figures of merit)的替代模型,在此基础上进行多目标优化。
  • 当目标函数随时间变化(如燃料价格改变、出现性能更好的材料),可以仅调整目标函数,继续在同一替代模型上优化。
  • 关键洞见(自动微分) :由于神经网络等机器学习模型天然可自动微分(这是训练时反向传播的基础),这种自动可微性可以直接用于工程设计优化循环中——实现无伴随(adjoint-free)优化,更便宜、更高效。
3.7 数据来源的保真度层次(Fidelity Pyramid)
  • 在设计复杂系统(如飞行器机翼、汽车、风力涡轮机)时,实际数据来自不同保真度的多个来源,成本随保真度递增:
  • 大量低保真度模拟(最便宜)
  • 较少的高保真度模拟
  • 更少的实验室测量
  • 最终实地建造/飞行测试(最昂贵)
  • 数字孪生的目标:构建一个替代模型,能够综合所有保真度数据,预测系统在不同使用场景下的行为。若替代模型足够好,大量优化工作可以在“虚拟世界”中完成,减少昂贵物理测试。
  • 理想效果:低成本的替代模型能给出“低成本和低误差”的预测——综合了不同数据源的优势。

四、动力系统的建模选择与混沌问题

  • 大多数物理信息机器学习处理的系统是随时间变化的动力系统(材料发现中的某些问题除外)。
  • 对动力系统建模时存在多种模型选择,这些选择在文献中常被忽视:
建模选择描述
学习微分方程的右端项测量系统状态(如 x, y, z 坐标),让机器学习模型表示函数 f(x),然后对模型进行积分以预测未来
离散时间步进(time-stepper)学习映射 F,将时刻 k 的状态推进到 k+1(固定 Δt),反复迭代
**学习势函数(potential)函数若已知系统满足 F = ma,且加速度 = −∇V,则可仅学习势函数 V
学习哈密顿量(Hamiltonian)或拉格朗日量(Lagrangian)利用已知的哈密顿/拉格朗日框架建模
  • 这些选择与特定架构相关联:ResNet 架构对应离散时间步进,神经 ODE(Neural ODE)架构对应学习连续微分方程。它们解决相关但不同的问题。
  • 在计算化学中,任务可能是学习自由能势等物理量。
混沌系统的特殊考量
  • 什么是混沌:以洛伦兹系统(Lorenz system)为例,初始条件的小块(红色立方体)在时间演化中会迅速扩散,微小初始不确定性被大幅放大。
  • 核心原则:如果系统是混沌的,精确预测长期轨迹是数学上不可能的任务——这对任何方法(模拟、实验、机器学习)都一样。机器学习不是魔法,无法做到数学上不可能的事。
  • 正确的建模目标:从确定性预测转向概率预测——给定初始条件,学习未来时间处于某位置的概率分布。
  • 天气预报 vs. 气候预测的关键区分
  • 天气预报:预测特定轨迹(5天后的天气),必须使单条轨迹正确。
  • 气候预测:预测概率分布(50年后的气候),看分布如何穿过动力系统演化。
  • 实践结论:如果知道系统是混沌的,问题定义应当改变——不应试图用任何方法预测系统 100 年后的精确轨迹,而应建立概率模型或分布模型。
  • 了解物理知识(如混沌性质)会直接决定机器学习模型的设定方式。

五、何时该使用机器学习

  • 常见问题:在存在完美简单模型的情况下,研究者仍使用大型深度神经网络——模型可能有百万级自由参数,训练极慢,需要海量数据。例如,一个可用二维线性系统(如动态模式分解,DMD)轻松建模的流体流动,被用大规模深度神经网络建模——这属于过度拟合(overkill) ,工具与问题不匹配。
  • 必须问自己的问题
  1. 这个问题需要机器学习吗?
  2. 基于物理的模型是否已经足够好?
  3. 是否有更简单的方法?线性回归是否可行?
  4. 如果线性回归可行,请使用线性回归。
  • 关于“AI 驱动”的提醒:讲座指出,许多标榜“Powered by AI”的产品(如 Peloton 健身车或智能健身中心)实际上可能只是线性回归。
  • 历史教训(天文学 vs. 占星术)
  • 在天文学规律(开普勒定律、牛顿定律、爱因斯坦相对论)被发现之前,存在大量“占星术”——人们在问错误的问题,试图用数据建模无法建模的事物。
  • 行星运动数据确实能回答有用的物理问题:何时发射火箭去火星、何时播种以获最大产量(季节规律)。
  • 但行星运动数据无法回答“我是否该在这一天结婚”这类问题。
  • 结论:机器学习应当做“实际物理”(Crystal ball 式的占星术不可取),避免提出无法用数据回答的问题。

六、基准系统与社区需求

  • 物理信息机器学习社区需要类比 ImageNet 的基准系统——用于图像分类的标准基准数据集。
  • 需要针对动力系统、工程系统、控制系统建立类似基准,以测试机器学习模型是否确实解决了目标任务,并了解哪些任务适合哪些模型。

七、典型研究案例:湍流闭合建模(Turbulence Closure Modeling)

  • 背景雷诺平均 Navier-Stokes(RANS)方程中,存在雷诺应力项(黄色标记),对这些项缺乏精确数学模型,必须从可测量量进行近似——这就是闭合问题(closure problem)
  • 经典案例Julia Ling 及其合作者的论文(距今约8年以上,已属经典)——认识到这是机器学习的最佳切入点:难以建模但有大量数据。
  • 方法:用机器学习专门预测雷诺应力。由于该量在方程中有已知的物理角色,该模型天然具备物理性(物理上知道它如何进入方程)。研究还进一步约束架构以确保预测满足已知的物理对称性。
  • 为什么这是完美案例
  • RANS 建模在 1970-1980 年代取得了大量基于解析和第一性原理的进展(如对称性约束),但随后研究者遇到了瓶颈——这些函数极其复杂(nasty functions) ,用纸笔无法写出闭式表达。
  • 机器学习擅长近似任意复杂的函数(只要有足够数据),因此可以用神经网络表示并满足对称性约束——这是机器学习能力的完美匹配。
  • 教学启示:当人类智慧已推进到某一物理理解了极限,但表达式过于复杂无法闭式写出时,机器学习是理想的补充工具。

八、各阶段之间的耦合

  • 问题定义与数据获取密切相关
  • 问题的定义(如超分辨率)决定了需要哪些数据(高低分辨率配对数据)。
  • 数据可获取性会反过来迫使问题定义被修改。
  • 整个流程是非线性的:从问题 → 数据 → 架构 → 损失 → 优化,过程中可能需要反复回到起点调整。
  • 必须保留经典物理与工程设计的所有原则——如同设计实验来解决物理问题、设计工程系统一样,用同样的严谨性来决定机器学习建模的问题。

方法与步骤

定义机器学习问题的通用流程

  1. 明确大目标:从一个模糊的大方向开始(如“设计更好的机翼”“造更好的赛车”)。
  2. 逐步分解:这个目标不够具体。问自己:
  • 哪些数据可能帮助改善这个过程?
  • 对现有数据,哪些架构类型是合适的?
  1. 审视数据的现实约束
  • 我能获取哪些数据?
  • 哪些数据便宜、哪些昂贵?
  • 数据量有多少?
  1. 可能需要返回修正问题定义:根据数据与架构的现实约束,重新精炼问题陈述。
  2. 训练并反思:模型训练后,若性能不符合预期或用途与设想不符,回到起点,基于学到的经验修正问题。
  3. 持续问自己
  • 这个问题的物理是什么?系统是混沌的吗?
  • 需要确定性预测还是概率预测?
  • 是否有更简单的非机器学习方法可以解决?线性回归可行吗?
  • 我是否在问一个“可回答”的物理问题?(避免“占星术”问题)
  • 最终目标是设计(如形状优化)还是建模(如获取动力学方程)?

动力系统问题定义决策清单

  • 需要学习微分方程的右端项,还是离散时间步进器?
  • 是否需要利用已知物理结构来学习势函数、哈密顿量或拉格朗日量?
  • 系统是否混沌?如果是,是否应将目标从确定轨迹预测改为概率/分布预测?
  • 是否需要在模型中嵌入自动微分以用于下游设计优化?

案例与数据

案例类型关键要点
Julia Ling 等的 RANS 湍流闭合建模从数据建模已知进入方程的物理量用机器学习预测雷诺应力,并通过架构约束满足物理对称性
Tao Schneider 研究组(加州理工)的云物理复杂的多物理相互作用云形成是极复杂的多尺度多物理过程,传统第一性原理建模尚难以覆盖
水星近日点进动从偏差中发现新物理观测与 F = ma 的微小偏差由广义相对论解释
新冠疫苗开发计算生物化学加速依赖加速计算框架,机器学习在此类任务中已有显著成功
洛伦兹系统混沌动力学小初始不确定性随时间大幅放大,精确长期预测不可行
天气预报 vs. 气候预测混沌系统的建模目标天气=单条轨迹;气候=概率分布
比萨(Picasso)名言方法论原则“Computers are useless. They can only give you answers.”(计算机无用,只能给出答案)——人类需定义正确问题

限制与待确认问题

  • 物理嵌入超分辨率的实现方式:本讲明确指出,社区仍在摸索如何在超分辨率任务中真正嵌入物理约束(如质量守恒、动量守恒),尚无成熟答案。
  • 基准测试系统尚待建立:物理信息机器学习领域仍然缺少类似 ImageNet 的标准基准系统,以系统比较不同模型在不同物理任务上的表现。
  • 机器学习不是万能:不能解决数学上不可能的问题(如长期精确预测混沌系统)。任何声称做到这一点的模型本质上都在问错误的问题。
  • 问题定义需反复迭代:不存在“一次性做对”的问题定义;训练后的反思与问题修正本身就是流程的常规组成部分。
  • 本讲未展开的内容:数据获取、架构选择、损失函数设计和优化问题均留待后续讲座——本讲仅覆盖五个阶段中的第一个阶段。

行动清单(实操建议)

  1. 在开始任何机器学习项目之前,写清楚:这个模型为什么需要存在?它要回答什么物理问题或解决什么工程问题?
  2. 列出“更好的定义” :如果大目标是“设计更好的机翼”,逐项列出“更好”的含义(更省油?更灵活?更可靠?)。
  3. 检查是否过度使用机器学习:先尝试线性回归或更简单的模型;如果物理模型已经足够,不要强行引入深度学习。
  4. 确认物理认知对问题的影响
  • 系统是否混沌?若是,转为概率建模。
  • 是否存在已知的对称性/守恒律需要嵌入模型?
  • 是学习微分方程、势函数、哈密顿量还是离散步进器?
  1. 评估数据现实的约束:先盘问清楚自己有什么数据、多少数据、成本多大,再确定问题是否可行。
  2. 考虑模型的下游用途:若用于优化设计,优先选择可自动微分的模型架构(如神经网络),以便利用自动微分进行无伴随优化。
  3. 保持实验思维:如同设计物理实验一样,问题定义是一个可反复修正的假设——训练后若发现模型行为不符合预期,回到问题定义阶段重新精炼,而非盲目调参。

总结

  • 问题定义是整个物理信息机器学习流程中最关键的环节:它决定了后续每一阶段(数据、架构、损失、优化)的方向和可行性。
  • 机器学习应用于物理/工程系统有四大正当理由:物理未知、物理太贵、物理太复杂、系统随时间变化。不具备这些条件的场景通常不需要机器学习。
  • 了解物理知识并不会被机器学习取代,反而更加重要——它决定了哪些问题可解、如何设定目标(确定性 vs. 概率)、在哪里嵌入物理约束(如对称性、守恒律)。
  • 机器学习的能力在于近似任意复杂函数;当人类已把物理推导到极限但表达式过于复杂时(如湍流闭合问题),机器学习是理想的补充工具。
  • 避免“占星术”式提问:确保模型回答的是数据真正支持的可回答物理问题,而非幻想中的关联。
  • 整个模型构建过程是迭代的:问题定义和其他阶段相互耦合,需要反复修正——这种迭代本身就是科学方法在机器学习时代的延续。