物理信息机器学习中的数据整理(Data Curation)阶段详解
在物理信息机器学习流程中,数据整理是第二步,其核心思想是利用物理知识(如对称性、坐标系选择、多保真度数据融合等)来提升数据效率,使模型在数据有限的情况下仍能有效训练并具备超越训练数据分布的外推能力。
核心要点
数据整理阶段在整个流程中的定位
本视频是"物理信息机器学习入门系列"的第二讲,聚焦于整理或选择用于训练模型的数据这一阶段。讲者强调,由于数据的多样性、待解决问题的多样性和解决方法的多样性,关于如何将物理融入数据收集过程,不存在"一刀切"的通用答案,本讲提供一系列可供思考和运用的思路。
- 核心动机:如果拥有近乎无限的数据(如Google或Microsoft等大公司的方式),理论上模型可以从数据中自动学习物理规律(如通过观察世界推断出重力、F=ma等)。生物学习在漫长的时间尺度上正是如此发生的。但这一过程极其昂贵、缓慢和繁琐,无法等待数百万年的进化。作为具备物理知识的人类专家,应主动将已知物理规律教给模型以加速学习。
关键前置结论:物理约束可以大幅减少所需数据量
讲者特意强调一个核心观点:如果将物理嵌入学习过程,通常可以用更少的数据完成训练。例如,当实验极其昂贵、数据样本极难获取时,传统的大神经网络需要大量数据才能训练,但若通过物理来约束神经网络、缩小其搜索空间,就能以少得多的数据完成训练。对于许多物理和工程领域中数据样本稀少的系统,物理是允许用较少数据训练模型的关键手段。
详细解析
一、数据增强(Data Augmentation):利用对称性与不变量
是什么:如果在生成机器学习模型所用数据时,已知某些先验物理知识(如系统具有平移不变性或旋转不变性),可以通过将这些变换作用于已有数据来生成额外的训练样本。
原理:例如,若待建模的流体系统具有旋转不变性(旋转对象不应改变任何物理性质),则可以将数据增强为包含旋转后的副本。这丰富了数据并"拉伸"了数据的覆盖面,使得少量数据可以被更充分地利用,训练出更大、更好的模型。
适用条件:这一方法在经典机器学习及物理/工程系统的机器学习中已被长期使用,适用于系统明确具有某种对称性或不变性的场景。
二、坐标系选择:对模型效果影响巨大
核心论点:测量数据的坐标系极其重要,这也是人类专业知识、物理知识和直觉能在机器学习过程中发挥巨大作用的机会。
案例说明:视频引用Maland Christerson关于日心说与地心说太阳系的示意图。若在地心坐标系中训练模型预测所有天体的运动,模型需要处理复杂得多的曲线,需要更多项来解释,在该坐标系下物理规律更难表示;而若在日心坐标系中,物理规律表达更简单。因此,在知道正确坐标系的情况下,选对坐标系是给机器学习模型的巨大"先发优势"。
二元性(对偶问题):有时并不知道正确的坐标系。此时可以尝试不同的坐标变换,若某个机器学习模型在某个变换下训练更快、误差更低,这本身就告诉我们该坐标系可能是正确的。这一思路对大脑科学等尚不知正确答案的领域尤为重要——当不知道测量变量的正确变换时,发现正确的坐标系本身就是重要的对偶问题。但如果已知物理在某个域(如傅里叶变换域)中表达更简单,应在训练前先对数据进行傅里叶变换。
结论:正确的坐标系选择可以带来巨大差异。
三、模拟数据与实验数据的本质差异
核心区别:
| 维度 | 模拟数据(Simulation) | 实验数据(Experiment) |
|---|---|---|
| 空间信息 | 通常具有高分辨率的空间场(实验中很难获得完整的流体流场) | 空间测量少(可能只有几个测点),难以获得完整场 |
| 时间长度 | 运行成本高,难以长时间运行 | 可以运行数小时、数天甚至更久,获得很长的时间序列 |
| 保真度 | 基于某些物理原理(如F=ma、Navier-Stokes),但可能含有近似假设 | 包含真实世界的细微细节,是检验假设是否失效的"金标准" |
| 成本 | 相对便宜 | 通常更昂贵 |
关键洞察:模拟数据通常基于物理原理,但若在建模过程中做了近似或对某些物理现象理解不足,这些误差会内在地存在于模拟数据中。实验数据包含了难以纳入模型的复杂细节——例如,真实双摆系统具有非线性摩擦、非线性轴承抖动、非线性风阻等难以放入Euler-Lagrange模型中的细微效应,因此同一系统的模拟数据不如实验数据丰富。
多保真度混合:现实中常见的方案是"混合设置":拥有大量针对简化物理的模拟数据,加上有限的但物理更真实的实验数据。这种多保真度数据源或模拟与实验数据的组合,是物理信息机器学习的常见工作场景。
来自同事Petros Koumoutsakos的洞见(在撰写与Beverley McKeon合作的《机器学习与流体力学》综述论文时提出):机器学习在某种意义上几乎是一个通用的数据处理框架——是一套通用的数据处理算法,可以帮助我们缝合来自模拟和实验的数据、不同模态的数据、不同保真度的数据、不同时空分辨率的数据。
理想情况案例:Quanser公司的实验设备展示了模拟与实验几乎完美匹配的情况——他们非常细致地不断更新模拟模型,使其更贴近真实实验系统。有时可以通过机器学习来实现这一点:通过从实验数据中学习小型的机器学习修正项来改进模拟。
四、评估数据是否"足够"与"丰富"
数据规模的陷阱:流体力学领域常有超大数据集,三维全分辨率湍流模拟的单个瞬时快照可达1GB甚至PB级别。但需要自问:这个数据是否有用?是否丰富?是否有时间序列(数据如何随时间演化)?是否覆盖了不同参数(不同流速、不同表面摩擦等)?有时数据仅在单一维度上"大"——空间分辨率高,但缺乏参数变化或时间演化;有时则有大量时间序列但空间信息不足。
判断标准:需要利用物理直觉判断数据是否足以支撑建模、获取直觉或用于设计过程。物理直觉(human intuition)在这里是关键的判断工具。
实际含义:不同的数据对驱动模型的帮助是不同的。对于既要减少数据量又要保证模型可用性的问题,理解数据在空间、时间、参数三个维度上的覆盖情况十分关键。
五、超越训练数据的外推需求与物理的作用
问题本质:在形状优化、气动优化等设计任务中,目标通常是设计前所未有的新设备。例如,设计新的冷却翅片(西班牙合作者的案例)或优化飞机机翼以使其性能优于见过的任何机翼——该测试案例或设计目标显然不在训练数据中。如果它已在训练数据中,就不需要设计它了。
数学表述:在一个二维参数空间中(如改变机翼的弯度和展弦比),每个点的升力、阻力和性能都不同。要找到性能更优的新设计,本质上是寻找训练分布之外的点。
核心结论:
- 大多数机器学习模型擅长在已见训练数据之间插值(例如已知5种机翼几何,模型能告诉所有介于它们之间的几何),但无法给出全新的设计。
- 让机器学习模型泛化到未见过的数据,一般方法是将物理融入模型:确保模型具有正确的对称性和守恒律(物理应具有的),这能大幅提高泛化概率。
- 同时应确保模型简约(parsimonious)——尽可能简单但不失描述能力,可以在损失函数中使用稀疏性促进正则化项(后续讲座详述)。
具体示例:假设要设计一种超湍流棒球,只训练了前三种情况的模型,从未见过第四种想要的情况。朴素机器学习只能在这三种行为之间插值,无法预测第四种。但若在机器学习过程中融入物理,使解满足Navier-Stokes方程,就可以通过思维实验提高流速,从而对该行为做出预测。这是一个重要的大思想:设计常常需要超出训练数据,需要物理来帮助模型泛化。
六、昂贵与稀有的实验数据
背景事实:CERN或LIGO等实验耗资数十亿美元,却只产生少量数据点。此类数据在某些维度可能很大,但在其他维度非常稀疏,且测量成本极其高昂。
挑战:这种数据通常不足以训练深度神经网络(不同于有数百万张图片的图像分类任务)。数据更贵、更难获得、更受限,因此需要更巧妙地设计机器学习架构和问题设定,以充分利用这些昂贵而稀有的数据。物理学家设计实验时非常特定,目的是用几个数字回答特定的物理问题——类似地,机器学习问题的设置也需要精心设计。
七、数据偏差(Data Bias)
定义与成因:在药物发现、材料科学发现中,训练数据通常只包含实际有效的样本。例如,训练数据可能是产生真正功能性蛋白质的DNA库,但每个功能性蛋白质背后存在几乎无限的无效蛋白质空间,而这些"垃圾"案例不在训练数据中。由此产生巨大的数据偏差——模型被偏向到"有效"或"传统有效"的方向。
注意:如果目标是发现从未见过的新材料或新蛋白质,必须仔细思考训练数据、网络架构或问题设定需要具备哪些特点才能实现真正的发现过程。
八、罕见事件(Rare Events):另一种数据偏差
案例:MIT的Themistoklis Sapsis等人研究动力系统中的极端事件。海洋中大多数海浪是正常的,但偶尔会出现灾难性的畸形波(rogue waves)。要构建机器学习模型预测这些畸形波的概率、大小或发生位置,但这类事件本质上极其罕见。
数据不平衡问题:海洋波浪数据中,99.999%不是畸形波(按定义,正是需要捕捉的异常/稀有事件)。如果直接训练模型,可以通过聚焦于大量"无聊"数据并忽略这些罕见事件来获得极高精度的模型——但这完全不是想要的行为。
解决思路:
- 平衡数据,人为增加罕见事件的权重,使其不会在训练过程中被淹没。
- 在机器学习过程的不同阶段融入物理,确保动力学被准确捕捉,以便模型可以运行足够长时间,从而观察到这些罕见事件。
核心概括:如果目标是在大海捞针,需要让数据看起来更像"一堆针"(a stack of needles)供机器学习处理。
九、微小信号(Small Signals)与被淹没的关键物理
案例:水星近日点进动。牛顿物理学对太阳系中行星和卫星的运动预测相当准确,但水星绕太阳运动的观测数据存在一个小的偏差,牛顿第二定律无法完全捕捉。广义相对论通过引入引力效应和时空扭曲修正了F=ma,更准确地解释了这一运动——这是物理学史上的重大成功案例之一。
机器学习视角:如果直接测量数据训练模型,牛顿第二定律能解释该运动99%或99.9%的成分,爱因斯坦相对论只用于捕捉最后那一小点差异。如果模型只是最小化误差或损失,几乎肯定会选择牛顿第二定律的解,很难让它"发现"下一步的修正,因为关键差异的信号相对于主导信号太小。
人类的科学方法:人类通过逻辑、演绎和科学方法创造了一整套科学流程,能够从很小信号中辨别它是真实物理现象还是测量噪声,然后探究解释该差异的物理规律——这在机器学习中很难自然实现,仍然需要人类引导。
历史案例:伽利略球体下落实验与亚里士多德模型的"复活"。伽利略双球实验表面证明了不同密度球体以相同速率下落并同时落地。但事实是,不同密度的球体(如沙滩球与保龄球)在达到不同速度时,会受到未被F=ma简单模型捕获的额外流体物理影响,实际下落速率不同。NASA的图表显示,阻力系数与速度的关系实际上非常复杂,完全未包含在简单的球体下落实验中。
- 伽利略选择了足够致密的球体,使流体效应可以被忽略——这是人类指导的战略性选择。
- 如果真正做不同密度球体的下落实验并开始看到流体效应,会发现亚里士多德被否定的模型(运动取决于惯性或密度)反而能更好地拟合数据。这是一个警示故事:收集数据时需思考,模型究竟想捕捉哪些部分?是否存在不重要的混淆因素?还是说那些"额外复杂物理"正是机器学习建模的机会?人类在历史上一直在战略性地选择忽略哪些数据、关注哪些数据,而机器不会自动忽视数据中的部分内容,除非人类帮助引导它们。
十、隐藏变量(Hidden Variables)
基本事实:大多数工程系统和物理系统,人类无法获得对该系统重要的所有变量,必须在部分信息基础上建模。
典型场景:
- 玩扑克牌时不知道对手所有信息,但仍需做出好的决策。
- 测量大脑以预测癫痫时,存在无法测量的隐藏状态。
- 机翼在流体中飞行时,无法测量机翼周围完整的流体流场。
机器学习的机遇:机器学习为填补这些隐藏测量提供了强大机会。例如,Lorenz混沌系统需要知道X、Y、Z三个状态才能建模为微分方程,但实践中往往只能测量一个标量(例如只有X坐标)。利用部分信息和机器学习填补缺失状态是一个重要问题——能否从部分测量中恢复出与原系统至少定性相似的系统?
物理理论的作用:依赖动力系统理论和物理知识来判断何时可行、何时不可行,这可以指导何时应该或不应该使用机器学习来填补状态。
研究前景(论文预告):已有高级机器学习架构(深度神经网络)能开始填补缺失数据并给出系统的完整状态表示。在Lorenz系统中,仅测量X坐标,通过自定义神经网络,可以找到描述系统完整状态的坐标变换,并学习描述该新状态演化的微分方程——从单个标量测量中最终获得一个简单可解释的微分方程。
十一、数字孪生(Digital Twin)与主动数据获取
定义:数字孪生是物理信息机器学习在工业工程领域的重要应用之一——构建物理资产的数字模型,以改进优化、设计和控制。其基础数据(生命线)来自真实世界数据,核心是一组多保真度数据源:有些便宜且低保真度,有些非常昂贵且稀有,但作为"地面真值"(ground truth)是必需的。
数据获取的递增成本结构(以飞机设计为例):
- 运行大量低保真度模拟以获得粗略的改进方向。
- 选择部分方案进行高保真度模拟。
- 进行实验室测试校准高保真度模型。
- 最终建造实机并试飞。
每一步的成本都在上升,所有经过整理的数据将用于构建机器学习模型(即数字孪生)、并进行优化。
核心创新:不确定性驱动的主动学习闭环。在设计下一代超材料、超合金或飞机机翼时,不希望仅仅把所有传统收集的数据喂给模型(这种老式数据收集方式很贵)。理想模式是:数字孪生模型不仅给出特定设计输入下的性能估计(如升力、阻力),还给出该估计的不确定性估计。基于不确定性,建立从数字孪生回到数据生成的反馈回路:如果模型对某个设计不确定性高但该设计有潜力,模型可以主动回去收集更多数据,并根据不确定性选择不同保真度的数据源。这本质上是通过主动学习(active learning)实现的数据生成优化方式。
静态数据集 vs. 主动查询:有时只能拥有静态数据集(如前任留下的数据),只能被动建模——这是可行的。但若在设计新工程系统时想实现更好的优化,拥有这种反馈回路(能查询不同保真度模拟和实验)将大大降低成本、提高效率和性能。
最终目标:综合不同来源数据的优势——现场测量误差低但成本高,低保真模型成本低但误差高——机器学习模型可以合成得到低成本和低误差的模型,然后在该替代模型(surrogate model)上进行设计和优化。这将是未来设计复杂系统的主流方式。
十二、数据整理阶段的实际工作模式
动态迭代:数据整理不是一个标准化的固定流程。存在三种常见情境:
- 已有数据,需要决定能用这些数据回答什么问题。
- 已有问题,需要决定有哪些数据可以用来解决该问题。
- 大多数情况的中间状态:可获取某些类型的数据(有的便宜有的贵),想解决某些问题(有的更雄心勃勃,有的更保守),需要在数据源和问题定义之间大量迭代。
方法与步骤
数据整理阶段的物理融入策略清单
- 数据增强:识别系统对称性/不变性(旋转、平移等),通过变换生成扩充数据,使有限数据发挥更大效用。
- 坐标系变换:根据物理先验选择正确的坐标系或变换域(如傅里叶域),或在不确定时通过对比不同坐标变换下模型训练效果来发现正确坐标系。
- 数据源选择与融合:明确模拟数据与实验数据的特性(空间分辨率 vs. 时间长度、保真度 vs. 成本),合理组合多保真度数据源;使用机器学习作为通用数据处理框架来缝合不同模态、不同保真度、不同时空分辨率的数据。
- 数据充分性评估:从时间维度、空间维度、参数维度三个方向评估数据的"丰富度";用物理直觉判断该数据对建模、直观理解或设计流程是否足够;对代理模型驱动的设计优化,训练数据应代表最终设计系统所需的工况范围(如不同的几何形状、不同的升力/阻力)。
- 外推能力设计:若设计目标在训练数据之外,需要在模型中嵌入正确的物理(对称性、守恒律)并使用简约原则(稀疏性正则化),提升模型对未见过情况的外推能力。
- 数据偏差识别与处理:审视训练数据中的偏差——是否只包含"有效"样本(如功能性蛋白质)、是否严重偏向传统方案;发现新蛋白/新材料等目标需要训练数据、架构或问题设定具有足够多样性。
- 罕见事件权重平衡:若目标事件是罕见事件(如畸形波),需人为增加稀有事件的权重或在模型中嵌入物理以确保动力学准确捕捉(可运行足够长以观察到罕见事件),避免模型只拟合大量平凡数据。
- 微小信号处理:对占整体数据比例极小但物理上重要的信号,需要人类引导模型关注差异部分,而非简单最小化总误差。
- 隐藏变量填补:利用物理知识和动力系统理论判断从部分测量中重建完整状态是否原理可行,再用适当的神经网络架构从部分测量中学习完整状态表示和系统演化方程。
- 主动数据查询(数字孪生):若条件允许,构建设计-模型-数据生成反馈回路,使模型能根据其不确定性主动选择查询不同保真度的数据源(模拟或实验),实现低成本和低误差的代理模型。
数据的三维丰富度评估框架
- 时间维度:是否有时间序列?数据如何随时间演化?
- 空间维度:空间分辨率/空间覆盖是否足够?是否只能获得几个测点?
- 参数维度:是否覆盖不同参数(流速、几何、物性等)?是否覆盖设计目标所需的参数空间?
案例与数据
案例1:日心说 vs. 地心说
在地心坐标系中,行星运动的轨迹是复杂的曲线(需要更多项解释,物理更难表达);在日心坐标系中,运动表达简单得多。同样的数据,坐标系选择决定了模型的学习难度和可能的表达能力边界。
案例2:伽利略球体下落实验
- 故事版本:不同密度的球从塔上同时落下、同时落地,证明恒定重力加速度。
- 复杂事实:不同密度球体由于空气阻力等流体动力学效应(阻力系数随速度的复杂变化,如NASA图表所示),下落速率实际不同。
- 伽利略的战略选择:选择了足够重的球体(而非沙滩球),以使流体效应忽略不计。
- 反转案例:如果真正下落不同密度球体,会发现亚里士多德的"运动取决于惯性/密度"模型反而更贴合数据。
- 要点:数据收集时需明确想建模什么,识别不需要的混淆因素,以及那些"额外物理"因素本身也可能是机器学习建模的机会。
案例3:水星近日点进动与广义相对论
- 牛顿力学解释了水星运动约99%~99.9%的部分。
- 剩余微小偏差由爱因斯坦广义相对论修正后得到精确解释。
- 机器学习若仅最小化误差会天然选择牛顿解(高占比主导项),很难自发"发现"占比极小但本质重要的相对论性修正——人类科学方法(逻辑、演绎、判别信号真伪、系统探究)在此不可替代。
案例4:畸形波(Rogue Waves)的稀疏性
- 海洋波浪数据中,畸形波占比极低(如0.001%),按定义即为罕见异常事件。
- 直接训练高精度模型只会拟合正常波浪,完全忽略畸形波。
- 需要人为提高罕见事件权重或嵌入物理使模型能生成足够长的时间序列以观察到这些极端事件。
案例5:Lorenz系统的部分测量重构
- Lorenz系统有三个状态变量X、Y、Z,完整建模为微分方程需要全部三个状态。
- 实际测量往往只有单个标量(如X坐标)的观测。
- 论文预告:使用自定义深度神经网络,从X坐标的单个标量测量出发,学习坐标变换以嵌入完整状态,并学习描述该新状态演化的微分方程——最终得到简单可解释的方程。
案例6:数字孪生驱动的飞行器设计
- 设计流程:大量低保真模拟(粗略改进)→ 少量高保真模拟 → 实验室测试校准高保真模型 → 建造实物并试飞(成本递增)。
- 理想闭环:数字孪生模型对每设计配置给出性能和不确定性估计;若设计有前景但模型不确定性高,则主动查询更高保真度的模拟或实验收集更多数据。
- 数据目标类型(如机翼优化需改变弯度、展弦比等参数使升力/阻力不同):若训练数据不具有几何和升/阻的多样性,不可能设计出全新的机翼。
案例7:昂贵稀有实验数据
- CERN(欧洲核子研究中心)、LIGO(激光干涉引力波天文台)等实验耗资数十亿美元,产出数据点有限。
- 此类数据无法支撑传统深度神经网络的大规模训练;需更巧妙的架构设计和问题设定来利用有限的昂贵数据。
- 类比:物理学家将实验设计得非常特定,以便用几个数字回答特定物理问题——机器学习问题设定也应有类似的精确性。
限制与待确认问题
- 数据整理的"无统一答案"性:由于数据多样性和问题多样性,不存在关于物理如何融入数据收集过程的普适规则;本讲提供的是可用的思路,而非操作手册。
- 模拟数据的固有限制:模拟数据基于建模时的物理假设,任何近似或不完全理解的物理都会被编码进数据中;模拟数据的"富程度"通常低于实验数据(如无法完美包含非线性摩擦、非线性轴承抖动、非线性风阻等)。
- 外推(泛化到训练数据之外)没有保证:通过注入物理能提高泛化到未见案例的概率,但这是"一般方式"而非绝对保证;文中对此明确说明并非笼统的绝对声明。
- 从部分测量重建完整状态的可行性受限于物理/动力系统理论:需要依赖理论判断何时可行、何时不可行,不是所有隐藏变量都能被填补。
- 主动数据查询在现实中并不总是可能:有时只有静态数据集(如前任收集的数据),只能在该数据上建模,无法主动收集新数据(如反馈式查询不同保真度模拟和实验)。
- 发现"正确坐标系"在未知领域(如脑科学)尚是待解决的研究问题:当不知道正确的变量变换时,如何通过多种变换尝试来发现坐标系——这仍是影响使用的开放实际问题。
行动清单
- 确定数据源类型:数据来自模拟还是实验?各自的空间/时间/参数覆盖和成本/保真度特征是什么?
- 评估数据充分性:数据在时间维度(时间序列演化)、空间维度(分辨率与覆盖)、参数维度(参数范围多样性)上是否足够?
- 检查数据偏差:训练数据是否只包含正面/有效样本?是否偏向传统方案?是否需要平衡或重新构建数据集?
- 识别罕见事件与微小信号:目标物在数据中占比是多少?是否需要人为加权或嵌入物理以捕捉?
- 选择坐标系和变换域:根据已知物理先验(对称性、简化域的已知性)决定是否对数据进行坐标变换或增强。
- 制定外推策略:如果设计目标在新颖(分布外)区域,确认模型中是否嵌入了正确的物理约束(对称性、守恒律)并采用简约原则(稀疏正则化)。
- 设计多保真度数据融合方案:明确哪些低保真模拟用于广泛探索、哪些高保真/实验数据用于校准与验证。
- 考虑数字孪生的不确定性反馈:若可能,设计模型对配置的不确定性估计,并用它指导额外数据采集(不同保真度)的决策。
总结
物理信息机器学习的数据整理阶段,核心不是简单地收集尽可能多的数据,而是有策略地利用物理知识来设计数据相关决策,以解决真实工程和科学问题中数据稀缺、昂贵、有偏差等根本性挑战。数据增强、坐标系选择、模拟与实验数据的多保真度融合、数据偏差与罕见事件的平衡、微小信号的识别、隐藏变量补齐以及数字孪生中的主动数据获取,构成了物理融入数据整理的七类关键途径。
特别重要的全局论点包括:
- 物理约束可以将模型所需数据量大幅降低——这对实验成本极高的物理和工程系统至关重要。
- 设计优化的本质是要求模型外推到训练数据分布之外,而物理是支撑这种外推的主要手段之一。
- 人类的物理直觉和科学方法(如战略性地选择忽略某些数据细节、设计实验使关键信号突出)在机器学习时代仍是不可替代的引导力量。