近年来,盘古、GraphCast、伏羲等人工智能预报模型快速发展,在多项中期天气预报指标上达到甚至超过传统数值模式。然而,一个更具基础性、也更具挑战性的问题仍有待回答:当极端事件、未来气候状态或新的动力学情景在历史训练数据中缺失或样本稀少时,AI模型能否依然保持可靠的预测能力?
为回答这一问题,复旦大学穆穆院士团队开展合作研究。研究采用参数可调的一维Burgers系统,通过改变非线性系数和扩散系数,构建了600种具有不同动力学特征的情景,并从有效雷诺数(图1)和解的性态(图2)两个维度刻画各系统所代表的物理机制。在此基础上,团队设计了“单一参数象限训练、跨象限测试”和“三个象限联合训练、剩余象限测试”两类试验。结果表明(图3和图4),AI模型能否泛化到训练阶段未见的情景,并不简单取决于训练样本的数量,而更取决于目标系统的物理机制是否在训练数据中得到充分且均衡合理的表征。

图1 600种Burgers系统的有效雷诺数分布

图2 四个参数象限中Burgers系统解的形态
具体而言,当训练样本覆盖较宽的有效雷诺数范围,并包含较为丰富的解之性态时,模型能够迁移到更多参数空间中“未见”的系统——这些系统虽然不属于训练集所在的参数象限,但其动力学机制已被训练数据覆盖(如图3e–f、图4a–b)。反之,即便显著增加训练数据量,只要目标系统的有效雷诺数范围未被覆盖(如图4e–f)、解的性态未得到表征(如图3a–d),或某类物理机制在训练样本中的占比过低(可类比于极端事件,如图4g–h),模型的预测性能仍会明显下降。这意味着,气象AI训练数据的构建思路,应由单纯追求“样本数量”进一步转向强调“物理机制的多样性、覆盖度与均衡性”。

图3 单一参数象限训练下的跨象限预测表现(黑色星号表示训练集)

图4 三个参数象限联合训练下的跨象限预测表现(黑色星号表示训练集)
该研究提示,仅依赖历史再分析资料,可能难以支撑AI模型对小概率极端天气事件和未来气候变化情景的稳健预测。未来,可利用数值模式有针对性地生成能够充分表征极端事件物理机制的稀缺样本,并与历史资料共同构建更加多样、充足且均衡的训练数据集,从而提升气象AI预测模型的可信度、适用范围与预测能力。
该成果以“AI model performances depend on adequate training data representing diverse physical mechanisms”为题发表于《Geophysical Research Letters》。穆穆院士为第一作者;同济大学计算机科学与技术学院秦博助理教授和我系戴国锟副教授为共同通讯作者。该研究得到国家自然科学基金卓越研究群体项目(42288101)资助。
论文信息:
Mu, M., Qin, B., & Dai, G. (2026). AI model performances depend on adequate training data representing diverse physical mechanisms. Geophysical Research Letters, 53, e2025GL121196. https://doi.org/10.1029/2025GL121196