资讯

AI读完了互联网,才发现真实世界更难

虎嗅·2026/8/28 03:39:37🔗 原文

📌 概要

<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/28/1008-prod-gptep-general-1-1787888094378.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /></

<figure><img src="https://img.huxiucdn.com/ai/ai-general-cover/202608/28/1008-prod-gptep-general-1-1787888094378.png?imageView2/1/w/1440/h/810/|imageMogr2/strip/interlace/1/quality/85/format/png" /></figure>导读:这场访谈真正讨论的,不是“AI 会不会做天气预报”过去几年,AI 最成功的一套范式几乎变成行业共识:更多数据、更大模型、更多算力、更长上下文。语言模型沿着这条路线学会了写代码、推理、调用工具,并开始参与科研。但 Anandkumar 提出的核心问题是:当 AI 真正进入天气、流体......<p><span>嘉宾背景:Anima Anandkumar 是加州理工学院数学与计算机科学教授。她从事 AI 研究已经超过二十年,研究经历跨越深度学习兴起前的概率模型理论、深度学习、大规模工业 AI,以及今天的 AI for Science。她曾在 NVIDIA 领导 AI 研究;更早之前,她参与创建 Amazon Web Services 的 Cloud AI 团队并构建早期云端 AI 产品。</span></p><p><span>Anima Anandkumar和Benedikt Jenik此前曾获贝索斯支持的Project Prometheus重金招揽,邀约包括35%的股权和最高200万美元年薪。两人最终没有接受邀约,继续发展Accelerated Understanding。她们共同创办了人工智能初创公司Accelerated Understanding,周二推出一款面向物理世界的AI模型。测试显示,该模型单次可处理5万亿项数据,约为Anthropic和谷歌旗舰模型通常处理量的500万倍。模型主要学习物理现象在时间和空间中的变化,可用于极端天气预测、芯片设计和地质数据分析。</span></p><p><span><a href="https://www.latent.space/p/anima?utm_source=chatgpt.com" target="_blank">Anima Anandkumar × Latent Space </a>完整对话中文译本,头图来自:AI生成</span></p><p>导读:这场访谈真正讨论的,不是“AI 会不会做天气预报”</p><p>过去几年,AI 最成功的一套范式几乎变成行业共识:更多数据、更大模型、更多算力、更长上下文。语言模型沿着这条路线学会了写代码、推理、调用工具,并开始参与科研。但 Anandkumar 提出的核心问题是:当 AI 真正进入天气、流体、材料、核聚变这些连续、高维、强物理约束的系统时,语言模型的成功经验还能不能原样复制?</p><p>她给出的答案并不是“Transformer 失效”,而是更谨慎的:物理世界的数据结构与语言不同。语言是一维序列,而工业级物理模拟可能同时涉及三维空间和时间,每个维度又有数百到上千个网格点。若机械地把这些点当成 Token 交给全局注意力,计算规模会迅速达到数千亿乃至万亿级。</p><p>因此,她代表的是另一种 AI Scaling 思路:不是放弃深度学习,而是把深度学习的表达能力,与几何结构、守恒定律、物理方程和更适合连续函数的架构结合起来。更重要的是,她把目标从“预测”进一步推到“设计”:未来科学 AI 不只是告诉人类某个系统会发生什么,而可能直接帮助寻找更好的材料、芯片结构、光学器件和聚变装置。</p><p>以下为完整对话翻译:</p><p>开场片段:FourCastNet 为什么改变了天气建模?</p><p><strong>Anima Anandkumar:</strong>于是我们开始寻找一些有意思的案例。其中一个就是天气建模,因为天气数据是开源的。既然数据在那里,我们就想,好,那就直接试试看。只要有数据可用,这通常都是好消息。不过当时很多气象科学家提醒我们,这件事非常难。那是 2021 年,他们说,传统天气预报已经发展了几十年,背后是一套非常谨慎、从底层物理出发的建模方法:先假定流体动力学等物理规律,再一步一步预测第二天、后天的天气。所以当时很多人的看法是,AI 不可能轻易超过几十年积累下来的天气模型。<br /><br />但后来我们发现,这件事确实可以做到。模型不仅准确,精度已经非常接近传统天气模型,而且速度快了数万倍。过去需要大型超级计算机运行的东西,现在可以用消费级 GPU 来跑。模型很小,运行很快,同时又很准确。我觉得这一下改变了很多人的想法。</p><p><strong>Brandon Anderson:</strong>欢迎来到 Latent Space,这是 Latent Space 的 AI for Science 专题。我是 Brandon。我在 Atomic AI 做利用 AI 开发 RNA 疗法的工作。和我一起主持的是 RJ Honicky,他做空间转录组学,也是 Mirror Omics 的 CTO 和创始人。<br /><br />今天我们很高兴请到 Anima Anandkumar。她是加州理工学院数学与计算机科学教授。Anima 做了很多非常有意思的工作,把 AI 和对物理世界的建模结合起来,她的研究背景也非常多元,我觉得我很难完整概括,所以还是请 Anima 自己介绍。感谢你来参加节目。</p><p><strong>Anima Anandkumar:</strong>谢谢 Brandon,也谢谢 RJ。很高兴来这里。我很喜欢 “Latent Space” 这个名字,因为“潜在空间”在我的很多工作里确实都非常重要——某种意义上,世界本身就是“潜在”的。<br /><br />简单介绍一下,我做 AI 已经超过二十年了。甚至在深度学习兴起之前,当时概率模型还需要建立很多理论基础,我就在做这些工作。后来深度学习开始发展,我也一直和产业界保持联系,直到最近都如此。我之前在 NVIDIA 领导 AI 研究;更早之前在 Amazon Web Services,我参与创建了 Cloud AI 团队,并参与构建第一批云端 AI 产品,那已经接近十年前了。<br /><br />所以,我一直是一只脚在产业、一只脚在学术。我觉得这让我获得了一个很有意思的视角:如何把理论和实践结合起来,既思考大规模 AI,也思考更有原则、有理论依据的 AI。</p><p>一、当神经网络进入核反应堆,验证必须成为能力的一部分</p><p><strong>Brandon Anderson:</strong>你的很多工作都和物理系统建模有关,比如用微分方程描述物理系统,再用机器学习去建模。我们可以先从比较高层的角度聊聊。后面我们会具体谈神经算子,以及天气等应用。不过我现在尤其好奇的是 TorchLean:你最近这项工作和你更大的研究计划是什么关系?</p><p><strong>Anima Anandkumar:</strong>对我来说,最广义的核心命题一直是:AI 和科学要怎样结合起来?<br /><br />我差不多十年前来到 Caltech。我的兴趣一直是科学、尤其是物理,但我的研究又是 AI,所以当时最早的问题就是:怎样把这两件事真正放到一起。这里面有几个不同层面。<br /><br />一个层面是,人们现在已经在思考怎样用语言模型做科学。语言模型当然可以生成很多假设、很多想法,但只有想法是不够的。你可以提出无数想法,真正的瓶颈在于:怎样测试它们、验证它们,确认它们在现实世界里真的成立。<br /><br />所以我最近很大一部分研究重点,就是怎样构建一种能够给出“有效性保证”的 AI。一个方向是:我们能不能对物理世界建模,同时让模型保持物理正确?这就是神经算子发挥作用的地方。<br /><br />另一个方向是:我们能不能对某些东西做符号层面的验证?例如,如果我们声称一个定理是正确的,就必须真正去验证它。Lean 这样的形式化系统就在这里发挥作用。自然语言模型可以辅助推理,但最终仍需要形式化验证。现在数学推理领域很多前沿工作,就是在探索怎样把这些东西和语言模型结合。<br /><br />TorchLean 也属于这个方向。我们的想法是,不仅数学命题需要验证,神经网络自己声称能够做到的事情也可能需要验证。比如你有一个神经网络,你想知道它是否鲁棒;或者你想把它放进一个控制回路里,无论是控制无人机还是控制核反应堆。<br /><br />最终,当我们把基于深度学习的 AI 系统放进控制回路时,我们需要的是鲁棒性。TorchLean 希望让这些验证能够更顺畅地完成,让神经网络本身成为验证流程的一部分,从而让我们更有信心地、以合适的方式使用它。</p><p><strong>RJ Honicky:</strong>我们之前在节目里已经聊过 Lean,大家对神经网络应该也都比较熟悉。但神经网络看起来非常“不受约束”。你说的证明具体是指什么?是对输入、输出做上下界约束吗?我们到底可以证明哪些东西?</p><p><strong>Anima Anandkumar:</strong>TorchLean 首先是一个整体框架。它真正让你可以做的是:把神经网络基本上直接写进 Lean 里。<br /><br />你可以把它理解为一种类似 PyTorch 的抽象层,只不过不是在 PyTorch 里写,而是在 Lean 里写,因此整个网络能够被 Lean 完整形式化。然后在这个框架之下,我们可以实现不同的验证算法。<br /><br />比如,我们有用于可认证鲁棒性<span>(certified robustness)</span>的算法,像 CROWN。CROWN 是其中一种方法。不同算法会用不同方式去计算鲁棒性边界,而这些边界到底有多紧,取决于你采用什么样的松弛方法。这里如果不深入技术细节,其实有很多类似算法。<br /><br />我们现在做的,是把这些算法实现到 Lean 框架中。这样一来,一方面你可以像用 PyTorch 一样,很方便地把神经网络写出来;另一方面,你也可以针对这个网络提出形式化命题,并真正去验证这些命题。两件事可以放进同一个框架。</p><p><strong>RJ Honicky:</strong>那能不能举一个“边界”的例子?假设我们在运行一座核反应堆,我们当然不希望它熔毁。对于输入和输出,你能提供什么样的保证,来帮助我们降低这种风险?</p><p><strong>Anima Anandkumar:</strong>最自然的例子,就是我刚才说的可认证鲁棒性。<br /><br />比如,如果输入受到某个幅度的扰动,输出最多会变化多少?这本质上是一种敏感性分析。我们希望针对不同神经网络架构,能够得到这类明确的边界。这样你不仅可以训练一个神经网络,让它在控制回路里表现好,还可以进一步考虑安全性、鲁棒性和稳定性——这些本来就是控制系统里非常关键的问题。<br /><br />这只是一个例子。更一般地说,只要神经网络进入很多现实场景,我们就会需要验证。<br /><br />控制回路是一类。另一个例子是,我们会用物理信息神经网络去求解偏微分方程,或者构建保证满足某些物理定律的系统。但与此同时,我们还会关心另一个问题:神经网络实际上是在有限精度下训练的,对吧?有限精度会带来什么误差、什么局限?这些影响能不能也被界定出来?<br /><br />所以,无论是数值精度的影响,还是输入扰动的影响,我们都希望有相应算法在 Lean 中实现,并直接成为整个验证流程的一部分。</p><p><strong>RJ Honicky:</strong>TorchLean 的表达能力足够描述几乎所有神经网络吗?还是它本身也有一些限制?</p><p><strong>Anima Anandkumar:</strong>它基本上是一个类似 PyTorch 的框架,所以你可以像在 PyTorch 里一样,很自然地定义各种神经网络层。区别在于,它的后端是 Lean,因此可以对这些网络做形式化表达和证明。</p><p><strong>RJ Honicky:</strong>那对于 Transformer 这样的架构呢?如果神经网络规模非常大,做这类边界证明现实吗?</p><p><strong>Anima Anandkumar:</strong>这里其实是两个问题。一个是“有没有这个框架”,另一个是“能不能扩展到足够大的规模”。<br /><br />Lean 目前在可扩展性上还有不少局限。它主要还是 CPU 环境,要迁移到 GPU 并不是把代码简单搬过去就行,里面有很多细节需要解决。<br /><br />所以我们现在首先建立了框架,但如果要让它在非常大的模型上变得高效,还需要大量工作。这其实也是 Lean 整体上面临的问题。</p><p>二、PINNs 与神经算子:为什么“只写下物理方程”还不够</p><p><strong>Brandon Anderson:</strong>我想确认一下我应该怎样理解这件事。假如我上研究生级别的数值分析课,面对一个微分方程,会有离散误差之类的问题;在满足某些条件下,我可以给这些误差做边界分析。<br /><br />但过去很多基于物理、或者 AI 求解微分方程的方法,某种程度上像“西部荒野”,很多东西并没有特别清楚的保证。你刚才提到物理信息神经网络<span>(PINNs)</span>,这个想法很酷,但据我了解,它们并不是总能工作,而且人们也不总是知道什么时候会有效、什么时候会失效。<br /><br />TorchLean 这类工作有没有帮助你更清楚地理解 PINNs 的适用范围?目标是不是最终可以非常严格地说:“这个解一定会收敛”?还是神经网络里的“收敛”本身并没有数值分析里那么直接?</p><p><strong>Anima Anandkumar:</strong>物理信息神经网络(PINNs)的思路大概是这样的:我把一个偏微分方程写下来,然后希望通过优化过程找到正确答案。<br /><br />如果优化完全不是问题,那当然太好了——理论上你可以什么都解。但现实不是这样。优化通常非常困难,特别是那些带时间演化的问题,而不只是静态问题。比如流体动力学,时间拉长之后可能进入湍流、甚至混沌状态;非常细小的局部效应都会变得重要。<br /><br />在这类问题上,希望仅仅“从零开始”,靠一个神经网络直接把偏微分方程解出来,往往是不现实的。所以 PINNs 并不是在所有地方都有效。<br /><br />神经算子的想法,正是为了克服这个局限。我们不能只依赖物理约束、从头求解。现实里其实有很多数据可以利用。<br /><br />以天气为例,我们不仅能用方程做合成数据,还能真正观测天气,获得现实世界的数据。既然这些数据存在,为什么不用?与其每次都从零求解偏微分方程和其他物理问题,数据驱动的方法可以更快给出答案。<br /><br />神经算子就是把两者结合起来:一方面充分利用现有数据,另一方面仍然可以加入物理约束。这样就能够绕开 PINNs 的一些局限。</p><p><strong>RJ Honicky:</strong>能不能再直观解释一下两者为什么不同?我听下来,PINNs 基本上是把物理约束“烘焙”进神经网络里,但随着时间或者其他变量变化,可能出现不稳定。如果再给它一些数据,我能直觉理解为什么会有帮助,但这里到底发生了什么?</p><p><strong>Anima Anandkumar:</strong>对于 PINN 来说,至少在经典做法里,每一个具体方程实例,基本都要从头求解。你先拿到这个方程的具体设定,然后希望优化过程能够成功找到答案。<br /><br />而神经算子更像一般的监督学习:训练阶段你已经看到了很多输入和对应答案。到了测试阶段,你再问模型:“面对一个新的实例,你能不能直接给我结果?”<br /><br />同时,你仍然可以利用物理约束去引导它。所以它可以既是数据驱动的,又是物理信息驱动的。<br /><br />关键区别在于:因为你在训练阶段看过真实答案,就不会完全被困在一个非常困难的优化地形里。你已经通过数据学到了解的结构,所以测试时更有机会迅速得到正确答案。</p><p><strong>RJ Honicky:</strong>我的理解是,神经算子本质上是在数据上拟合函数,或者说让一个神经网络学习“函数到函数”的映射。这个理解对吗?</p><p><strong>Anima Anandkumar:</strong>对。从这个意义上说,神经算子和神经网络很像:它也是从数据中学习。但神经算子可以看作对普通神经网络的一种推广。<br /><br />普通神经网络通常假设输入和输出尺寸固定。比如语言模型里,我们先固定词表;计算机视觉或者视频里,也经常默认一个固定分辨率,输入输出都在这个分辨率上。模型训练完之后,你不能随意把分辨率换掉。<br /><br />但大量物理数据天然是多尺度的。我们不应该提前规定世界“只能”处在某一个固定分辨率上。<br /><br />比如你现在只有比较粗分辨率的天气数据,但真实现象其实发生在更细的尺度。未来你可能得到更高分辨率的数据,或者希望在更高分辨率上加入物理约束。<br /><br />所以模型应该保留这种灵活性。真实世界不是在一个离散网格上存在的,它本质上是连续的、可以不断细化的。<br /><br />神经算子想做的就是这一点:把输入和输出表示为连续函数,从而允许不同的离散化、不同的分辨率。到推理阶段,你可以在训练时没有固定死的分辨率上使用它。</p><p><strong>RJ Honicky:</strong>但这样会受到约束吧?如果只看有限数据,会有很多很多不同函数都能把这些数据拟合好,非常容易过拟合。你们怎么做正则化?</p><p><strong>Anima Anandkumar:</strong>当然。如果你要求模型预测比训练数据更高的分辨率,也就是我们所说的零样本超分辨率<span>(zero-shot super-resolution)</span>,某种意义上它确实是在做外推、做猜测。<br /><br />模型本身会通过正则化,希望平滑地扩展到更高分辨率。但如果你能够再提供额外信息,比如加入一个物理损失,把偏微分方程直接给模型,然后在比训练数据更细的分辨率上去约束这个方程,那么模型就会得到更多指导。<br /><br />这样,物理信息神经算子就有可能在比原始训练数据更高的精度、更高的分辨率上仍然给出合理结果。</p><p>三、傅里叶神经算子:用结构换掉不可承受的计算复杂度</p><p><strong>RJ Honicky:</strong>我的理解是,你很多工作都使用一种特定的算子——傅里叶算子。傅里叶空间是一种对偶域,它覆盖整个输入空间。这听起来有点术语化,你能不能直观解释一下,为什么这件事重要?它到底帮了什么?</p><p><strong>Anima Anandkumar:</strong>前面我说过,神经算子这类模型可以接受任意分辨率的输入、输出,并学习两者之间的映射。这个“映射”本身在数学上就叫算子,所以才叫神经算子。<br /><br />傅里叶神经算子<span>(Fourier Neural Operator,FNO)</span>是我们比较早提出的一种架构。它之所以成功,我觉得很重要的一点,是在效率和表达能力之间取得了很好的折中。<br /><br />为什么傅里叶空间好用?一个关键原因是,它可以很高效地捕捉非局部现象。<br /><br />自然界里很多现象都存在非局部性,无论是流体动力学、材料形变还是量子化学。偏微分方程里的“导数”看起来是局部的,但真正求解方程,往往相当于做积分,解本身是非局部的。傅里叶表示很适合捕捉这种关系。<br /><br />与此同时,傅里叶变换又非常高效,而且能够天然表达很多自然现象里的归纳偏置。<br /><br />但这并不意味着我们把整个世界都强行表示成傅里叶基上的线性组合。经典数值方法往往就是这样,而我们不是。我们会在傅里叶层之间加入非线性,也会加入残差连接等深度学习架构里已经被证明有效的设计。<br /><br />所以它其实是在结合两个世界的优点。<br /><br />如果你用 Transformer 去处理非常高分辨率的数据,注意力机制会带来二次复杂度和全连接成本,很快就不可承受。而傅里叶变换接近准线性复杂度,同时仍然能够表达全局联系和非局部现象。所以它是一个很好的中间地带。</p><p><strong>RJ Honicky:</strong>也就是说,它能学到远距离的影响。比如天气里,芝加哥发生的事情可能会影响旧金山——当然这个例子未必准确,但大概是这种意思?</p><p><strong>Anima Anandkumar:</strong>对,就是这种意思。有些影响在短时间、局部尺度上看起来很局部,但随着时间演化,最终会影响更远的地方。所以无论空间还是时间,我们都希望模型能够捕捉这种依赖关系。</p><p><strong>RJ Honicky:</strong>对,所以芝加哥今天发生的事情,之后会产生影响。</p><p><strong>Anima Anandkumar:</strong>是的,这里既有短期效应,也有长期效应。短期我们讨论的是可预测天气;把时间拉长,就进入气候问题。<br /><br />你也许无法非常精确地说:“芝加哥今天发生什么,会让旧金山某一天具体发生什么。”这就是类似蝴蝶效应的问题。<br /><br />但另一方面,我们可以预测统计意义上的平均趋势。比如某一大片区域出现热浪,我们可以推断另一些区域出现高于平均温度的概率会增加。这些不同尺度的东西,可以在同一个框架里捕捉。</p><p><strong>RJ Honicky:</strong>从架构角度问一个给 AI 工程师的问题:我们现在只是把所有运算都搬到傅里叶域里吗?本质上还是同一个神经网络,只是换了计算空间?还是说还需要其他架构设计?</p><p><strong>Anima Anandkumar:</strong>最容易的理解方式是:想象一个 Transformer,把原来的注意力模块换成傅里叶模块,但网络里的其他部分仍然存在。<br /><br />你依然会有各种非线性、残差连接,以及把通道映射到更高维空间的 lifting,这些设计都会提供表达能力。<br /><br />所以深度学习里很多已经验证有效的原则,我们仍然保留。傅里叶部分主要帮助我们处理全局依赖,也就是类似“全连接”的关系,但不需要承担 Transformer 那样巨大的计算复杂度。</p><p><strong>Brandon Anderson:</strong>它还有一个优点,是天然具有多尺度性质。但如果从信号处理或物理背景来看,会有一个问题:在线性傅里叶表示里,总会有一个最高频率,超过这个范围就无法表示。那加入这些非线性架构之后,你对频率截断、频率范围的选择会怎样变化?</p><p><strong>Anima Anandkumar:</strong>这是个很好的问题。这正是“表达能力”发挥作用的地方。<br /><br />如果你只是对一个信号做傅里叶变换,再用有限傅里叶模式表示它,这其实和传统数值方法做的事情很像。为了得到高精度,你就需要非常细的离散化,所以传统模拟才会这么昂贵。<br /><br />但深度学习的核心不是死板地固定表示,而是学习特征。既然我们希望模型自己学习更好的特征,就不能把所有东西都强迫限制在原始傅里叶域里。<br /><br />我们需要加入非线性,让网络自己找到更合适的基、更合适的表示空间。可以说,它会找到一个更合适的“潜在空间”——这里刚好和节目名字呼应了。<br /><br />我们先把原始信号以非线性的方式提升到更高维空间,本身就形成一个潜在表示;然后在傅里叶变换之间继续做非线性变换。<br /><br />所以即使有限的频率模式本身不够表达复杂现象,加入非线性之后,模型也可以用更丰富的方式去表示它。</p><p>四、物理世界的数据不会像互联网文本一样无限丰富</p><p><strong>Brandon Anderson:</strong>你的研究生涯开始得很早,那时神经网络还没有真正起飞。那时候研究者会很认真地思考应该选择什么基函数、怎样做函数展开、正交多项式等等。<br /><br />后来整个社区逐渐走向一种“别管那么多,把东西全扔给网络”的路线。但听起来,你仍然认为那些经典思想有一部分可以作为指导原则。<br /><br />你的看法是:严格的经典数学方法,今天仍然能够帮助我们更好地建模真实世界吗?即使总体上我们仍然在使用现代深度学习这种非常灵活的方法。</p><p><strong>Anima Anandkumar:</strong>我觉得这里需要一个平衡。<br /><br />很有意思的是,我二十多年前的本科毕业论文就是做分数傅里叶变换。单靠这些经典技术当然不够做今天的计算机视觉,但我当时就很好奇:这些数学工具到底能做什么、边界在哪里?<br /><br />我完全同意,我们不能把自己限制在“石器时代”的技术里。我们需要特征学习,需要灵活性、表达能力,也需要网络容易优化——这些都是深度学习非常重要的优点。<br /><br />但到了物理世界,情况不同。<br /><br />物理数据永远不会像语言数据那样充裕。我们的天气模型大概只有 5 万个样本,虽然每个样本分辨率很高,但和语言模型的训练数据完全不是一个量级。很多其他领域的数据更少,因为模拟本身就非常昂贵,真实实验数据更可能根本不存在。<br /><br />所以在物理问题上,我们必须更认真地思考归纳偏置,必须把物理约束加进来,而不能只依赖数据。这就让架构设计本身重新变得重要。<br /><br />还有一个问题是计算复杂度。<br /><br />语言本质上是一维序列。即便只有一维,现在上下文做到百万级,我们已经很吃力。但物理系统不是一维:可能是二维、三维,甚至三维空间再加时间,也就是四维。<br /><br />哪怕每个维度只有几百个网格点,工业尺度往往甚至是每个维度上千个网格点,那么如果你把它直接当作“上下文”,就是数千亿甚至万亿级。<br /><br />所以,别想着用 Transformer 直接处理这种规模。哪怕把世界上的算力都拿来,也不够,而且这些算力还得全部放在一起。这就是为什么我们需要其他架构。</p><p><strong>RJ Honicky:</strong>我稍微反驳一下。现在已经有视觉-语言模型、视频模型了,它们不是也在学习从现实世界到潜在空间的映射吗?</p><p><strong>Anima Anandkumar:</strong>关键在于它们现在的分辨率非常低。<br /><br />物理世界里我们需要的分辨率,可能是 1000×1000×1000 这种尺度。你算一下,光这一点就已经是非常巨大的规模。今天我们做图片和视频模型,并没有真的在这么高的物理分辨率上计算。</p><p><strong>Brandon Anderson:</strong>这里我想到一个例子。</p><p><strong>Anima Anandkumar:</strong>而且视频通常还是自回归生成,本质上只需要一步一步预测下一步。</p><p><strong>Brandon Anderson:</strong>对。</p><p><strong>RJ Honicky:</strong>但一般来说,视觉模型也会学习某种 codebook,对吧?也就是学习如何把现实世界压缩到潜在空间。如果物理世界也存在可以压缩的结构……</p><p><strong>Anima Anandkumar:</strong>问题在于,很多视觉和视频模型的目标主要是“看起来不错”,而不是进行高精度物理模拟。<br /><br />对真实物理系统来说,更高的分辨率和细节不是装饰,而是必要条件。至少训练数据本身就必须保持这种高分辨率,模型也必须能够处理并推理这些细节。<br /><br />这正是瓶颈所在。我们不能简单把所有细节扔掉,说每个维度只留 50 个或者 100 个网格点。那样不足以正确建模流体动力学、等离子体、材料形变等现象。<br /><br />这些问题要求高保真,而高保真就意味着高分辨率。</p><p>五、AI 能否挑战几十年数值预报体系</p><p><strong>RJ Honicky:</strong>我的理解是,你有一个比较明确的判断:如果 AI 接下来想继续扩大能力、并且真正变得可靠,就必须更深入地把物理世界纳入模型。很多人都有类似观点,但你比较特别的是,你已经做了不少把神经算子真正用到物理世界里的案例,而且你的判断似乎就是从这些实践中长出来的。你能不能分享几个你觉得最有意思、最令人兴奋的例子?</p><p><strong>Anima Anandkumar:</strong>可以。我们一开始是从神经算子求偏微分方程出发,但其实更一般地说,它并不要求问题一定写成偏微分方程;只要是时空数据、多尺度数据,都可以考虑。<br /><br />所以我们开始寻找一些有意思的案例。天气建模就是其中一个,因为天气数据是开放的。ECMWF——也就是欧洲中期天气预报中心——提供了公开数据。既然数据在那里,我们就想,那就试试看。只要有数据可用,通常都是好消息。<br /><br />但 2021 年前后,很多气象科学家都提醒我们:这件事太难了。传统天气预报已经发展了几十年,是非常严谨、从底层物理出发的建模体系,比如从流体动力学出发,一步一步计算第二天、后天的天气。很多人的直觉是:AI 不可能轻易超过几十年积累下来的天气模型。<br /><br />但我们还是直接去训练了。我们用神经算子来捕捉这些现象,结果让我们自己都很意外:模型不仅准确,精度已经非常接近传统天气模型,而且速度快了数万倍。<br /><br />过去需要大型超级计算机才能跑的计算,现在可以用消费级 GPU 完成。模型本身很小,运行很快,同时又保持较高精度。我觉得这件事改变了很多人的想法。<br /><br />再后来,DeepMind、华为等团队也陆续跟进。我们很早就把 FourCastNet 以比较宽松的许可方式开源,这使公司、气象机构和研究者都可以直接基于它继续开发。<br /><br />现在你能看到一个非常有意思的变化:AI 天气模型开始真正进入气象机构。它甚至让全球南方一些规模较小的气象机构,有机会获得过去只有大型国家气象机构才能负担的预测精度。某种意义上,这是在让天气建模能力民主化。<br /><br />所以天气只是一个例子,但它非常清楚地展示了:这个领域在很短时间里发生了范式变化——AI 开始被认为可以成为一种可靠的天气建模工具。</p><p><strong>RJ Honicky:</strong>我看到你提到的这些模型时有一个感觉:你最早似乎抓到了一个别人还没抓到的关键洞察,后来其他团队也找到不同机制追了上来。<br /><br />这里真正发生的是不是一种思维方式的变化?是不是说,过去大家没有意识到这些数据里其实存在足够强的可学习结构,而你们先相信了这一点,然后不同方法都开始去学习这些结构?</p><p><strong>Anima Anandkumar:</strong>我想稍微澄清一下。<br /><br />第一阶段最重要的发现,其实很简单:传统方法每次都要重新求解一套偏微分方程;AI 则可以从数据里学习规律和模式,然后在新实例上直接给出结果。这样既可以达到接近的精度,又可以快得多。<br /><br />接下来我们才开始问:怎样把精度进一步提高?<br /><br />天气还有一个很重要的时间尺度问题。短期天气通常是未来一两周可预测的东西;再往后就进入次季节尺度,最终走到气候建模。传统上,不同时间尺度往往用不同系统:短期一个模型,长期又是另一套模型。<br /><br />但对我来说,地球只有一个。<br /><br />如果我们真的说自己想做一个“基础模型”,那它就不应该只在一个很窄的时间范围里工作,而应该能够同时处理非常短期和非常长期的问题。<br /><br />这也是 FourCastNet 后续版本里我们努力做的事情。一个关键改进,就是把地球的球面几何真正纳入模型。<br /><br />很多架构在短期天气上可以做到不错精度,但一旦把它不断向前 rollout,跑几个月甚至更长时间,就会迅速发散、爆掉。一个原因是:它们在表示上把世界当成了一个矩形,但真实地球不是矩形。<br /><br />当你把球面几何以及相关结构直接纳入神经算子以后,同一个模型就可以更稳定地向更长时间尺度运行。<br /><br />在这个方向上,也已经有机构基于神经算子架构进一步做气候模型。长期气候模拟和短期天气预报并不是同一个难度层级。对于真正的气候模拟,你需要模型尊重地球本身的球面结构,并且在长期反复 rollout 时一直保持这种结构信息。<br /><br />如果一个模型只是针对几个指标做短期近似,我会把它看成比较窄的 surrogate;而基础模型的目标应该更广。</p><p><strong>Brandon Anderson:</strong>你刚才说 FourCastNet 训练大概用了 5 万个数据样本。能不能具体说说这些数据是什么样?<br /><br />模型的输入到底是什么?它在预测什么?另外,你刚才一直在讲从天气走向气候,这种泛化到底怎么发生?<br /><br />因为如果只有 5 万个样本,我会担心这些数据很依赖本地地形。比如如果你总是在建模堪萨斯,它怎么迁移到瑞士阿尔卑斯山?又怎么迁移到喜马拉雅?</p><p><strong>Anima Anandkumar:</strong>先澄清一点:我们训练的是全球天气模型,所以输入本身覆盖整个地球。<br /><br />我们会给模型当前的全球天气状态,比如风、湿度等,然后让它以自回归方式预测下一个时间点。时间步长是 6 小时:给定现在,预测 6 小时以后;再把这个结果作为下一步输入,再预测之后 6 小时,如此不断 rollout。<br /><br />理论上,同一个模型可以一直往前滚动。但天气本身有可预测窗口,超过这个窗口以后,你就不能再把单一确定轨迹当成“准确答案”。<br /><br />这时要使用集合预测,也就是同时运行很多不同轨迹,得到未来几个月甚至几年发生不同情况的概率分布。长期预测不是一句“某一天一定会怎样”,而是概率性的。</p><p><strong>RJ Honicky:</strong>也就是说,你会产生一组不同的预测轨迹,然后对这些轨迹做统计,从而得到气候层面的预测?</p><p><strong>Anima Anandkumar:</strong>对。你会运行多个 rollout,也就是得到多条未来演化轨迹,然后再从这些轨迹的整体分布中提取结果。</p><p><strong>RJ Honicky:</strong>所以这里计算效率就变得非常关键。</p><p><strong>Anima Anandkumar:</strong>没错。这正是传统气候建模最大的瓶颈之一:哪怕只运行一条非常长的轨迹,成本都非常高;而要做真正的气候分析,通常还需要跑很多条。<br /><br />所以接下来一个问题就是:我们到底怎样验证气候模型?</p><p><strong>Brandon Anderson:</strong>你需要跑很多条轨迹,然后看它们整体怎样演化。刚才你也提到蝴蝶效应:哪怕有一个“完美”的天气模型,本地细节大概也只能精确预测一两周,之后就会因为混沌变得不可精确计算。<br /><br />所以你会做很多 rollout,允许它们有一些混沌和差异,然后看总体统计。但问题是:当时间尺度拉得非常长,你怎样验证这个模型是真的可靠?</p><p><strong>Anima Anandkumar:</strong>这是一个很难的问题。<br /><br />首先,你必须确保模型满足各种物理约束。如果只是做最普通的自回归 rollout,很可能做不到这一点。<br /><br />我们现在正在研究的一个方向,就是当模型不断向前 rollout 时,怎样持续施加正确的物理约束。<br /><br />这里有一个很微妙的平衡:如果你为了稳定,把细节全部抹平,模型就会失去准确性;但如果你把所有微小细节都完整保留,其中一些细节可能在物理上已经不合理。<br /><br />所以这仍然是一个开放问题。<br /><br />气候模拟真正难就难在这里:你既希望 AI 足够快,能够做非常长时间的模拟,又希望对这些长期结果有充分信心。这两件事要同时做到,目前仍有很多研究要做。</p><p>六、极端天气:数据稀缺为什么不一定意味着不可预测</p><p><strong>Brandon Anderson:</strong>我不确定这算天气问题还是气候问题,不过美国西南部最近刚经历了现代气候记录里非常极端的一次热浪。我不知道你有没有具体参与分析,但你知道你们或者其他团队有没有真正把这次事件预测出来吗?</p><p><strong>Anima Anandkumar:</strong>我没有这一次事件的具体信息,不过在我们最近的研究里,确实专门测试过极端天气。<br /><br />这类问题里,只给出一个确定性输出是不够的。面对极端天气,你需要概率预测,而且要非常认真地做概率校准。<br /><br />我们的结果显示,模型可以很好地捕捉这类事件。其实早期第一次做天气模型时,我们就很惊讶:我们把一些飓风和风暴可视化出来,模型表现得很好。<br /><br />这件事一开始很反直觉,因为人们通常会觉得 AI 应该擅长“常见事件”,而不擅长罕见极端事件。<br /><br />但这里有一个更普遍的启示:物理世界也许比我们想象中更有结构。极端事件虽然少见,却不是任意发生,它们受很明确的物理机制约束。<br /><br />我们在很多例子里反复看到这一点。比如等离子体和聚变反应堆,可能只有几千个样本,但仍然可以很好地预测破裂这类事件,而且比传统模拟快大约一百万倍。<br /><br />这些结果听起来很惊人,但我觉得某种程度上是自然界在帮助我们:现实系统存在大量潜在结构。<br /><br />传统数值方法通常要求“无论给什么情况,我都要重新求解这些方程”;AI 则从数据中学习,可能会发现这些系统实际存在的低维结构、可预测结构,也就是发现问题为什么在很多真实分布里没有理论上那么难。<br /><br />我们在越来越多案例里看到这种现象。</p><p><strong>Brandon Anderson:</strong>这让我想到一个类似例子。我自己的背景更接近计算生物学,而 AlphaFold 显然是这个领域非常令人兴奋的进展。<br /><br />蛋白质结构预测这个问题本身受到很强的物理约束。我觉得这也是为什么,在一个整体非常复杂、AI 往往很难取得决定性突破的生物学领域里,蛋白质结构反而成了最成功的案例之一。<br /><br />那些可以用微分方程很好描述、或者至少受到强物理规律约束的问题,好像确实更适合把这些方法结合进去。<br /><br />我刚才好像没有真正问一个问题。</p><p><strong>RJ Honicky:</strong>没关系。回到刚才的话题:现在我们已经谈了天气和气候、等离子体、也谈了生物学。你还准备了一些可视化案例。<br /><br />你能不能带我们看一下这些例子?它们之间有没有一条共同的主线?我想听众应该已经能隐约猜到一点,但我还是很想看。</p><p><strong>Anima Anandkumar</strong>:当然。<br /><br />这里想展示的第一件事,是现实世界跨越很多不同尺度。你可以从原子尺度、蛋白质尺度,一直到我们刚才说的行星尺度天气系统。<br /><br />神经算子的目标,就是能够跨这些不同尺度工作,也能够把不同尺度的数据纳入模型。<br /><br />这和今天很多视觉、视频模型的目标非常不同。大量生成式视觉模型最重要的是“看起来好看”,所以可以使用相对低的分辨率,采用自回归方式,只要生成的视频够短、视觉上合理就可以。<br /><br />但工业尺度的物理模拟不是这样。<br /><br />真正高保真的物理模拟必须有足够高的分辨率。大气就是一个很好的例子:你在不同分辨率下观察,会看到完全不同的现象。如果分辨率不够,有些关键现象就直接消失了。<br /><br />所以一个核心问题是:AI 能不能在保持高保真的同时,比传统模拟快得多?<br /><br />这里展示的神经算子例子,就是为了说明这种差异。<br /><br />普通神经网络往往固定在某个像素数、某个离散分辨率上。如果你把图像不断放大,最后只会越来越模糊——它并不存在更细的函数结构。<br /><br />神经算子则使用函数空间表示。理论上你可以不断提高分辨率;如果获得更高分辨率数据,可以把这些数据加入;如果没有数据,也可以在更细尺度加入物理约束。<br /><br />所以它提供的是一种把多尺度现象放进同一个模型的方法。</p><p><strong>Brandon Anderson:</strong>那你说的物理约束具体在哪里?比如是局部的流体方程、水动力方程之类吗?</p><p><strong>Anima Anandkumar:</strong>都可以。<br /><br />你可以加入守恒定律。例如在不可压缩流体里,可以加入相应的守恒关系;你也可以加入材料形变规律,比如材料怎样拉伸;甚至可以直接加入完整的偏微分方程。<br /><br />这其实也引出了一个我们正在研究的问题:不同物理约束应该怎样安排、怎样选择。<br /><br />有些物理规律很难直接作为损失函数加入,有些则相对容易。所以你不能简单地说“把所有物理都塞进去”,还要认真设计到底约束什么、怎样约束。</p><p><strong>RJ Honicky:</strong>我理解你说的“加入物理约束”,主要就是把这些东西加进损失函数,对吗?</p><p><strong>Anima Anandkumar:</strong>对,因为这是目前比较可计算、可操作的方式。<br /><br />如果你要求网络严格、硬性地满足所有约束,通常会非常难;把它们作为损失函数的一部分,会更可行。<br /><br />当然,这里还有另一个问题:物理损失和真实数据损失之间到底怎样平衡,需要认真调节。<br /><br />刚才展示的天气案例里,我们也可以看到类似东西。比如“大气河”这种现象,在加州经常带来非常强的降雨和风暴。要捕捉这种现象,就需要模型能够理解非常大尺度的空间结构。</p><p><strong>RJ Honicky:</strong>那我们这周就等着检验你的预报了。</p><p><strong>Anima Anandkumar:</strong>对。之所以拿它出来展示,就是因为这类现象本身是全球尺度、或者至少跨越数千英里的大尺度现象。<br /><br />要准确建模它们,就需要一种能捕捉非局部依赖的模型。神经算子能够做到这一点。</p><p><strong>Brandon Anderson:</strong>那这些天气模型的训练数据具体来自哪里?你前面说过一点,但我还是想弄清楚:是卫星数据?地面观测?还是二者的混合?</p><p><strong>Anima Anandkumar:</strong>是不同来源的组合。<br /><br />这类数据通常叫再分析数据<span>(reanalysis data)</span>。它不是单一传感器直接给你的“原始天气记录”,而是把历史观测——包括卫星等数据——和物理数值模型的结果通过数据同化结合起来。<br /><br />气象机构会把这些再分析数据整理并公开,我们就可以用它们训练模型。</p><p><strong>Brandon Anderson:</strong>也就是说,他们先把全球各种气象观测汇总起来,然后用传统物理模拟去补足空间和时间上的细节,得到一套统一的全球数据。<br /><br />短时间尺度上,这类物理模拟非常有用,但如果一直往很远的未来推,就会很快发散。</p><p><strong>RJ Honicky:</strong>所以本来每一家机构都需要重复做这套很贵的处理,但现在有人先把它做成了统一数据,你们就可以直接利用?</p><p><strong>Anima Anandkumar:</strong>对,这套数据本身已经准备好了。<br /><br />而且因为它在生成过程中已经融合了物理模拟,所以某种意义上,训练在这种数据上的模型天然就吸收了一部分物理信息。也许这也是它为什么在一些极端天气上能够表现不错的原因之一。</p><p>七、AI 天气模型更大的价值是风险评估</p><p><strong>Brandon Anderson:</strong>包括极端天气事件。</p><p><strong>Anima Anandkumar:</strong>对。<br /><br />这里展示的是,我们的模型后来进入了 ECMWF 的公开评估和展示系统。那大概是在 2023 年秋天前后。<br /><br />对我来说,这是一个非常重要的节点,因为 AI 天气模型第一次真正被气象机构公开展示,公众和天气科学家都可以直接观察它们到底表现怎样。<br /><br />例如,FourCastNet 在一些飓风事件上表现得很好。这类模型如果真的能更早、更准确地预测极端天气,对人的生命安全和经济损失都会非常重要。<br /><br />我觉得也是从这些真实事件开始,气象科学界对 AI 天气模型的接受度明显提高。<br /><br />这里也回到我刚才说的集合预测。无论是极端天气还是气候问题,你都不能只看一条唯一轨迹。<br /><br />真实初始状态本身就带有噪声和不确定性。比如一个飓风刚在加勒比海形成时,你不可能知道每一个变量的真实精确值。所以你会对初始条件加入不同幅度的扰动,然后同时运行很多条未来轨迹,看结果分布。<br /><br />这才是真正的风险评估。<br /><br />传统天气模型在这里成本尤其高,因为你必须重复跑很多次大型模拟。<br /><br />AI 天气模型快数万倍之后,你就能够跑规模大得多的集合预测。对于风险评估来说,这是非常大的能力提升。</p><p><strong>Brandon Anderson:</strong>你们有没有用历史飓风数据系统做过这种校准?也就是说,对过去事件重新跑集合预测,然后检查预测概率到底准不准?</p><p><strong>Anima Anandkumar:</strong>有。在 FourCastNet 后续研究里,我们专门评估了极端天气和集合预测,也训练模型去获得更好的概率校准。<br /><br />对于这类事件,校准非常重要:不是只要“预测到”就够了,还要让给出的概率本身是可信的。</p><p><strong>Brandon Anderson:</strong>FourCastNet 3 相比第二版和最早版本,最关键的变化是什么?</p><p><strong>Anima Anandkumar:</strong>最早的版本主要使用傅里叶神经算子,但没有把球面几何显式纳入模型。<br /><br />后来我们越来越觉得,地球是一个球体这件事本身非常重要。如果你不考虑它,就会产生几何畸变。所以后续版本开始认真处理地球球面结构。</p><p><stron