导读:中国科学院自动化研究所研究团队教会AI"理解"物理世界的秘密
炒股就看金麒麟分析师研报,权威,专业,及时,全面,助您挖掘潜力主题机会!
(来源:科技行者)
这项由中国科学院自动化研究所(CASIA)国家模式识别实验室主导完成的研究,以预印本形式于2026年7月30日发布在arXiv平台,论文编号为arXiv:2607.28624。有兴趣深入探究技术细节的读者,可以通过该编号在arXiv上查阅完整论文,项目主页地址为Phi-Zero.github.io。
**一、从"看热闹"到"看门道"——AI视频模型一直缺少什么?**
当你把一个玻璃杯推到桌子边缘,即便闭上眼睛,你的大脑也能"预判"出它会摔碎的声音、碎片散落的样子,以及地板上留下的一滩液体。这种对物理世界运作规律的直觉理解,是人类自幼习得的宝贵能力,也是让人类有别于机器的核心所在。
如今市面上已经有了许多令人叹为观止的视频生成模型,它们能把一张静止的照片变成流动的影像,生成的画面细腻逼真,乍看之下几乎与真实录像无异。然而这些模型有一个根深蒂固的缺陷——它们所掌握的,终究只是"像素层面的视觉规律",而非真正意义上的物理规律。用一个直白的例子来说:这类模型在生成"网球击中橡皮鸭"的视频时,往往会让画面看起来很顺滑,但那只橡皮鸭可能纹丝不动,仿佛什么都没发生一样。模型"知道"画面应该漂亮,却不"知道"被撞击的物体应该飞出去。
正因如此,研究团队抛出了一个颇具野心的问题:能不能设计一套专门用来描述物理世界变化规律的"语言",让机器像人类一样,先在这套语言里"推理"物理过程,再把推理结果转化为视频画面?这个想法,就是PhiZero(读作"Phi Zero")这一研究的出发点。
**二、人类的秘诀:先用语言想清楚,再动手做出来**
人类学会物理直觉的方式,和AI训练的方式有一个本质区别。人类不是通过死记硬背每一次看到的物体运动来积累经验的,而是从无数次观察中提炼出抽象规律——"被推的东西会倒"、"水往低处流"、"火焰向上蹿"——然后用语言把这些规律组织起来,以便在脑海中灵活推理新的场景。
自然语言是人类整理和表达知识的强大工具。正因如此,大型语言模型在文字世界里如鱼得水,能完成推理、写作、编程等各种复杂任务。然而当目标从数字世界转向物理世界时,自然语言就显得太粗糙了。"球会飞出去"这五个字,根本无法精确描述球飞出的速度、轨迹、旋转和碰撞后的形变——这些细节对于准确模拟物理过程至关重要。
研究团队因此提出:既然自然语言太粗、像素太细,能不能在两者之间找到一个"恰到好处"的中间层次?这个层次既足够抽象,能捕捉跨越不同场景的通用运动规律,又足够精细,能承载视频生成所需的物理细节。他们把这个中间层次称为"物理语言"(Physical Language)。
**三、什么是"物理语言"——给世界变化打上专属标签**
以配乐打比方,一首曲子的乐谱和乐器演奏录音是两种不同层次的东西。乐谱记录的是抽象的音符和节奏结构,而不是具体的音色和音量细节;录音则包含了所有可听到的声学信息。如果你想把同一首曲子从钢琴版改编成弦乐四重奏,只需要根据乐谱重新演奏,而不用"翻译"整段录音。物理语言扮演的角色,正类似于这张"乐谱"——它记录的是物理变化的结构性信息(这里发生了一次碰撞、那里有液体在扩散),而不是具体的视觉像素细节。
更准确地说,物理语言是一套从真实视频中自动学习到的**离散符号序列**。所谓"离散符号",可以理解为一个规模约25000个词汇的特殊词典里的词条,每个词条代表一种特定类型的世界状态变化模式。一段4秒钟的视频,会被压缩成一串长度为256的符号序列,这串序列就是这段视频中物理变化过程的"摘要"。
这套语言完全由机器从大量无标注视频中自动习得,没有人事先告诉模型什么是"碰撞"或"倒塌",所有规律都是模型通过观看和重建视频内容"悟"出来的。这与人类婴儿通过反复观察身边世界来建立物理直觉的过程,有着异曲同工之妙。
**四、PhiZero的工作流程:"先想清楚,再画出来"**
PhiZero整体遵循一个简洁优雅的两步走逻辑,研究团队称之为"先推理,后渲染"(reason-then-render)。
第一步,给系统看一张当前世界的截图,再配上一句人类指令(比如"把酒倒进玻璃杯"),系统先在物理语言的符号空间里进行"推理",输出一串描述未来变化过程的符号序列——这就好像一位剧本作家先写好了接下来这场戏的动作说明。第二步,再把这串符号交给一个视频生成器,后者根据符号序列和初始截图,将抽象的变化描述渲染成栩栩如生的未来视频画面——这就像导演根据剧本调度演员、完成拍摄。
这种分离设计的好处在于:物理推理和视觉渲染被拆解成两个独立的任务,各司其职。物理推理模块只需要关心"事情该怎么发展",不用操心画面好不好看;视觉渲染模块只需要关心"如何把变化过程画得漂亮",不用费力推断物理规律。两个模块相互配合,一个负责"想明白",一个负责"画出来"。
**五、物理语言分词器——把视频"翻译"成符号**
PhiZero内部有两个核心组件,分别承担不同的职责。第一个组件叫做"物理语言分词器"(Physical Language Tokenizer),它的任务是把视频翻译成物理语言符号序列,同时学会如何根据符号序列重建视频。
分词器的工作方式颇为精巧。给定一段视频,它首先用一个空间-时间编码器把视频压缩成一系列紧密相邻的"状态快照"。关键设计在于,系统不是一下子处理整段视频,而是专注于每两帧相邻状态之间发生了什么变化——就好像看连环画时,你的注意力落在每两幅画之间那个"发生了什么"的空档上,而不是试图一眼记住整本画册。负责提取这种变化信息的结构叫做"过渡级Q-Former",它会同时看着前后两帧的特征,提取出一组代表这段变化的特征向量。
提取完变化特征之后,系统会把连续的特征向量"量化"成离散的符号,就像把音乐中连续变化的音调归并到有限个固定音符上。这里使用的量化方法叫做有限标量量化(FSQ),它不需要单独维护一个码本,而是通过几个维度的数值组合直接生成词汇表,规模约为25000个符号。
在解码端,系统借用了一个预训练好的视频扩散模型(基于Wan2.2-5B)作为"画笔"。这个扩散模型原本就具备很强的生成能力,能根据各种条件画出逼真的视频画面。PhiZero把物理语言符号序列作为条件喂给这个扩散模型,再加上第一帧的画面作为场景参考,让扩散模型据此重建未来的视频。这样一来,物理语言符号只需要记录"发生了什么",至于场景的颜色、光线、质感等视觉细节,交给扩散模型的生成先验来填充即可。
为了防止扩散模型在训练初期偷懒——直接依赖加噪的目标帧来推测答案,而不认真学习物理语言——研究团队设计了一个"纯噪声热身"阶段。在这个阶段里,模型被刻意设置为只能从物理语言和第一帧出发来重建视频,中间帧全部替换为纯噪声,逼迫模型真正依赖物理语言符号来推断未来变化,而不是走捷径。
**六、物理语言推理器——教AI用符号"思考"未来**
第二个核心组件是"物理语言推理器"(Physical Language Reasoner)。如果说分词器负责学会物理语言的"读写",那么推理器的任务就是学会用这门语言"预测未来"。
推理器以一个预训练好的视觉-语言模型(Qwen3-VL-4B)为基础,在其原有的文字词汇表之上,额外添加了25000个代表物理语言符号的特殊词条。这就像给一个已经精通中英文的人,再教他一门新的"物理速记语",让他能够用这门速记语来记录和推断物理世界的变化。
推理器的工作方式是自回归预测——每次生成下一个物理符号时,都参考当前已生成的所有符号、第一帧图像以及用户给出的动作意图描述,像接龙游戏一样逐步补全完整的变化描述序列。训练时,系统先用冻结的分词器把训练视频编码成物理语言序列,再让推理器学习如何从第一帧和动作描述出发,预测出正确的符号序列。
值得一提的是,训练时给推理器看的文字描述,被刻意控制为只描述"高层次的动作意图",比如"把杯子放到桌上",而不是详细叙述整个变化过程。这是为了防止文字描述直接剧透答案,让推理器真正学会从初始状态和意图出发推断物理演化,而不是单纯学习从文字描述到符号的"翻译"。
**七、海量数据和循序渐进的训练——给AI打好"物理童子功"**
为了让这套系统真正学到有普适性的物理规律,而不是死记硬背特定场景的视觉规律,研究团队构建了一个规模庞大且经过精心筛选的训练数据集。
整个数据准备过程分为多个层级。团队从互联网上收集了约5万小时的真实世界视频,经过去重和多轮质量过滤(去除有压缩瑕疵、水印、画质过差、镜头切换过频的视频)之后,剩下约1万小时的干净视频用于分词器的大规模预训练。在此基础上,再叠加审美质量、运动幅度和状态变化可观测性的筛选,以及约1千小时的模拟仿真视频(来自各类物理仿真数据集),最终形成约500万段4秒长的视频片段,用于分词器的精细化微调阶段。微调阶段所用的仿真数据包括来自物理学研究的合成碰撞视频、流体仿真视频等多种类型,帮助模型学习在真实视频中较为罕见的特定物理现象。对于推理器,则进一步筛选出约100万段运动丰富、物理交互明显的视频片段用于专项微调。
训练过程同样遵循循序渐进的课程设计:分词器先在低分辨率(256×448)的短视频(1秒)上学习基础的局部变化规律,再逐步过渡到2秒、4秒的视频,最后提升重建分辨率至512×896并进行精细化调整。这种"由浅入深"的训练策略,让模型能够先稳固地掌握短时间内的状态变化,再尝试理解更长时间跨度的物理演化。
**八、实验结果——三类权威榜单上的表现**
研究团队在多个权威评测基准上对PhiZero进行了系统性验证,覆盖了视频生成能力和视频理解能力两大维度。
在视频生成方面,评测使用了三个专注于物理真实性的基准。Physics-IQ Verified是一个拍摄了66组真实物理实验(如倒水、碰撞、燃烧等)的评测集,通过比较生成视频和真实视频在关键区域变化上的重叠程度来打分。PhiZero在综合得分(IQ-Score)上达到41.2分,超越了包括Sora 2、Cosmos3-Super等商业模型在内的所有对比方法。PhyGround基准专注于固体力学、流体动力学和光学共13条物理定律的遵从情况,使用专门训练的物理评判模型打分。PhiZero的物理得分(Physics Score)和综合得分(Overall)均居所有参与对比方法之首,分别达到3.01和2.97。WorldModelBench从更宏观的角度评估世界建模能力,涵盖自动驾驶、机器人操作、人类活动等7个领域。PhiZero在物理一致性(Physics Adherence,4.88分)和总分(8.19分)上同样排名第一。
在视频理解方面,评测采用了一种有趣的间接验证方式:给模型看一对视频(一个符合物理规律,一个违背物理规律),让模型判断哪个更合理,依据是模型为哪段视频分配了更高的物理语言序列生成概率。IntPhys2基准评测直觉物理理解能力(如物体永久性、时空连续性等),PhiZero的总体准确率达到56.34%,超越GPT-4o、Gemini等大型多模态模型。LikePhys基准评测模型区分有效和无效物理场景的能力,PhiZero的平均错误率(41.7%,越低越好)低于Hunyuan-Video等强基线。YoCausal基准评测真实世界视频中的因果理解能力,PhiZero在综合排名上位列第一。
除了与其他整体系统的比较,研究团队还专门评测了分词器本身的压缩与重建能力。相比之下,Wan2.2 VAE(一个连续的视觉编码器)在重建质量上最高,但需要44800个连续视觉标记;PhiZero的分词器只用256个离散的物理语言符号,在所有高度压缩方案中重建质量最好,在峰值信噪比(PSNR,28.9 dB)、结构相似性(SSIM,0.903)和感知距离(LPIPS,0.087)三项指标上均优于Video-LaVIT和VideoFlexTok等竞争方法。
**九、消融实验——哪些设计真的有用?**
为了验证PhiZero各设计选项的有效性,研究团队进行了一系列对照实验,逐一"拆掉"某个设计来观察性能变化。
在分词器设计上,去掉预训练扩散解码器(改用普通确定性解码器)是影响最大的改动,三项重建指标均出现明显下滑,证明扩散先验对于从紧凑符号中恢复高质量视觉细节至关重要。去掉过渡级Q-Former(改用对整段视频全局提取特征)也导致性能下降,验证了对相邻帧变化的局部建模确实更有利于捕捉物理过渡信息。去掉纯噪声热身阶段同样带来一定程度的性能退化,说明这一机制确实有效地阻止了模型在训练早期形成"走捷径"的惰性。
在推理器设计上,实验对比了以下几种设定:直接用基础模型Wan2.2-5B生成视频(得分21.2)、在此基础上加入精心设计的文字提示来引导生成(得分26.6),以及PhiZero不使用仿真数据(得分37.7)、不使用两阶段训练(得分39.2)和完整版(得分41.2)。这组数据清楚地表明,仅靠更好的文字描述无法弥补缺少物理语言的根本差距;仿真数据的引入切实提升了模型对物理合理变化的预测能力;而专项微调阶段的"精练"训练则在通用能力的基础上进一步提升了物理精准度。
**十、物理语言的两个迷人特性——可迁移性与语义结构**
在做完定量评测之后,研究团队还深入分析了物理语言本身的两个值得关注的内在特性。
第一个特性是可迁移性。研究人员做了一个简洁的实验:取出一段倒酒视频,用分词器编码出它的物理语言序列,然后把第一帧图像替换成另一个场景(比如改变容器形状、颜色或背景),再用同一串未改动的物理语言序列来生成新视频。结果表明,新生成的视频忠实保留了倒酒动作的流体扩散轨迹和运动韵律,尽管视觉外观已经完全不同。这说明物理语言确实成功地把"变化方式"和"看起来像什么"分开存储了,运动规律不依附于外观而存在。
第二个特性是语义结构。研究团队提取了自动驾驶(nuScenes数据集)和机器人操作(AGI-Bot RealRobot数据集)两个领域的视频,计算每段视频的物理语言特征,然后用降维可视化方法观察这些特征在空间中的分布。在自动驾驶场景里,静止不动的视频自然地聚集在一处,而左转、右转、直行的视频则沿着连续的弧形流形排列,就像一个方向盘的转角示意图。在机器人操作场景里,"向下移动并夹紧"、"向上移动并夹紧"、"向下移动并张开"、"横扫"四种末端执行器动作分别形成紧密而独立的簇,说明物理语言把不同的运动类型清晰区分开来了。这种自发涌现出来的语义组织结构,是物理语言真正捕捉到了运动内在规律的有力证据。
**十一、更广泛的应用——从驾驶仿真到跨身体的动作搬运**
PhiZero的能力并不局限于生成符合物理规律的通用视频,其物理语言接口还为多种实际应用场景打开了可能性。
在可控世界模型方面,研究团队将PhiZero适配到了自动驾驶(nuScenes)和机器人操作(AGI-Bot RealRobot)两个领域。对于驾驶场景,系统接收预期的车辆行驶轨迹(以数字文本形式描述的时序坐标),通过推理器预测对应的物理语言序列,再渲染出未来的驾驶视频。系统能够精细区分不同转弯幅度和方向的驾驶场景,连"轻微右转"和"急速右转"这样细微的差别也能体现在生成的视频里。对于机器人操作场景,输入的是机械臂各关节角度和末端执行器姿态的时序数值,系统同样能够准确还原对应的机器人动作视频,机械手抓握和放开物体的动作精度相当高。
在交互式世界模型方面,用户可以用自然语言指令(如"向右转动视角")来控制生成视频中的摄像机运动,系统通过滑动窗口的方式逐段生成更长的视频序列,实现连续交互式的场景探索体验。
在零样本跨身体动作迁移方面,物理语言可迁移性的潜力体现得最为直接。只需三步:拍摄一段人体运动视频,编码为物理语言序列;用图像编辑工具把第一帧里的人替换成目标机器人(宇树G1人形机器人或Sharpa灵巧手);用相同的物理语言序列重新解码,就可以得到机器人执行对应动作的视频,而且不需要任何人机配对训练数据。同样的思路也适用于仿真到现实的迁移:取出仿真环境里的机器人操作视频,编码其物理语言,把第一帧渲染成真实风格的照片,再用原来的物理语言序列重新解码,就能生成"看起来是在真实厨房里操作"的视频。
**十二、诚实面对局限性——研究团队怎么看自己的工作**
研究团队在论文结尾坦率地指出了当前工作的几个明确局限。物理语言目前是从数据中归纳出的经验性表示,而非对物理定律的显式符号化,所学符号尚未直接对应到人类可解释的物理变量(如速度、质量、力)。由于训练数据来自可视频拍摄的现实场景,对于触觉交互、微观粒子运动等在视觉上不可见或高度模糊的物理过程,模型的覆盖能力自然受限。此外,当前实验使用的模型规模和数据量,相对于整个物理世界的复杂多样性而言仍属有限,但目前取得的较好结果表明这条路径具备进一步扩展的潜力。
展望未来,研究团队认为物理语言在以下几个方向具有延伸价值:作为视觉-语言大模型的中间推理层,改善时空理解能力;借助从大量人类视频中提炼出的物理语言,以较低成本向机器人具身系统迁移运动技能;通过层级化或循环式预测,将当前固定4秒的生成窗口扩展到更长的时间跨度;以及通过更大的模型、更多的计算资源和更丰富的训练数据进一步提升整体能力。
**十三、归根结底——这项研究说明了什么**
说到底,PhiZero这项研究回答的是一个朴素但深刻的问题:AI是否需要一套专属的"语言"来理解物理世界,就像人类需要语言来组织和表达知识一样?研究团队给出的答案是肯定的,并且用一套完整的技术方案和丰富的实验数据为此提供了支撑。
从实际效果来看,PhiZero在多个严苛的物理合理性评测上超越了参数量更大的商业视频模型,靠的并不是堆砌更多像素预测的计算量,而是在中间插入了一个显式的物理推理环节。这种"先想后画"的架构,让模型有机会在生成像素之前先在符号层面"纠正"不合理的物理逻辑。
对于普通人而言,这项研究的潜在影响覆盖相当广泛的场景。在机器人领域,它意味着未来训练家用机器人或工业机械臂时,可以更高效地利用人类日常活动的视频来迁移技能,而不必为每一种机器人身体结构单独收集和标注大量配对数据。在自动驾驶领域,能够理解物理规律的世界模型可以生成更贴近真实物理场景的仿真数据,降低真实路测的成本和风险。在科学教育和可视化领域,一个能够生成物理合理交互视频的模型,具备成为强大教学演示工具的潜力。
这项研究的完整论文可通过arXiv编号2607.28624查阅,项目主页Phi-Zero.github.io上也提供了更多可视化效果供参考。如果你对物理AI、视频生成或世界模型领域感兴趣,这篇论文提出的"物理语言"框架值得认真研读——它或许代表了让AI真正理解物理世界的一个有效切入角度。
Q&A
Q1:PhiZero中的"物理语言"到底是什么,和普通的文字描述有什么区别?
A:物理语言是PhiZero自动从真实视频中学习到的一套离散符号系统,词汇表约有25000个符号,一段4秒视频会被压缩成256个符号的序列。它和文字描述的核心区别在于精细程度:文字描述只能给出"倒水"这样的高层次概念,而物理语言能精确编码液体扩散的具体轨迹和时序细节,足以支撑后续还原出物理合理的视频,同时比像素编码紧凑得多。
Q2:PhiZero实现跨身体动作迁移需要配对的人机数据吗?
A:不需要。PhiZero的动作迁移流程分为三步:先用分词器把人体动作视频编码成物理语言序列,再用图像编辑工具把第一帧里的人替换成目标机器人,最后用原始的物理语言序列重新解码生成机器人动作视频。整个过程不使用人机配对数据,因为物理语言编码的是运动本身的结构,与外观无关。
Q3:PhiZero和现有视频生成模型相比生成速度会不会慢很多?
A:PhiZero在生成流程中增加了物理语言推理这一额外步骤,理论上会有一定的时间开销。然而由于物理语言序列长度仅为256个离散符号,自回归预测过程相对轻量;更重要的是,压缩后的物理语言大幅减少了扩散解码阶段需要条件化的信息量,因此整体效率影响有限。论文并未单独报告推理速度数据,具体延迟情况有待进一步披露。
声明:市场有风险,投资需谨慎。本文基于第三方数据库发布,不代表本网观点,任何在本文出现的信息均只作为参考,不构成个人投资建议。如有出入请以实际公告为准。