Wenzhao Zheng

Wenzhao Zheng

加州大学伯克利分校博士后 · BAIR

世界模型与智能体
迈向可靠物理智能

大模型为通用智能提供了重要基础,但要实现现实世界的物理超级智能(PSI),还需要围绕它建立完整的物理世界支撑系统。 在大模型认知、推理与决策能力的基础上,我们将空间智能、世界模型与具身智能连接为一个持续感知、预测、行动和反馈的智能系统,并研究贯穿其中的效率与安全问题。

物理超级智能(PSI)系统概念图:左侧共享的空间智能双向连接右侧三层:LLM/VLM 认知核心、世界模型和具身智能。各层之间保持双向联系,并保留认知与行动的直接通路。AI 安全与可靠性覆盖整个系统,系统通过观测、行动与反馈同物理环境交互。
共同技术基础 大模型 AI 安全

欢迎对这个方向感兴趣的合作者加入我们(可邮件联系wenzhao.zheng@outlook.com)。

本页仅展示由本人担任主要作者(第一作者/共同第一作者/Project Leader/通讯作者)的工作。

空间智能

将现实世界转化为 PSI 可通用理解、可交互训练的数字孪生

空间智能是物理超级智能(PSI)的基础,提供基本空间理解、仿真训练数据等。我们从图像和视频中恢复场景的几何、语义与运动,并研究更高效、完备的三维世界表征。过去的工作包括三维语义占用预测、前馈式高斯预测与流式三维重建。现在我们关注:

  • 连续场景几何与表面重建
  • 结构化运动与四维场景理解
  • 面向仿真的生成式几何基础模型
StreamVGGT 场景重建结果与推理时间、显存开销对比
StreamVGGT:流式场景重建利用缓存记忆融合连续观测并更新场景。此处展示重建结果与效率对比,项目提供交互演示。
重建结果 · 2025 年 7 月StreamVGGT · 交互演示
相关工作与资源

研究时间线

场景表示的取舍

我们并不把表征的发展理解为简单的替代关系。深度、占据、点、高斯和隐式场各有取舍。我们更关心:如何保留智能体预测与行动所需的几何、运动和不确定性信息。

  1. 已有工作探索表示被占据的三维空间
  2. 已有工作探索持续维护几何与运动
  3. 待验证的研究目标面向仿真的生成式几何

待研究的问题 如何同时表示连续表面与结构化运动,并保持仿真与在线交互所需的效率?

  1. 2023

    三维占用表示

    TPVFormer 将环视相机图像映射为三视角表示,并预测三维语义占据。
    三维语义占据

    显式描述场景几何与语义,同时降低监督成本。

  2. 2024

    高斯场景表示

    S3Gaussian 将时空特征与高斯结合,重建街景、渲染新视角,并分离静态和动态内容。
    自监督动态街景重建

    以稀疏高斯表示场景,并拓展至时序建模。

    更多工作 · 1
  3. 2025

    流式场景重建

    StreamVGGT 利用流式图像与缓存记忆,逐步重建室内场景。
    在线场景重建

    持续融合新观测,无需每次从头重建整个场景。

    更多工作 · 1
  4. 2026

    完备场景理解

    SM4RT 重建运动中的秋千,并以彩色轨迹展示运动。
    结构化四维运动

    将连续表面与结构化运动连接起来,形成更完备的场景表示。

    More coming soon

    探索面向仿真的生成式几何基础模型。

世界建模

预测动作后果与未来演化

我们研究如何表示和生成变化中的世界:OccWorld 建模三维场景动态,SVG 探索面向生成的语义表示,Astra 预测不同动作条件下的视觉序列。现在我们关注:

  • 生成理解一体化的多模态世界模型
  • 从可探索世界模型到强交互世界模型
  • 打造世界模型智能体
Astra:左转条件生成这段预先生成的视频来自 Astra,以行动为条件预测未来。右转示例展示了同一场景下另一条轨迹的可能结果。
10 秒片段 · 生成视频Astra · 完整演示
相关工作与资源

研究时间线

什么样的预测有用?

我们的工作涵盖显式三维动态、持续隐状态、语义生成表征与动作条件视频。可通过相机探索的场景,不等同于能够响应具身动作的世界。我们希望连接生成与理解,并建立让智能体通过交互检验预测的支撑系统。

  1. 已有工作探索生成场景动态
  2. 已有工作探索探索场景与动作条件下的未来
  3. 待验证的研究目标构建具身世界模型

待研究的问题 世界模型需要表示哪些信息,才能预测接触、操作以及具身智能体造成的持续变化?

  1. 2024

    三维世界模型

    OccSora 编码四维占用,并在不同轨迹条件下生成场景。
    轨迹条件四维生成

    通过显式三维状态与持续隐状态动态,预测场景演化。

  2. 2025

    交互世界模型

    MoRe4D / MoGe4D 从单张图像生成四维轨迹与多视角视频。
    MoRe4D / MoGe4D 从单张图像生成四维轨迹与多视角视频。

    连接生成表征、可探索的四维场景与动作条件下的未来预测。

  3. 2026

    具身世界模型

    从探索生成的场景,走向通过具身交互改变场景。

    More coming soon

    让具身本体通过执行操作参与世界互动,建模动作如何改变世界,并利用反馈指导下一次交互。

具身智能

改变现实世界,并接收反馈

过去我们主要研究自动驾驶系统,推动了生成式端到端自动驾驶、世界动作模型与多模态闭环驾驶基础模型的发展,并提出视觉几何动作模型的新范式。现在,我们开始关注更通用的机器人:

  • 如何让人形机器人具备通用全身智能
  • 如何利用触觉更好地实现灵巧抓取
DVGT-2:重建与轨迹规划DVGT-2 从流式视觉观察中联合重建稠密几何并预测行动轨迹。
10 秒片段 · 规划可视化DVGT-2 · 完整演示
相关工作与资源

研究时间线

规划与反馈

我们的自动驾驶研究连接了生成、空间理解、语言与行动。这些成果启发了面向人形机器人的进一步探索,但驾驶表现本身并不能证明通用全身控制或触觉灵巧操作能力。

  1. 已有工作探索端到端生成驾驶规划
  2. 已有工作探索连接世界模型与行动
  3. 待验证的研究目标探索全身智能与触觉灵巧操作

待研究的问题 如何让人形机器人协调移动与灵巧操作,并结合触觉和视觉反馈调整动作?

  1. 2024

    端到端自动驾驶

    GenAD 对比串行的感知、预测、规划流程与联合未来生成范式。
    生成式驾驶范式

    在统一的驾驶模型中连接感知、未来生成与规划。

  2. 2025

    世界动作模型

    Vega 根据同一场景中的不同指令,生成不同的驾驶轨迹与未来图像。
    指令条件下的行动计划

    以未来预测、语言与视觉几何为依据,形成驾驶决策。

  3. 2026

    全身通用智能

    从自动驾驶拓展到人形机器人的通用移动与灵巧操作。

    More coming soon

    探索人形机器人的通用移动、全身协调,以及基于触觉的灵巧操作。

大模型与 AI 安全

大模型与 AI 安全是物理超级智能(PSI)系统的共同技术基础。我们的研究从相似性度量学习与视觉表征开始,逐步发展到多模态大模型、空间智能体与AI内容鉴伪。

大模型:PSI Agent 的认知大脑

我们希望大模型成为 PSI Agent 连接感知、语言、推理与决策的认知核心。目前重点推进其中两项基础能力:高效多模态推理,以及在三维空间中的空间智能体。

  • SparseVLM压缩视觉 token,保留与问题相关的关键证据。
  • Proxy3D以紧凑的三维表示支撑视觉语言模型的空间推理。

More coming soon

我们正在探索多智能体进化与桌面智能体。

AI 安全:PSI Agent 的兜底机制

我们研究实现可靠、安全、友好 PSI Agent 的兜底机制。我们目前从生成内容验证切入:识别生成图像、发现生成视频中的伪造线索,并提供可供检查的证据。

  • UniGenDet联合学习图像生成与生成图像检测,引入可解释的反馈。
  • Skyra定位视频瑕疵出现的区域与时间,并解释问题所在。

More coming soon

我们希望从数字 AI 安全拓展到物理 AI 安全,从被动安全走向主动安全。

研究时间线

  1. 2017–2022

    相似性度量学习

    IDML 结合语义差异与不确定性比较图像。
    IDML 结合语义差异与不确定性比较图像。

    学习能够刻画结构、相似性与不确定性的表征。

  2. 2023

    视觉基础模型

    SpatialFormer 在图像 token 与显式空间 token 之间交换信息。
    SpatialFormer 在图像 token 与显式空间 token 之间交换信息。

    研究可迁移的视觉表征、监督方式与空间结构。

  3. 2024

    高效大模型

    SparseVLM 根据问题的不同,保留不同的视觉 token。
    高效多模态推理

    降低推理成本,同时保留与任务相关的视觉证据。

  4. 2025

    AI 内容鉴伪

    Skyra 对比视频瑕疵解释,并通过边界框与时间戳标注判断依据。
    视频瑕疵定位与解释

    识别生成内容,并检查其中的时空不一致。

  5. 2026

    空间智能体

    Proxy3D 将语义与几何编码器、三维代理表示生成器和语言模型连接起来,用于空间问答与定位。
    用于视觉语言推理的三维代理表示

    让大模型基于空间证据进行推理。

    More coming soon

    多智能体进化、桌面智能体。

未来展望

空间智能的基础地位

  • 物理规律在我们身处的三维世界中有更简洁、本质的表达(洞穴寓言)。从高维二维图像直接映射到低维动作空间,是低效的Scaling,容易学习到不通用的关联关系而造成模型幻觉。
  • 实现真正的PSI所需要的不只是Scale up被动采集数据,而是需要构建大规模多样的数字孪生世界用于闭环训练,最终结合LLM实现PSI的自进化。

世界模型与 LLM 的融合

  • 语言是人类长期发展出的对世界的高层表征,为LLM的自回归目标提供了良好的基础。但仅靠语言这一高层表征,难以充分刻画物理世界交互中的动力学。LLM和世界模型需要结合。
  • 兼顾生成与理解的世界表征有望推动语言、视觉与动作在表征和架构上的统一。我们希望理解、预测与决策在同一模型中协同发展,最终走向大一统模型。

人形机器人的崛起

  • 人形机器人是最有可能实现 PSI 的途径。人类活动提供了大量人类动作视频,关键在于如何把这些经验迁移到机器人的移动与操作,再通过机器人自身的反馈学习本体控制。
  • 现实世界中的大量设施围绕人的身体设计,我们看好人形机器人在无需大规模改造环境的前提下,进入既有人类空间并完成通用任务,同时与其他形态的专用机器人协同。

关于我

我目前是加州大学伯克利分校电气工程与计算机科学系的博士后,隶属于 BAIR,合作导师为 Kurt Keutzer。我在清华大学获得自动化博士学位,导师为 Jie Zhou 和 Jiwen Lu,并在清华大学获得物理学学士学位。

联系与合作

欢迎对世界模型、具身智能、空间智能、大模型感兴趣的同学与合作者交流。如有意参与 BAIR 或者清华大学的线下或远程科研实习,欢迎联系。

wenzhao.zheng@outlook.com

研究配图