Wenzhao Zheng

Wenzhao Zheng

加州大学伯克利分校博士后 · BAIR / Berkeley DeepDrive

世界模型与智能体
迈向可靠物理智能

我们研究如何让大语言模型与视觉语言模型同空间理解、世界模型和具身控制协同,构成闭环智能体系统。我们的目标是通过观测、预测、行动与反馈,将推理与物理世界连接起来,并将可靠性与效率贯穿其中。

物理AGI系统概念图:左侧共享的空间智能双向连接右侧三层:LLM/VLM 认知核心、世界模型和具身智能。各层之间保持双向联系,并保留认知与行动的直接通路。AI 安全与可靠性覆盖整个系统,系统通过观测、行动与反馈同物理环境交互。
共同技术基础 大模型 AI 安全

空间智能

几何、运动与空间记忆

我们从图像和视频中重建场景的几何与运动,研究内容包括语义占用、高斯表示、流式重建和隐式表面。一个贯穿这些工作的具体问题是:新的观测不断到来时,哪些信息应该被保留下来?

  • 连续场景几何与表面重建
  • 结构化运动与四维场景理解
  • 空间记忆与在线场景理解
IVGT 在多个场景中的彩色表面重建结果
IVGT:连续表面重建IVGT 学习隐式场景表征,支持连贯的表面提取与新视角渲染。
重建结果 · 2026 年 5 月IVGT · 交互式三维对比
相关工作与资源

研究时间线

场景表示的取舍

我们并不把表征的发展理解为简单的替代关系。深度、占据、点、高斯和隐式场各有取舍。我们更关心:如何保留智能体预测与行动所需的几何、运动和不确定性信息。

  1. 已有工作探索表示被占据的三维空间
  2. 已有工作探索持续维护几何与运动
  3. 待验证的研究目标建立与行动相关的空间记忆

待研究的问题 哪些信息必须跨越多次观察持续保留?哪些细节可以舍弃,而不影响之后的决策?

  1. 2023

    占用与自监督

    SurroundOcc 从环视相机预测占用,并利用稀疏激光雷达扫描生成稠密监督。
    稠密占用与标注生成

    描述完整空间,并降低获取监督信号的成本。

    更多工作 · 1
  2. 2024

    高斯场景表示

    S3Gaussian 将时空特征与高斯结合,重建街景、渲染新视角,并分离静态和动态内容。
    自监督动态街景重建

    依据几何与运动的需要,分配稀疏场景表示。

    更多工作 · 1
  3. 2025–2026

    流式几何与记忆

    SM4RT 重建运动中的秋千,并以彩色轨迹展示运动。
    结构化四维运动

    持续维护场景几何,从点走向表面与运动。

    更多工作 · 2

GitHub 数据截至: · 显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照: · 按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。

世界建模

生成表示与世界动态

我们研究如何表示和生成变化中的世界:SVG 探索面向生成的语义表示,OccWorld 与 OccSora 建模三维场景动态,Astra 则预测不同动作条件下的视觉序列。

  • 以行动为条件的视觉生成
  • 三维场景动态预测
  • 生成基础模型
Astra:左转条件生成这段预先生成的视频来自 Astra,以行动为条件预测未来。右转示例展示了同一场景下另一条轨迹的可能结果。
10 秒片段 · 生成视频Astra · 完整演示
相关工作与资源

研究时间线

什么样的预测有用?

SVG 研究面向生成的语义表示;OccWorld 与 OccSora 建模三维场景动态;Astra 探索动作条件视频生成。这些是相互补充的路线,并非逐代继承的一条模型链。我们的判断是:有用的世界模型既需要强大的生成基础,也需要能够区分不同动作后果的预测。

  1. 已有工作探索预测场景如何演化
  2. 已有工作探索预测不同行动下的未来
  3. 待验证的研究目标在交互中检验决策

待研究的问题 模型能否指出预测何时不可靠?智能体能否利用这个信号,选择更好的行动?

  1. 2023–2024

    生成场景动态

    OccSora 编码四维占用,并在不同轨迹条件下生成场景。
    轨迹条件四维生成

    从静态三维状态,走向可能的场景演化。

  2. 2025

    生成基础模型

    SVG 对比了基于 VAE 的扩散与在语义视觉特征空间中的生成。
    生成基础模型

    为视觉生成建立具有语义结构的潜空间。

  3. 2025

    动作条件下的未来

    Astra 以行动为条件的驾驶视频演示中的路口画面。
    生成式驾驶视频

    行动改变时,未来的观察会如何变化?

GitHub 数据截至: · 显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照: · 按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。

具身智能

从视觉观测到行动规划

在自动驾驶中,我们将场景几何和未来预测用于轨迹规划,近期也在研究语言指令与在线重建。我们关注的是:当新的观测与预测不一致时,智能体如何调整自己的计划。

  • 生成式预测与驾驶规划
  • 流式视觉、几何与行动模型
  • 以指令为条件的轨迹规划
DVGT-2:重建与轨迹规划DVGT-2 从流式视觉观察中联合重建稠密几何并预测行动轨迹。
10 秒片段 · 规划可视化DVGT-2 · 完整演示
相关工作与资源

研究时间线

规划与反馈

GenAD 探索联合未来生成;GaussianAD 与 DVGT-2 让规划立足于三维结构;Vega 引入语言指令;Doe-1 探索驾驶与世界建模之间的闭环。下一步挑战是当观测与计划不符时可靠地恢复:离线分数或模型内部的闭环,本身并不能证明真实世界中的可靠性。

  1. 已有工作探索联合生成未来轨迹
  2. 已有工作探索让指令与几何共同支持规划
  3. 待验证的研究目标根据反馈持续修正计划

待研究的问题 当现实偏离预测时,智能体应如何发现偏差、更新理解,并重新规划?

  1. 2024.02

    联合未来生成

    GenAD 对比串行的感知、预测、规划流程与联合未来生成范式。
    生成式驾驶范式

    将预测与规划纳入同一个生成问题。

  2. 2024.12

    空间结构与模型闭环

    GaussianAD 将语义高斯感知连接到未来场景预测与轨迹规划。
    高斯驱动的端到端驾驶

    将空间表示与想象的未来连接到决策。

  3. 2026

    从语言、几何到行动

    Vega 根据同一场景中的不同指令,生成不同的驾驶轨迹与未来图像。
    指令条件下的行动计划

    让期望行为立足于指令与重建的场景。

GitHub 数据截至: · 显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照: · 按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。

大模型与 AI 安全

理解、预测和行动都依赖两个基础:能从丰富观测中推理的大模型,以及判断模型输出是否可信的验证方法。

大模型:Agent 的认知大脑

我们希望大模型成为 Agent 连接感知、语言、推理与决策的认知核心。目前重点推进其中两项基础能力:高效多模态推理,以及有三维空间依据的理解。

  • SparseVLM压缩视觉 token,保留与问题相关的关键证据。
  • Proxy3D以紧凑的三维表示支撑视觉语言模型的空间推理。

AI 安全:让判断有据可查

我们目前从生成内容验证切入:识别生成图像、发现生成视频中的可见问题,并提供可供检查的证据。

  • UniGenDet联合学习图像生成与生成图像检测,引入可解释的反馈。
  • Skyra定位视频瑕疵出现的区域与时间,并解释问题所在。

下一步,我们希望将验证拓展到世界模型的预测和 Agent 的行动风险。这仍是开放研究目标,而非现有工作已经实现的安全保证。

研究时间线

  1. 2019

    表示学习

    HDML 在嵌入空间调节样本难度,并生成对应的特征。
    早期表示学习

    用更有信息量的训练样本塑造表示空间。

  2. 2024

    高效多模态推理

    SparseVLM 根据问题的不同,保留不同的视觉 token。
    高效多模态推理

    保留与问题相关的视觉证据。

  3. 2025–2026

    空间推理与内容验证

    Skyra 对比视频瑕疵解释,并通过边界框与时间戳标注判断依据。
    视频瑕疵定位与解释

    为大模型推理补充空间依据,让生成内容的问题可被定位和解释。

GitHub 数据截至: · 显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照: · 按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。

正在研究的问题

我们的长期目标是形成一个闭环:模型为行动提供依据,行动带来新的证据,新的证据再共同改进模型与智能体。

持续的世界理解

将空间记忆与动态预测结合,让智能体持续维护并更新对环境的建模。

在交互中学习

用预测结果指导决策,再从想象与实际观察的差异中学习。

高效且可验证的模型

发展紧凑表征与高效推理,同时探索检验预测、识别其局限性的方法。

关于我

我目前是加州大学伯克利分校电气工程与计算机科学系的博士后,隶属于 BAIRBerkeley DeepDrive,合作导师为 Kurt Keutzer。我在清华大学获得自动化博士学位,导师为 Jie Zhou 和 Jiwen Lu,此前在清华大学获得物理学学士学位。

联系与合作

欢迎对世界模型、具身智能体和可靠物理智能感兴趣的同学与合作者交流。如有意参与 BAIR 的线下或远程科研实习,欢迎联系。

wzzheng@berkeley.edu

研究配图