大模型:Agent 的认知大脑
我们希望大模型成为 Agent 连接感知、语言、推理与决策的认知核心。目前重点推进其中两项基础能力:高效多模态推理,以及有三维空间依据的理解。
我们研究如何让大语言模型与视觉语言模型同空间理解、世界模型和具身控制协同,构成闭环智能体系统。我们的目标是通过观测、预测、行动与反馈,将推理与物理世界连接起来,并将可靠性与效率贯穿其中。
我们从图像和视频中重建场景的几何与运动,研究内容包括语义占用、高斯表示、流式重建和隐式表面。一个贯穿这些工作的具体问题是:新的观测不断到来时,哪些信息应该被保留下来?
视频加载失败,可通过下方项目链接查看原始演示。
视频加载失败,可通过下方项目链接查看原始演示。
我们并不把表征的发展理解为简单的替代关系。深度、占据、点、高斯和隐式场各有取舍。我们更关心:如何保留智能体预测与行动所需的几何、运动和不确定性信息。
待研究的问题 哪些信息必须跨越多次观察持续保留?哪些细节可以舍弃,而不影响之后的决策?
描述完整空间,并降低获取监督信号的成本。
依据几何与运动的需要,分配稀疏场景表示。
持续维护场景几何,从点走向表面与运动。
GitHub 数据截至:
·
显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照:
·
按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。
我们研究如何表示和生成变化中的世界:SVG 探索面向生成的语义表示,OccWorld 与 OccSora 建模三维场景动态,Astra 则预测不同动作条件下的视觉序列。
视频加载失败,可通过下方项目链接查看原始演示。
视频加载失败,可通过下方项目链接查看原始演示。
视频加载失败,可通过下方项目链接查看原始演示。
SVG 研究面向生成的语义表示;OccWorld 与 OccSora 建模三维场景动态;Astra 探索动作条件视频生成。这些是相互补充的路线,并非逐代继承的一条模型链。我们的判断是:有用的世界模型既需要强大的生成基础,也需要能够区分不同动作后果的预测。
待研究的问题 模型能否指出预测何时不可靠?智能体能否利用这个信号,选择更好的行动?
从静态三维状态,走向可能的场景演化。
为视觉生成建立具有语义结构的潜空间。
行动改变时,未来的观察会如何变化?
GitHub 数据截至:
·
显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照:
·
按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。
在自动驾驶中,我们将场景几何和未来预测用于轨迹规划,近期也在研究语言指令与在线重建。我们关注的是:当新的观测与预测不一致时,智能体如何调整自己的计划。
视频加载失败,可通过下方项目链接查看原始演示。
GenAD 探索联合未来生成;GaussianAD 与 DVGT-2 让规划立足于三维结构;Vega 引入语言指令;Doe-1 探索驾驶与世界建模之间的闭环。下一步挑战是当观测与计划不符时可靠地恢复:离线分数或模型内部的闭环,本身并不能证明真实世界中的可靠性。
待研究的问题 当现实偏离预测时,智能体应如何发现偏差、更新理解,并重新规划?
将预测与规划纳入同一个生成问题。
将空间表示与想象的未来连接到决策。
让期望行为立足于指令与重建的场景。
GitHub 数据截至:
·
显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照:
·
按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。
理解、预测和行动都依赖两个基础:能从丰富观测中推理的大模型,以及判断模型输出是否可信的验证方法。
我们希望大模型成为 Agent 连接感知、语言、推理与决策的认知核心。目前重点推进其中两项基础能力:高效多模态推理,以及有三维空间依据的理解。
我们目前从生成内容验证切入:识别生成图像、发现生成视频中的可见问题,并提供可供检查的证据。
下一步,我们希望将验证拓展到世界模型的预测和 Agent 的行动风险。这仍是开放研究目标,而非现有工作已经实现的安全保证。
用更有信息量的训练样本塑造表示空间。
保留与问题相关的视觉证据。
为大模型推理补充空间依据,让生成内容的问题可被定位和解释。
GitHub 数据截至:
·
显示查询时的仓库累计数量,非各节点当时的历史数量。
Semantic Scholar 引用快照:
·
按论文统计,收录范围与 Google Scholar 不同;暂无数据不代表零引用。
我们的长期目标是形成一个闭环:模型为行动提供依据,行动带来新的证据,新的证据再共同改进模型与智能体。
将空间记忆与动态预测结合,让智能体持续维护并更新对环境的建模。
用预测结果指导决策,再从想象与实际观察的差异中学习。
发展紧凑表征与高效推理,同时探索检验预测、识别其局限性的方法。
我目前是加州大学伯克利分校电气工程与计算机科学系的博士后,隶属于 BAIR 与 Berkeley DeepDrive,合作导师为 Kurt Keutzer。我在清华大学获得自动化博士学位,导师为 Jie Zhou 和 Jiwen Lu,此前在清华大学获得物理学学士学位。