李飞飞团队「世界模型」技术路线:可能是最务实的路线


从 4 篇最新论文,拆解斯坦福 AI Lab 的具身智能战略


引言:不玩花活的「世界模型」

2024 年以来,「世界模型」成为 AI 领域最火的概念之一。

李飞飞团队「世界模型」技术路线:可能是最务实的路线

OpenAI 做了 Sora,World Labs 做了视频生成,大家都在比谁能更好地「想象」这个世界。

李飞飞团队的世界模型,完全是另一个画风——他们不关心 AI 能不能生成一段逼真的视频,他们在乎的是:AI 能不能真的操控一个机器人,在物理世界里干活。

这不是在 мир (世界) 里画画,而是在世界里行动

本文基于李飞飞团队 2025-2026 年的 4 篇最新论文,系统解析她的「世界模型」技术路线这可能是目前最务实、最接近物理现实的世界模型方案。


01 从「看」到「做」:世界模型的两种哲学

在展开李飞飞团队的具体工作之前,有必要先澄清一个根本问题:什么是世界模型?

主流路线有两条:

引言:不玩花活的「世界模型」

路线代表核心理念
生成式Sora, World LabsAI 生成视频,想象物理世界的演化
具身式李飞飞团队AI 理解物理世界,并在其中有效行动

李飞飞团队选的是第二条。

用她本人的话说:“Intelligence cannot be separated from embodiment”——智能无法脱离身体存在。

一个能生成加州海岸线视频的模型很酷,但它不会帮你把桌子上的水杯放到洗碗机里。

李飞飞团队要做的,是让 AI 具备这种能力。


02 支柱一:Code-as-Policy — 用代码「组装」机器人的行动

引言:不玩花活的「世界模型」

论文:CaP-X (2026.03)

核心问题

传统的 VLA (Vision-Language-Action) 模型,需要海量数据才能让机器人学会各种动作。

但问题来了:

引言:不玩花活的「世界模型」

  1. 数据不够:不可能把所有家务动作都标注一遍
  2. 泛化困难:学会叠衣服,不等于会收拾桌子
  3. 可解释性差神经网络就是个黑箱,出了问题也不知道咋修

解决思路:让模型写代码

Code-as-Policy 的思路很直接:不让模型直接输出动作,而是让它生成可执行的代码

举个例子,当你说「把桌子上的苹果放到冰箱里」,传统 VLA 可能需要成千上万条数据来训练这个动作。

但 Code-as-Policy 模型会思考:

引言:不玩花活的「世界模型」

「我需要:

引言:不玩花活的「世界模型」

  1. 识别苹果的位置(视觉)
  2. 识别冰箱的位置(视觉)
  3. 规划抓取路径(运动规划
  4. 规划移动路径(导航)
  5. 执行抓取动作(控制) 」

然后把这些「认知」组合成一段代码,调用底层的感知和控制原语。

关键发现

团队在 CaP-Bench 上测试了 12 个前沿模型,发现了一个有趣的规律:

引言:不玩花活的「世界模型」

  • 性能随抽象层级提升:给模型越多人类设计好的「脚手架」(结构化先验),效果越好
  • 但依赖脚手架:去掉这些先验后,性能下降明显
  • test-time scaling 可以弥补:推理时多轮交互、集成推理、视觉差分……可以显著提升效果

这意味着:不需要疯狂堆数据,而是让模型在推理时多「想」一会儿。

技术贡献

引言:不玩花活的「世界模型」

  • CaP-Gym:交互式机器人环境
  • CaP-Agent0:训练-free 框架,达到人类水平可靠性
  • CaP-RL:强化学习 + 可验证奖励,sim2real 迁移

引言:不玩花活的「世界模型」

一句话总结:代码 = 机器人的「行动语言」。模型不需要记住所有动作,而是理解因果结构后,用代码表达策略。


03 支柱二:RAPiD — 机器人也需要「见机行事」

引言:不玩花活的「世界模型」

论文:RAPiD (2026.03)

核心问题

之前的机器人技术,擅长处理刚体——桌子、椅子、盒子,这些形状固定的东西。

但真实世界里到处都是可变形物体:衣服、窗帘、塑料袋、人的身体……

处理刚体那一套方法,用在可变形物体上完全失效。因为后者会拉伸、弯曲、褶皱状态空间无穷大。

解决思路:粒子动力学嵌入

团队提出了 RAPiD 方法,核心思想是:

把可变形物体想象成无数个粒子组成的系统。

引言:不玩花活的「世界模型」

  • 每个粒子的位置 = 物体的实时形状
  • 粒子之间的相对运动 = 物体的形变模式

两阶段学习:

引言:不玩花活的「世界模型」

阶段做什么用什么信息
Phase 1学习「看到这种形状,我该怎么动」模拟器的 privileged 信息(ground-truth 粒子位置)
Phase 2不用模拟器,只用摄像头和动作,学会推断形变非特权信息(视觉观察)

实验结果

引言:不玩花活的「世界模型」

  • 22 自由度的移动机械臂
  • 80%+ 成功率
  • 跨不同物体材质、形状、重量

引言:不玩花活的「世界模型」

一句话总结:世界模型必须理解「柔软」。真实物理世界不是刚体堆积,而是布料的伸展、液体的流动、人体的动作。


04 支柱三:Reflective Test-Time Planning — 机器人也需要「反思」

引言:不玩花活的「世界模型」

论文:Reflective Test-Time Planning (2026.02)

核心问题

现在的具身 LLM 很擅长推理,但有个致命缺陷:它不会从错误中学习。

每次执行任务都是「从零开始」——上次摔过的跟头,下次照摔不误。

这不像人类。人类做事会复盘:想想上次哪做错了,下次改。

解决思路:两种反思机制

团队引入了三种反思机制,让机器人真正具备学习能力:

引言:不玩花活的「世界模型」

机制功能类比
reflection-in-action执行前生成多个候选动作,内部反思评分,选最优三思而后行
reflection-on-action执行后根据结果更新反思模型和动作策略吃一堑长一智
retrospective reflection重新评估整个任务链条,做长期信用分配复盘 + 归纳

实验验证

引言:不玩花活的「世界模型」

  • Long-Horizon Household benchmark(长期家务任务)
  • MuJoCo Cupboard Fitting benchmark(高难度装配任务)
  • 真实机器人实验

效果显著优于基线模型

引言:不玩花活的「世界模型」

一句话总结:世界模型不是一次性推理机器。真实世界的 Agent 需要闭环反馈,需要从错误中进化。


05 Mirage 的警示:模型可能根本没「看」世界

引言:不玩花活的「世界模型」

论文:Mirage (2026.03)

惊人发现

这是最让人后背发凉的一篇论文。

团队发现,当前最先进的多模态模型,存在一个根本缺陷:

引言:不玩花活的「世界模型」

发现含义
模型对从未提供的图像生成详细描述可能在「幻觉」视觉理解
没有图像输入,仍在基准测试中获高分文本线索足以「猜」出答案
最极端案例:没看任何图像,却在胸部 X 光基准拿第一基准设计存在根本缺陷

根因

当 prompt 说「describe this image」时,模型被隐式暗示图像已提供,于是开始编造

只有当人类明确说「guess without seeing anything」时,模型才启用保守模式,性能大幅下降。

警示意义

这给所有世界模型研究者敲响警钟:

引言:不玩花活的「世界模型」

你的模型可能根本没有真正「看到」世界,只是根据语言线索在「猜」。

这就是为什么李飞飞团队坚持做具身智能——只有在物理世界中真正行动,才能验证模型是否理解世界。


06 技术路线的统一逻辑

把四篇论文串起来,李飞飞团队的世界模型路线图清晰可见:

引言:不玩花活的「世界模型」

引言:不玩花活的「世界模型」感知层(Perception)
    ↓ "AI 真的看到世界了吗?" (Mirage 警示)
表示层(Representation)
    ↓ "如何表示世界?" (代码/粒子/嵌入)
行动层(Action)
    ↓ "如何有效行动?" (CaP-X / RAPiD)
学习层(Learning)
    ↓ "如何从经验中学习?" (Reflective TTP)

演化路径:

引言:不玩花活的「世界模型」

引言:不玩花活的「世界模型」2015-2020: Sim2Real + 强化学习
    ↓
2021-2023: Foundation Models for Robotics (SayCan 系列)
    ↓
2024-2025: Code-as-Policy + 快速适应
    ↓
2025-2026: 反思机制 + groundedness 验证

07 与其他世界模型路线的对比

引言:不玩花活的「世界模型」

路线代表核心差异
生成式视频Sora, World Labs侧重「想象」物理世界
神经辐射场NVIDIA, Google侧重 3D 重建
李飞飞团队Stanford SAIL侧重具身行动
LeCunMeta AI (JEPA)侧重「世界预测」而非生成

08 总结:最务实的世界模型路线

李飞飞团队的世界模型,可以凝练为一句话:

引言:不玩花活的「世界模型」

不追求「完美模拟」世界,而追求「有效操控」世界。

三大支柱的协同:

引言:不玩花活的「世界模型」

  • Code-as-Policy:解决「如何表达策略」——用代码复用人类结构化知识
  • Rapid Adaptation:解决「如何适应物理」——从刚体到柔体的泛化
  • Reflective Learning:解决「如何持续进化」——从错误中学习的闭环

加上 Mirage 的警示:

引言:不玩花活的「世界模型」

世界模型的终极考验不是 benchmark 分数,而是能否在真实物理世界中可靠地行动


参考论文

引言:不玩花活的「世界模型」

Mirage: The Illusion of Visual Understanding (arXiv:2603.21687, 2026.03)

CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation (arXiv:2603.22435, 2026.03)

RAPiD: Rapid Adaptation of Particle Dynamics for Generalized Deformable Object Mobile Manipulation (arXiv:2603.18246, 2026.03)

Reflective Test-Time Planning for Embodied LLMs (arXiv:2602.21198, 2026.02)