从 4 篇最新论文,拆解斯坦福 AI Lab 的具身智能战略
引言:不玩花活的「世界模型」
2024 年以来,「世界模型」成为 AI 领域最火的概念之一。

OpenAI 做了 Sora,World Labs 做了视频生成,大家都在比谁能更好地「想象」这个世界。
但李飞飞团队的世界模型,完全是另一个画风——他们不关心 AI 能不能生成一段逼真的视频,他们在乎的是:AI 能不能真的操控一个机器人,在物理世界里干活。
这不是在 мир (世界) 里画画,而是在世界里行动。
本文基于李飞飞团队 2025-2026 年的 4 篇最新论文,系统解析她的「世界模型」技术路线。这可能是目前最务实、最接近物理现实的世界模型方案。
01 从「看」到「做」:世界模型的两种哲学
在展开李飞飞团队的具体工作之前,有必要先澄清一个根本问题:什么是世界模型?
主流路线有两条:
引言:不玩花活的「世界模型」
| 路线 | 代表 | 核心理念 |
|---|---|---|
| 生成式 | Sora, World Labs | AI 生成视频,想象物理世界的演化 |
| 具身式 | 李飞飞团队 | AI 理解物理世界,并在其中有效行动 |
李飞飞团队选的是第二条。
用她本人的话说:“Intelligence cannot be separated from embodiment”——智能无法脱离身体存在。
一个能生成加州海岸线视频的模型很酷,但它不会帮你把桌子上的水杯放到洗碗机里。
李飞飞团队要做的,是让 AI 具备这种能力。
02 支柱一:Code-as-Policy — 用代码「组装」机器人的行动
引言:不玩花活的「世界模型」
论文:CaP-X (2026.03)
核心问题
传统的 VLA (Vision-Language-Action) 模型,需要海量数据才能让机器人学会各种动作。
但问题来了:
引言:不玩花活的「世界模型」
- 数据不够:不可能把所有家务动作都标注一遍
- 泛化困难:学会叠衣服,不等于会收拾桌子
- 可解释性差:神经网络就是个黑箱,出了问题也不知道咋修
解决思路:让模型写代码
Code-as-Policy 的思路很直接:不让模型直接输出动作,而是让它生成可执行的代码。
举个例子,当你说「把桌子上的苹果放到冰箱里」,传统 VLA 可能需要成千上万条数据来训练这个动作。
但 Code-as-Policy 模型会思考:
引言:不玩花活的「世界模型」
「我需要:
引言:不玩花活的「世界模型」
- 识别苹果的位置(视觉)
- 识别冰箱的位置(视觉)
- 规划抓取路径(运动规划)
- 规划移动路径(导航)
- 执行抓取动作(控制) 」
然后把这些「认知」组合成一段代码,调用底层的感知和控制原语。
关键发现
团队在 CaP-Bench 上测试了 12 个前沿模型,发现了一个有趣的规律:
引言:不玩花活的「世界模型」
- 性能随抽象层级提升:给模型越多人类设计好的「脚手架」(结构化先验),效果越好
- 但依赖脚手架:去掉这些先验后,性能下降明显
- test-time scaling 可以弥补:推理时多轮交互、集成推理、视觉差分……可以显著提升效果
这意味着:不需要疯狂堆数据,而是让模型在推理时多「想」一会儿。
技术贡献
引言:不玩花活的「世界模型」
- CaP-Gym:交互式机器人环境
- CaP-Agent0:训练-free 框架,达到人类水平可靠性
- CaP-RL:强化学习 + 可验证奖励,sim2real 迁移
引言:不玩花活的「世界模型」
一句话总结:代码 = 机器人的「行动语言」。模型不需要记住所有动作,而是理解因果结构后,用代码表达策略。
03 支柱二:RAPiD — 机器人也需要「见机行事」
引言:不玩花活的「世界模型」
论文:RAPiD (2026.03)
核心问题
之前的机器人技术,擅长处理刚体——桌子、椅子、盒子,这些形状固定的东西。
但真实世界里到处都是可变形物体:衣服、窗帘、塑料袋、人的身体……
处理刚体那一套方法,用在可变形物体上完全失效。因为后者会拉伸、弯曲、褶皱,状态空间无穷大。
解决思路:粒子动力学嵌入
团队提出了 RAPiD 方法,核心思想是:
把可变形物体想象成无数个粒子组成的系统。
引言:不玩花活的「世界模型」
- 每个粒子的位置 = 物体的实时形状
- 粒子之间的相对运动 = 物体的形变模式
两阶段学习:
引言:不玩花活的「世界模型」
| 阶段 | 做什么 | 用什么信息 |
|---|---|---|
| Phase 1 | 学习「看到这种形状,我该怎么动」 | 模拟器的 privileged 信息(ground-truth 粒子位置) |
| Phase 2 | 不用模拟器,只用摄像头和动作,学会推断形变 | 非特权信息(视觉观察) |
实验结果
引言:不玩花活的「世界模型」
- 22 自由度的移动机械臂
- 80%+ 成功率
- 跨不同物体材质、形状、重量
引言:不玩花活的「世界模型」
一句话总结:世界模型必须理解「柔软」。真实物理世界不是刚体堆积,而是布料的伸展、液体的流动、人体的动作。
04 支柱三:Reflective Test-Time Planning — 机器人也需要「反思」
引言:不玩花活的「世界模型」
论文:Reflective Test-Time Planning (2026.02)
核心问题
现在的具身 LLM 很擅长推理,但有个致命缺陷:它不会从错误中学习。
每次执行任务都是「从零开始」——上次摔过的跟头,下次照摔不误。
这不像人类。人类做事会复盘:想想上次哪做错了,下次改。
解决思路:两种反思机制
团队引入了三种反思机制,让机器人真正具备学习能力:
引言:不玩花活的「世界模型」
| 机制 | 功能 | 类比 |
|---|---|---|
| reflection-in-action | 执行前生成多个候选动作,内部反思评分,选最优 | 三思而后行 |
| reflection-on-action | 执行后根据结果更新反思模型和动作策略 | 吃一堑长一智 |
| retrospective reflection | 重新评估整个任务链条,做长期信用分配 | 复盘 + 归纳 |
实验验证
引言:不玩花活的「世界模型」
- Long-Horizon Household benchmark(长期家务任务)
- MuJoCo Cupboard Fitting benchmark(高难度装配任务)
- 真实机器人实验
效果显著优于基线模型。
引言:不玩花活的「世界模型」
一句话总结:世界模型不是一次性推理机器。真实世界的 Agent 需要闭环反馈,需要从错误中进化。
05 Mirage 的警示:模型可能根本没「看」世界
引言:不玩花活的「世界模型」
论文:Mirage (2026.03)
惊人发现
这是最让人后背发凉的一篇论文。
团队发现,当前最先进的多模态模型,存在一个根本缺陷:
引言:不玩花活的「世界模型」
| 发现 | 含义 |
|---|---|
| 模型对从未提供的图像生成详细描述 | 可能在「幻觉」视觉理解 |
| 没有图像输入,仍在基准测试中获高分 | 文本线索足以「猜」出答案 |
| 最极端案例:没看任何图像,却在胸部 X 光基准拿第一 | 基准设计存在根本缺陷 |
根因
当 prompt 说「describe this image」时,模型被隐式暗示图像已提供,于是开始编造。
只有当人类明确说「guess without seeing anything」时,模型才启用保守模式,性能大幅下降。
警示意义
这给所有世界模型研究者敲响警钟:
引言:不玩花活的「世界模型」
你的模型可能根本没有真正「看到」世界,只是根据语言线索在「猜」。
这就是为什么李飞飞团队坚持做具身智能——只有在物理世界中真正行动,才能验证模型是否理解世界。
06 技术路线的统一逻辑
把四篇论文串起来,李飞飞团队的世界模型路线图清晰可见:
引言:不玩花活的「世界模型」
引言:不玩花活的「世界模型」感知层(Perception)
↓ "AI 真的看到世界了吗?" (Mirage 警示)
表示层(Representation)
↓ "如何表示世界?" (代码/粒子/嵌入)
行动层(Action)
↓ "如何有效行动?" (CaP-X / RAPiD)
学习层(Learning)
↓ "如何从经验中学习?" (Reflective TTP)
演化路径:
引言:不玩花活的「世界模型」
引言:不玩花活的「世界模型」2015-2020: Sim2Real + 强化学习
↓
2021-2023: Foundation Models for Robotics (SayCan 系列)
↓
2024-2025: Code-as-Policy + 快速适应
↓
2025-2026: 反思机制 + groundedness 验证
07 与其他世界模型路线的对比
引言:不玩花活的「世界模型」
| 路线 | 代表 | 核心差异 |
|---|---|---|
| 生成式视频 | Sora, World Labs | 侧重「想象」物理世界 |
| 神经辐射场 | NVIDIA, Google | 侧重 3D 重建 |
| 李飞飞团队 | Stanford SAIL | 侧重具身行动 |
| LeCun | Meta AI (JEPA) | 侧重「世界预测」而非生成 |
08 总结:最务实的世界模型路线
李飞飞团队的世界模型,可以凝练为一句话:
引言:不玩花活的「世界模型」
不追求「完美模拟」世界,而追求「有效操控」世界。
三大支柱的协同:
引言:不玩花活的「世界模型」
- Code-as-Policy:解决「如何表达策略」——用代码复用人类结构化知识
- Rapid Adaptation:解决「如何适应物理」——从刚体到柔体的泛化
- Reflective Learning:解决「如何持续进化」——从错误中学习的闭环
加上 Mirage 的警示:
引言:不玩花活的「世界模型」
世界模型的终极考验不是 benchmark 分数,而是能否在真实物理世界中可靠地行动。
参考论文
引言:不玩花活的「世界模型」
Mirage: The Illusion of Visual Understanding (arXiv:2603.21687, 2026.03)
CaP-X: A Framework for Benchmarking and Improving Coding Agents for Robot Manipulation (arXiv:2603.22435, 2026.03)
RAPiD: Rapid Adaptation of Particle Dynamics for Generalized Deformable Object Mobile Manipulation (arXiv:2603.18246, 2026.03)
Reflective Test-Time Planning for Embodied LLMs (arXiv:2602.21198, 2026.02)