← 文章

2026.01.21

世界模型:为啥JEPA比认为是通往AGI最可行、非纯scaling的路线?

JEPA(Joint Embedding Predictive Architecture,联合嵌入预测架构)是Yann LeCun(图灵奖得主、Meta前首席AI科学家)从2022年开始大力推动的一种非生成式世界模型核心思路。

LeCun说,这被视为“通往AGI最可行、非纯scaling的路线”。

现在(2026年1月)它已经是LeCun新创业公司AMI Labs的基石技术,被视为“通往AGI最可行、非纯scaling的路线”。

JEPA很抽象,因为它不像Sora/Marble/Genie那样直接生成视频/3D世界让你“看到”效果。

它更像AI在脑子里默默构建一个抽象的“世界理解”,不画图、不吐像素,只预测“本质会怎样”。

JEPA像人类“脑补”而不是“重画”

你看到一个人从画面左边走进来,画面突然黑了半秒,你大脑不会去“脑补”每一根头发、每个像素的颜色变化,而是直接知道:“他大概率会继续往右走,姿势差不多,重力往下,脚会碰到地。”

这就是JEPA干的事,它不预测像素/细节(太费劲、太随机),而是预测抽象表示(高层次的“状态”:物体位置、运动方向、物体是否还在、因果关系等)。

生成式模型(像Sora)相当于强迫一帧一帧重画整张图,而JEPA相当于“AI在心里默念:接下来应该是这个意思”。

看视频预测下一步,输入一段视频的前几秒(一个人扔球)。

生成式模型,努力预测下一帧的每一个像素 → 经常模糊、幻觉、物理不对(球突然变大或消失)。

JEPA会把视频编码成一个抽象向量,比如“球在向上飞,速度X,重力影响Y,人手臂姿势Z,然后预测下一个抽象向量会是什么。

它不关心球的精确纹理、光影、背景噪声,只关心“可预测的本质规律”。所以更省算力、更稳、更接近“理解物理”而不是“模仿视频”。

JEPA有三块积木

首先它有两个编码器(Encoders)。一个看“上下文”(已知部分,比如视频前半段),一个看“目标”(要预测的部分,比如后半段)。它们把输入压成同一个“语言”——抽象向量空间。

其次,预测器(Predictor),只看上下文的向量,猜目标的向量应该长啥样。

第三,损失函数,不是比像素(L2距离),而是用能量函数(Energy-Based Model)。

匹配得好→能量低(好),不匹配→能量高(坏)。

训练时,强制模型把“可预测的东西”塞进向量里,把随机噪声/无关细节扔掉。

为什么LeCun说

JEPA是“AGI唯一可行路径”?

预测什么

生成式世界模型预测像素、帧或 3D 点云等细节(高分辨率的原始数据)。
JEPA 路线预测抽象表示或状态(本质的高层次特征和规律)。

计算代价

生成式模型极高,因为每帧都需要生成海量细节,计算资源消耗巨大。
JEPA 路线低很多,只在低维的向量/抽象空间中运算,避免了像素级重建的开销。

处理不确定性
生成式模型容易出现模糊、平均化或幻觉(因为必须“猜”每一个不确定像素)。
JEPA 天然忽略不可预测的部分(如树叶的随机晃动、背景噪声),只关注可预测的核心规律。

学到物理/常识

生成式模型主要靠海量数据通过统计“涌现”出物理规律。

JEPA 通过强制学习可预测规律、更接近因果关系和不变性(invariance),学得更本质、更稳健。

规划/推理能力

生成式模型需要额外添加规划模块,容易出错或不稳定。

JEPA 天生适合规划,因为它在向量/抽象空间中操作,优化轨迹和决策更高效、直接。

当前,演示效果
中,生成式模型看起来很炫,能直接生成视频或交互世界,给人强烈视觉冲击。

JEPA 不炫(没有直接画面输出),但在下游任务(如规划、机器人控制、效率基准)上表现更稳、更高效。

总体来说,生成式模型擅长产生可见、可直接使用的输出(适合演示和某些应用),而 JEPA 更注重高效的“内在理解”和长期推理,被LeCun视为通往真正 AGI/具身智能的潜力路径。

(AI生成,科普学习)


原文链接:https://mp.weixin.qq.com/s/QhC4K9j2FwQv13GRTLoi4g

来源:XT

本文所属主题:AI 工程战略 枢纽 →

相关文章