标签:World Model JEPA Representation Learning Robot Control Self-supervised
LeWM 是首个仅用两项损失函数、从原始像素端到端稳定训练的 JEPA 世界模型,规划速度比基础模型方案快 48 倍,在多种控制任务中保持竞争力。
JEPA(Joint Embedding Predictive Architecture)在紧凑隐空间中学习世界模型,但现有方法极易出现表示坍塌(Representation Collapse),不得不依赖:
这些方法要么不能端到端训练,要么超参众多、训练不稳定。
ℒ_LeWM = ℒ_pred + λ · SIGReg(Z)
ℒ_pred = ‖ẑ_{t+1} − z_{t+1}‖² ← 下一帧嵌入预测(MSE)
SIGReg(Z) ← 强制隐嵌入服从各向同性高斯分布