当前位置:首页 > AI资讯 > 正文内容

抛弃预测像素:JEPA引领世界模型新范式

admin2小时前AI资讯5

抛弃预测像素:JEPA引领世界模型新范式

引言

当“堆大模型、喂更多 token”不再显著带来能力跃升,AI 行业把目光转向“世界模型”。问题的本质并不在于生成更清晰的画面或更通顺的语言,而在于机器是否真正理解物理世界:能否预测行动的后果、据此制定计划并稳健执行。Yann LeCun 在 ECCV 2026 的主旨演讲给出了尖锐判断——“预测像素是伪命题”,语言与 token 无法跨越通向物理智能的门槛;答案在于抽象表征与可预测结构,代表方案是 JEPA(联合嵌入预测架构)。

为什么“预测像素”走不通

像素预测与表征预测对比示意

“下一帧视频该长什么样?”看似自然的目标,却暗藏根本性的不可辨识:镜头外有人突然闯入、光线骤变、风把纸张吹起——这些决定性变量并不存在于当前帧的像素里。直接拟合像素让模型承担了两种负担:
- 不确定性的幻觉:未来是多模态的,逼迫模型在像素空间“平均”多种可能,既浪费算力,又稀释结构。
- 与任务目标错位:规划和控制需要的是因果、物理约束和可控变量,而不是纹理、噪声与光照细节。
- 评估误导:更小的像素误差或更逼真的视频,并不等价于更好的物理理解与长期一致性。

“预测像素”的困难不是工程调参能解决的,而是目标设定本身偏离了智能的要义:为行动服务的可预测表征与推理。

JEPA:在抽象表征里预测未来

JEPA 抽象表征与行动预测流程图

JEPA 的核心转向是“先抽象再预测”。它通过编码器将感知数据压缩成抽象表征,主动丢弃短时不可预测的细节,只保留与动态、因果和控制相关的结构;随后在表征空间进行未来预测与一致性约束,而非在像素空间生成下一帧。

这一思路带来三点优势:
- 去噪与聚焦:把建模能力集中在可预测、可规划的因素上,提高样本效率与泛化。
- 可条件的可控性:表征预测可自然接入行动条件(action-conditional),支持“预测行动后果—反向规划—执行”的闭环。
- 训练更稳健:对比式或能量式目标在表征空间学习相容性,避免像素级生成的发散与评估困境。

与其把算力花在复刻像素,不如让系统在“能被用来决策”的空间里学习世界的动力学约束。这也是“只靠语言和 token 不足以达成人类水平智能”的技术理由:物理世界的连续性与可控性,必须在传感器与交互中学习,而不是从文本统计中外推。

四条世界模型路线:复刻还是推理?

当前“世界模型”有四种主流路线,各有赌注与短板:
- 赌涌现(视频生成):Sora、Genie 等希望从高拟真的下一帧中“长出”物理规律。长处在于感知丰富度与可视化,短板在于不确定性与规划对齐问题。
- 赌几何(三维一致性):自底层约束 3D 结构,生成可探索场景。长于空间一致与交互可用性,但对动力学与因果仍需补课。
- 赌仿真(物理引擎):Cosmos、Omniverse 用明确物理法则训练机器人。优势是可控与可验证,难点在于现实差距(sim2real)与场景覆盖。
- 赌表征(JEPA):不复刻像素,专注抽象预测与可控变量。强于规划耦合与泛化潜力,挑战是表征可解释性与与下游控制的接口标准化。

更合理的走向并非二选一,而是互补:几何与仿真提供先验与可验证环境,生成模型承担数据合成与可视化,JEPA 打造以行动为目标的抽象预测与规划核心。

影响与展望

如果把智能看作“感知—记忆—推理—行动”的闭环,行业需要几项系统性调整:
- 数据与训练范式转向
- 从纯文本扩展到视频、触觉、力反馈等多传感器数据,鼓励主动交互与自监督。
- 评估指标从像素保真度转向长期一致性、任务成功率与动力学不变量。
- 架构层面的重排
- 用联合嵌入连接“世界模型—规划器—控制器—记忆”;LLM 更像知识检索与语言接口,而非中枢。
- 在表征空间进行代价学习与策略搜索,降低对大规模生成的依赖。
- 工程与生态挑战
- 表征的可解释性与可控性;跨模态时间对齐;安全与长尾鲁棒性。
- 开放的交互式数据管线与标准化评测套件,避免只在“可视化漂亮”的指标上内卷。

LeCun 的三条“逆风”建议因此并非口号,而是路线校准:
- 少迷信纯生成,重目标对齐与行动可用性。
- 不再把 LLM 当作万能中枢,回到表征与世界模型的基本功。
- 以 JEPA 为代表,在抽象空间学习预测与规划。

可以预期,未来两三年内,能在开放居家环境完成多步任务的轻量机器人原型,将更多依赖“表征预测—行动规划”的内核;行业指标也将从“下一帧多逼真”转向“长时任务稳定完成率”。当机器真正学会在抽象空间预测并据此行动,跨越物理世界门槛的那一步,才算迈出。

标签: 世界模型 JEPA Yann LeCun 生成式AI 机器人

相关文章

生成式AI ROI达49%,智能体如何落地变现

从试验田到生产线:生成式 AI 与智能体的 ROI 兑现之路 过去几年,生成式 AI 的风潮席卷全球,企业纷纷投入资源进行试点探索。然而,随着技术逐渐成熟,讨论的焦点已从“AI 能做什么”转向“AI...

上海发力新一代通用人工智能技术突破

上海加速布局人工智能新赛道:从技术攻关到产业落地的全面突围 在数字经济浪潮席卷全球的当下,人工智能已成为城市竞争的核心引擎。近日,上海市人民政府办公厅正式印发《国家数字经济创新发展试验区(上海)实施方...

Kimi K2.6工程化突破:从做题到造系统

从“做题”到“造系统”:Kimi K2.6 的工程化跃迁 4月20日深夜,月之暗面悄然发布并开源了其最新旗舰模型 Kimi K2.6。这并非一次常规的模型迭代,而是一场关于 AI 能力边界的重新定义。...

商汤绝影Sage端侧大模型颠覆车载AI格局

端侧智能体的破局者:商汤绝影Sage如何改写车载AI格局 当AI全面迈入智能体时代,汽车行业却长期陷入一个尴尬的“两难”:依赖云端大模型实现复杂任务处理,意味着高延迟与高成本;而坚守端侧部署,又只能实...

Token成本飙升,企业AI如何提升性价比

Token膨胀时代:企业AI转型的“性价比”新考题 过去一年,大模型推理成本每百万Token下降约75%,但企业Token消耗量的增长斜率却远超成本优化曲线。OpenRouter数据显示,截至2026...

DeepSeek V4发布:技术理想与商业现实的博弈

从技术理想主义到商业现实的转身:DeepSeek V4的发布与未解之问 靴子终于落地。在经历了近三个月“下周发布”的调侃与猜测后,DeepSeek V4终于正式亮相。1.6T的最大参数量、1M的上下文...

发表评论

访客

◎欢迎参与讨论,请在这里发表您的看法和观点。