Meta发布V-JEPA 2,世界模型探索视频理解与机器人规划

发布时间:2025-06-12 分类:行业洞察 原文:查看原文 阅读:1分钟
Meta发布V-JEPA 2,世界模型探索视频理解与机器人规划

6月11日,Meta发布V-JEPA 2世界模型,并开放代码与模型检查点。该模型主要通过视频学习物体、动作和环境变化规律,目标是让AI具备理解当前状态、预测后续变化并规划行动的能力。

根据Meta披露,V-JEPA 2参数规模为12亿,预训练阶段使用超过100万小时视频和100万张图片;在后续阶段,又使用62小时机器人数据加强与动作相关的预测能力。官方展示中,模型可在未专门适配的新环境中,为机器人执行抓取和放置任务提供规划。

世界模型与普通视觉识别模型的区别,在于它不仅判断画面里有什么,还尝试预测“采取某个动作后会发生什么”。这一方向可能应用于机器人、自动化设备、仓储操作和具身智能,但实验演示与生产环境之间仍存在光照变化、遮挡、传感器误差和安全控制等差距。

*本文为基于官方发布信息的中文摘要,详情以原文链接为准。

获取适合企业发展的解决方案

围绕企业业务目标与组织需求,提供面向实际场景的产品与服务支持