Meta发布V-JEPA 2,世界模型探索视频理解与机器人规划
6月11日,Meta发布V-JEPA 2世界模型,并开放代码与模型检查点。该模型主要通过视频学习物体、动作和环境变化规律,目标是让AI具备理解当前状态、预测后续变化并规划行动的能力。
根据Meta披露,V-JEPA 2参数规模为12亿,预训练阶段使用超过100万小时视频和100万张图片;在后续阶段,又使用62小时机器人数据加强与动作相关的预测能力。官方展示中,模型可在未专门适配的新环境中,为机器人执行抓取和放置任务提供规划。
世界模型与普通视觉识别模型的区别,在于它不仅判断画面里有什么,还尝试预测“采取某个动作后会发生什么”。这一方向可能应用于机器人、自动化设备、仓储操作和具身智能,但实验演示与生产环境之间仍存在光照变化、遮挡、传感器误差和安全控制等差距。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。