Google DeepMind发布Genie 3,文本可实时生成可探索世界
8月5日,Google DeepMind发布通用世界模型Genie 3。用户输入文字描述后,模型可以实时生成可探索的动态环境,并在720p分辨率、每秒24帧条件下维持数分钟的连续交互。
与普通视频生成不同,世界模型需要根据用户动作持续预测环境变化,并保持场景、物体和空间关系的一致性。Genie 3还支持通过提示改变天气、加入角色或触发新的世界事件。
这类模型可用于游戏原型、动画创作、教育模拟以及智能体和机器人的虚拟训练环境。对于AI研究而言,可持续交互的环境能够提供大量低风险测试场景,帮助评估智能体规划和行动能力。
目前Genie 3仍属于研究阶段,交互时长、文本呈现和真实物理模拟仍有限。企业更适合把它视为原型和研究工具,而不是直接替代成熟的三维开发流程。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。