Gemini 2.5 Computer Use发布,模型开始直接操作网页界面
10月7日,Google发布Gemini 2.5 Computer Use预览模型。该模型建立在Gemini 2.5 Pro的视觉理解与推理能力上,可根据截图和操作历史完成点击、输入、滚动等界面操作。
模型通过Gemini API中的computer_use工具进入循环:系统提交任务与截图,模型返回操作指令,客户端执行后再把新页面状态传回模型,直到任务完成或被终止。
这类能力可用于没有完善API的后台录入、表单处理和跨页面资料整理。但网页环境可能包含恶意提示、广告、弹窗和不可逆操作,风险高于普通文本生成。
企业应设置可访问网站、账号权限和动作范围,并在购买、提交、删除和发送等关键环节要求人工确认。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。