Qwen2.5-VL发布,视觉模型加强文档、视频与界面理解
1月26日,通义千问团队发布Qwen2.5-VL视觉语言模型,并开放3B、7B和72B三种规模的基础模型与指令模型。不同参数规模覆盖边缘设备、常规开发和复杂视觉任务,为开发者提供了更细分的部署选择。
根据Qwen团队介绍,Qwen2.5-VL不仅能够识别常见物体,还加强了文本、图表、图标、页面布局和扫描文档的理解能力。模型支持从发票、表单和表格中提取结构化信息,也能够对较长视频进行理解,并定位与事件相关的时间片段。
此次更新还强调视觉智能体能力。模型可以结合屏幕画面进行推理,并执行电脑或手机操作相关任务。相比单纯回答“图片里有什么”,视觉智能体需要进一步理解界面结构、判断操作目标并输出坐标或结构化结果,这为后台录入、页面测试和跨系统信息处理提供了新的技术路径。
不过,文档识别和界面操作对准确率要求较高。发票金额、合同条款、页面按钮和坐标一旦识别错误,可能直接影响后续流程。企业应用时应保留原始图片、结构化结果和人工校验记录,并对不同类型的图片分别评估。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。