Qwen-Image发布,复杂文字渲染成为图像模型新突破
8月4日,通义千问团队发布Qwen-Image。这是一款200亿参数的MMDiT图像基础模型,重点提升复杂文字渲染、通用图像生成和图像编辑能力,并同步提供在线体验、模型权重与技术资料。
文字一直是生成式图像中的难点。模型不仅要画出字形,还要理解多行排版、段落语义、字体结构和画面位置。根据官方介绍,Qwen-Image对中文、英文及复杂版式进行了专门训练,可用于海报、信息图、商品图和视觉概念稿等场景。
模型同时支持内容一致性编辑,能够在调整风格或局部元素时尽量保持原图主体和语义关系。对于企业内容生产而言,这意味着图像生成正在从“提供氛围参考”进一步进入带有文字和版式要求的正式素材制作环节。
不过,生成文字即使更清晰,也仍需逐字校对。涉及品牌名称、价格、合同信息和公开宣传语时,建议保留人工排版与审核步骤,避免将生成结果直接作为最终成品。
*本文为基于官方发布信息的中文摘要,详情以原文链接为准。