快科技7月21日消息,阿里今日正式发布新一代图像生成基础模型Qwen-Image-3.0。
该模型支持最长4500个token的指令输入,能够一次性生成融合公式符号、几何图形、逻辑推导步骤等多种元素的复杂知识图解和精细UI界面。
同时,模型原生支持12种语言和20余款字体的精准渲染,字迹清晰锐利,大幅降低多语言产品海报、影视及漫画分镜等可商用素材的制作成本。
作为千问图像生成与编辑模型系列的第三代基础版本,Qwen-Image-3.0在核心能力上实现了全面进化。
此前GPT-Image-2擅长的直播间页面,Qwen-Image-3.0同样能轻松驾驭,从人像摄影到数学试卷,再到古碑拓片,生成的图片细节丰富、生动逼真。
此次升级的重点在于显著强化了对复杂信息的承载能力,文本输入长度相比前代提升了4.5倍。
这意味着,在影视短剧分镜、复杂信息图表、产品说明页等需要大量提示描述的场景中,用户无需再将需求精简为一句话。
而是可以像为设计师撰写需求文档那样,完整描绘画面结构、文字内容、视觉风格和排版细节,让模型更精确地生成图文内容,有效减少反复修改和人工调校的成本。
凭借在语义并置和空间控制上的出色把握,新模型可一次性生成涵盖9个不同领域的九宫格知识图解,每个格子内的文字都清晰可辨、内容准确无误。
此外,Qwen-Image-3.0还具备更充实的知识储备,能够轻松理解复杂指令和画面中的逻辑嵌套关系。
新模型能够根据单条指令,在一幅图中同时生成网页、软件界面、聊天窗口、海报等多类视觉元素的组合式表达。
例如,当用户输入“在VSCode编程界面中,通过千问App生成一张发布在聊天界面里的手冲咖啡海报”时,模型能够准确解析其中多层UI的嵌套关系,依次生成VSCode编程界面、千问App界面、社交媒体聊天界面和咖啡海报。在保持各层界面结构与风格准确的同时,连手机截屏中的时间数字以及低至10像素的微小文字都清晰可辨。

图说:Qwen-image-3.0生成的多层UI界面嵌套模拟图片
模型在文生图过程中积累的文字渲染能力、细节质感和世界知识,也被迁移到了图像编辑场景。古画修复、全景图生成、手绘草图转PPT、多镜头机位生成等复杂编辑任务,均可一键完成。
用户无需在生成与编辑工具之间反复切换,也不必担心风格、文字、细节在二次处理时出现偏差。
据了解,阿里云百炼及千问平台已开放API邀测,Qwen Studio和千问APP也即将上线,供用户免费体验。