7月21日,阿里正式发布了千问图像生成和编辑模型系列的第三代基础模型——Qwen-Image-3.0。如果说前代模型的关键词是“准”与“美”,那么Qwen-Image-3.0的核心主线则聚焦于一个“实”字,标志着AI生图正从追求视觉惊艳的“好看”,全面迈向满足实际工作需求的“好用”。

此次升级的核心突破,在于将支持的指令长度大幅提升至4.5k token,实现了4.5倍的跃升。这意味着用户不再需要将需求压缩成简单的一句话,而是可以像给设计师撰写需求文档一样,完整描述画面结构、文字内容和排版细节。凭借对语义并置与空间控制的极致把握,Qwen-Image-3.0能够一次性生成涵盖公式符号、几何图形、逻辑推导步骤等多元素融合的复杂版面。例如,它能准确渲染包含多行复杂公式推导、上下标及LaTeX排版元素的学术论文,甚至能一次性生成包含9种不同领域知识图解的复杂九宫格,字字清晰,幅幅准确。

在细节呈现上,Qwen-Image-3.0达到了微观级的真实刻画。模型不仅支持10px小字的精准渲染,连肌肤质感、毛孔与发丝都能纤毫毕现,逼真度逼近摄影级真实。此外,它还支持12国语言和20多款字体的原生渲染,能够高度仿真主流网页、游戏、直播等UI界面,甚至能根据一条指令,在同一幅图中层层递进地生成“画中画”式的复杂逻辑嵌套界面。

Qwen-Image-3.0的问世,大幅降低了多语言产品海报、影视/漫画分镜、复杂信息图及试卷等“可读可用”商业素材的生产成本。目前,阿里云百炼、千问AI平台已开通API邀测,Qwen Studio和千问APP也即将上线供用户免费体验。