TL;DR:
阿里千问推出了Qwen-Image-3.0,文本输入长度直接翻了4.5倍,从此AI画图能读懂你的长篇大论了!还能在画面里嵌套UI界面、聊天窗口、甚至咖啡海报,简直是套娃式创意。更秀的是生成和编辑一体化,省去多次调试的烦恼。(但实际效果如何,还得上手试试才知道~)
很长一段时间里,用AI画图最让人头大的就是提示词限制——你想描述清楚画面里的每个元素、文字风格、排版细节,结果AI跟你说“字符数超标”。你只能把需求压成“一个女孩在樱花树下”,出来的图跟你脑补的差了十万八千里。
阿里千问最新发布的Qwen-Image-3.0,似乎要对这个痛点动手了。文本输入长度提升到4.5倍,最高支持4.5K Token——这意味着什么?就是你可以把产品需求文档直接喂给AI,让它帮你生成一张几乎不需要人工调整的海报或知识图解。阿里官方表示,新模型在复杂指令理解、文字渲染、空间布局和多层信息组织能力上全面升级。换句话说,AI画图终于开始“听懂人话”了。
告别“短平快”,长篇指令也能Hold住
新模型支持4.5K Token文本输入,相当于可以描述画面结构、文字内容、视觉风格、排版要求……以前需要多轮生成加手动调整的活,现在一条指令搞定。场景覆盖很广:数学试卷(带公式和几何图形)、复杂UI界面(带多种字号的原生渲染)、影视分镜、古籍图像……连12种语言和20多种字体的原生渲染都支持。对于做设计、教育、影视的团队来说,这是个“真香”升级。
一张图里“套娃”:九宫格知识图解、嵌套UI界面、聊天窗口同框
如果说文本能力提升是“能写”,那信息组织能力就是“能塞”。Qwen-Image-3.0可以在同一张图中组合不同类型的视觉元素,比如根据一条指令生成九宫格知识图解(多个领域的内容整齐排列),或者在同一画面里嵌套网页、软件界面、聊天窗口和海报。阿里展示了一个案例:用户要求生成一张包含VS Code编程界面、千问App、聊天窗口和手冲咖啡海报的多层嵌套图片。结果完美呈现了不同界面层级,连截图时间、界面上的小字都清晰可见——AI不仅能画图,还能当“排版工”和“套娃大师”。
当然,目前这些效果主要来自官方展示,实际使用时稳定性和生成质量还得再测。但至少方向是舒服的:以后做多内容视觉图,可能真的一步到位。
一体化架构:生成+编辑不“人格分裂”
新模型采用图像生成与编辑一体化架构,把文字渲染、图像细节和知识理解能力同时用在生成和编辑任务中。这意味着你不用在多个工具之间来回切换——初次生成后想改个局部、扩个背景、换个风格,同一个模型就能搞定。阿里表示,这能减少二次编辑时可能出现的文字变化、风格不一致和结构偏移。想想以前改图时AI突然“失忆”的样子,这功能简直救命。
除此之外,模型还能处理古画修复、全景图扩展、手绘草图转演示文稿、多镜头视角生成等任务。从“能画”到“能修能造”,AI画图的应用边界又拓宽了一圈。
目前,阿里云百炼和千问AI平台已开放API邀测,Qwen Studio和千问App也计划上线体验功能。可以期待一下,当AI能用长篇作文驱动创作,设计工作的“下限”会直接被拉高。至于上限?那就看你的脑洞有多长了。