阿里通义团队近日推出了其第三代图像生成模型Qwen-Image-3.0,官方用“实”字概括此次升级的核心——内容更丰富、细节更逼真、知识储备更深厚。这款模型宣称支持超长指令输入,单图可承载九宫格级别的复杂信息,文字渲染精度达10像素小字清晰可辨,覆盖12国语言原生渲染,并支持100余种艺术风格。然而,当其与当前行业标杆GPT-Image-2展开直接对比测试时,结果却呈现差异化表现。
在复杂排版测试中,Qwen-Image-3.0虽能生成包含九个独立信息块的太阳系科普海报,但核心问题出在科学准确性上:行星相对位置、大小比例等基础物理结构出现明显错误,导致科普信息失真。相比之下,GPT-Image-2生成的版本虽未刻意炫技,但行星排列、网格划分、文字渲染等细节均符合科学规范,整体布局更显专业。
多语言文字渲染测试暴露了另一处短板。当要求同时呈现中文、日文、韩文、英文、阿拉伯文五种语言时,Qwen-Image-3.0在阿拉伯文部分出现字符错误,而GPT-Image-2实现全部语言准确输出。Qwen生成的航班信息板采用单一底色,视觉层次不如GPT-Image-2通过颜色区块区分行数的设计贴近真实场景。
写实人像测试中,两款模型表现接近。面对“70岁老人阴天窗边肖像”的命题,二者均成功还原皱纹、胡茬、光影过渡等细节,未出现塑料感或过度美化问题。唯一差异在于面部特征:Qwen生成亚洲面孔,GPT-Image-2呈现欧洲面孔,这反映训练数据中不同地域样本的偏好差异。
UI设计测试揭示更深层的逻辑缺陷。Qwen-Image-3.0虽能生成包含多层嵌套界面的复杂图像,但在模拟社交应用截图时,将用户昵称与评论内容的上下层级关系颠倒,违背基本交互常识。GPT-Image-2不仅保持信息层级正确,按钮比例、卡片间距等细节也更符合真实应用设计规范。
极限场景测试呈现性能分野。当生成包含摩天楼群、河流、公园人群、飞行器的8K超宽画幅生态城市图时,GPT-Image-2凭借原生4K分辨率输出占据优势,而Qwen-Image-3.0虽在2K分辨率下保持人物面部稳定,但个别腿部出现轻微变形。不过,Qwen在生成速度上明显快于对手,更适合批量出图场景。
五轮测试结果显示,GPT-Image-2在文字准确率、UI交互逻辑方面领先,Qwen-Image-3.0则在生成速度、基础写实度上表现突出。尽管Qwen通过技术升级实现了信息密度的突破,但太阳系海报的科学错误、阿拉伯文字符错误、评论层级颠倒等问题表明,模型对知识内容的理解深度仍需提升。这场对决显示,当前AI图像生成领域的竞争已从单纯的技术参数比拼,转向对真实世界逻辑的理解与重构能力。











