在人工智能图像生成领域,一个长期被忽视的问题正被重新审视:不同任务所需的数据是否应该独立构建?阿里巴巴研究团队近期发表的论文提出,传统按任务划分数据的方式,正在导致大量重复劳动和效率损失。研究指出,文生图、图像编辑和知识关联三类任务的数据若能共享,可让模型像人类学习一样,先掌握基础能力再进阶复杂技能。
传统方法中,三类任务的数据构建团队各自为战,导致模型在文生图任务中学到的文字渲染能力,无法直接迁移到图像编辑任务中。研究团队以“画海报”为例,若文生图模型已掌握“大甩卖”文字的清晰呈现,编辑模型却需从头学习,这种割裂造成计算资源的严重浪费。论文将这种现象类比为连锁餐厅,总部研发的番茄酱配方未被分店共享,导致各分店重复开发且质量参差。
为解决这一问题,研究团队设计了三套独立但互通的数据引擎。T2I数据引擎从数十亿图片中筛选出4.4亿张高质量训练图,特别保留了设计师海报、电商产品图等复杂排版素材,以强化模型的文字渲染能力。更反常识的是,团队刻意保留了老照片、轻微失焦等带瑕疵的图片,并在标注中明确缺陷类型。这一设计源于烹饪教学类比:若新手厨师只见过完美菜品,将无法识别“炒糊”的错误,模型同样需要接触负面样本才能学会规避。
图像编辑数据引擎通过三条路径构建1.2亿组配对样本。第一条路径利用视觉语言模型(VLM)和分割模型(SAM3),自动识别图片中的可编辑对象并生成“改前改后”样本;第二条路径挖掘电商平台的多图拼版、化妆前后对比等自然关联图片;第三条路径针对稀缺任务,先用少量领域数据微调专家模型,再批量生成可控样本。例如,电商平台的“四宫格拼图”可被拆解为四组编辑样本,无需人工合成。
知识关联数据引擎则从维基数据中筛选出300万个高显著度实体,包括名人、地标、动植物等,并抓取2700万组配图进行视觉核验。这一设计解决了模型对具体事物认知不足的问题,例如当指令要求“画埃菲尔铁塔前的野餐场景”时,模型需准确识别地标而非泛化为普通铁塔。
三套引擎的协同关键在于统一描述语言。研究团队训练了VLM图注专家,将编辑指令的用词风格与文生图标注对齐。例如,若文生图标注习惯使用“穿白色连衣裙的女性靠在木门前”,编辑指令也会采用相同表述,而非各自为政。这种设计使模型在文生图任务中习得的“白色连衣裙”概念,可直接应用于编辑任务,避免重复学习。图注系统还生成了从简短描述到超详细描述的多粒度版本,并支持中英双语,以增强模型泛化能力。
在训练策略上,研究团队设计了五阶段课程调度,从256像素低分辨率逐步提升至1024像素高清训练。第一阶段通过宽松过滤策略保留长尾分布样本;第二阶段引入密集文字排版等复杂内容;第三阶段在文生图能力稳定后,才开始联合训练编辑数据;第四阶段提升分辨率并优化数据质量;第五阶段用精选数据集进行微调。每个阶段结束后,模型会自我评估能力差距,生成失败案例并检索相似数据或调用专家模型生成针对性样本,形成“评估-反馈-补充”的闭环。
实验结果显示,30亿参数和60亿参数的模型在CPI-Bench编辑基准测试中均取得接近4分的成绩(满分5分),证明数据组织方式的优化收益不依赖参数量。在混合编辑、推理编辑、老照片修复等复杂任务中,该模型的表现较竞品更自然,编辑痕迹更不明显。例如,在多图编辑任务中,模型需准确识别“图1引用的人物”“图2引用的服装”等指令,并将对应属性绑定到正确位置,这依赖于统一描述语言的设计。
这项研究引发了对训练顺序的重新思考。传统研究多关注数据量和质量,却忽视了能力间的依赖关系。论文提出的五阶段课程虽未直接证明依赖顺序的必然性,但实践结果印证了其合理性。例如,若过早引入编辑数据,模型因缺乏基础视觉概念而无法理解“保留原图特征”的指令。这提出一个新问题:能力依赖顺序是模型架构决定,还是数据性质决定?答案或许需等待后续研究揭晓。











