在人工智能技术快速发展的今天,让AI根据网页截图自动生成对应的HTML和CSS代码已不再遥远。然而,最新研究揭示了一个令人意外的问题:当AI被赋予自我修正能力,试图通过多轮迭代优化代码时,结果往往适得其反。这种“越改越差”的现象在多个主流模型中普遍存在,引发了科研界对AI自我改进机制的深入反思。
实验数据显示,在针对GPT-5.2和GPT-5.4的测试中,模型经过15轮自我修正后,生成的代码质量反而低于初始版本。具体而言,GPT-5.2在Design2Code测试集上的最终得分较首轮下降2.73分,GPT-5.4虽在首轮略有提升,但后续10轮中有9轮表现不及初始水平。这种反直觉的结果促使研究人员深入探究其根源。
研究发现,网页代码的特殊性是导致这一现象的关键因素。与文字生成任务不同,网页布局具有高度关联性——修改某个CSS属性可能引发连锁反应,导致其他未被触碰的元素位置、大小或颜色发生意外变化。研究人员将这种“牵一发而动全身”的现象命名为“视觉修复耦合”,并指出其类似于家庭装修中调整家具位置时引发的空间重构问题。
为解决这一难题,研究团队提出了名为RubSE的创新框架。该框架借鉴教育评估中的评分细则理念,要求AI在每轮修正时生成结构化的修复条目,而非笼统的自由文本反馈。每个条目包含问题描述、修改建议和类型标签,并从布局、间距、文字、样式和完整性五个维度进行分类。通过“生成-筛选-记录”的三步循环机制,AI能够有计划、有边界地进行修正,避免盲目修改导致的连锁反应。
实验结果表明,RubSE框架显著提升了AI的修正效果。在6个视觉语言模型和3个基准测试的组合中,RubSE在15组对比中有14组表现出色。以GPT-5.4为例,其在Design2Code测试集第10轮的综合得分较普通自迭代提升2.0分,较初始生成提升0.9分。人工评估也证实,RubSE生成的网页在视觉还原度上明显优于传统方法。
进一步分析显示,RubSE的优势不仅体现在最终得分上,还表现在修正过程的稳定性。数据显示,使用该框架后,模型的“轨迹崩溃率”(即连续两轮得分骤降的现象)从18.9%降至12.8%,恢复率则从20.7%提升至32.8%。这意味着即使出现修正失误,AI也能更快回到正确轨道。
研究还发现,强模型生成的修复建议对弱模型具有显著提升作用。当让GPT-5.4生成修复条目并由Qwen系列模型执行修改时,弱模型的表现普遍优于自身生成建议的情况。这得益于强模型更擅长从结构层面诊断问题,而非局限于局部技术细节。例如,GPT-5.4的条目中89%涉及全局布局,而Qwen的条目中70%聚焦具体CSS属性。
在成本效益方面,RubSE框架在闭源API场景下会增加约60%的费用,但考虑到其能减少无效迭代并提升最终质量,整体性价比仍具优势。对于开源模型,由于推理时间主要消耗在代码生成环节,RubSE的额外开销可忽略不计,仅增加2.5%的推理时间。
这项研究不仅为网页代码生成领域提供了新的解决方案,也引发了对AI自我改进机制的普遍思考。研究人员指出,类似“视觉修复耦合”的现象可能广泛存在于复杂系统的生成任务中,如长文档结构或软件模块设计。如何设计更精准的反馈机制,避免AI在自我修正过程中陷入“拆东墙补西墙”的困境,将成为未来研究的重要方向。









