AI正在悄然接管软件维护领域的“脏活累活”。Claude之父Boris Cherny近期在社交平台公布了一项实验成果:由AI驱动的自动化系统在数周内提交了388个代码修改请求(PR),其中180个被人类工程师合并入库。这项实验的核心是让AI承担起应用程序日常维护中那些耗时费力却难以量化绩效的工作,包括崩溃排查、冗余代码清理、测试用例优化等任务。
实验依托名为“proj-claude-maintains-apps”的Slack频道展开,AI代理Claude Tag每日自动执行覆盖六大平台(iOS/Android/桌面/Web/CLI/SDK)的维护任务。系统采用分层架构设计:Slack频道作为交互入口,Routines例行任务模块负责具体执行,云端运行的Claude Code处理代码生成,最终由人类工程师完成合并审批。这种设计使AI能够像真实开发者一样主动发现问题、提交修改并附带详细说明,而人类只需在关键节点进行决策。
在具体任务分配上,AI承担的工作呈现出显著特征。崩溃巡检要求AI在模拟器中随机操作应用直至崩溃,随后定位问题并提交修复方案;代码清理任务需要区分绝对冗余代码与疑似冗余代码,对后者需先埋点观察运行日志再决定删除;测试优化工作则涉及识别永远通过的“僵尸测试”和时好时坏的“间歇性测试”。这些任务普遍具有规则明确但执行繁琐的特点,正是传统开发流程中容易被拖延的环节。
代码生成效率的提升带来了新的挑战。工程数据平台Faros AI对2.2万名开发者的追踪研究显示,AI辅助使人均任务完成量增长66.2%,但每周实际部署次数反而下降11.7%。这种矛盾现象源于代码审查环节的瓶颈——每个PR的平均审查时间激增441.5%,导致31%的修改未经审查就被合并。Anthropic公司的内部数据印证了这一困境:审查每个PR需消耗15-25美元的算力成本,且大体积修改(超过1000行)的查错率是小修改(50行以下)的2.7倍。
Boris Cherny的解决方案聚焦于优化任务规则而非单个PR。当某类修改频繁被驳回时,系统会调整对应的Routines配置参数,通过持续迭代使生成结果更符合工程标准。这种将提示词视为可运维资产的理念,使AI提交的PR质量逐步提升。实验数据显示,经过规则优化的任务流,其后续PR的通过率显著高于初期阶段,验证了“调规则不修结果”策略的有效性。
技术实现层面,该系统依赖Claude Code的Routines功能。这项4月推出的特性允许用户预设提示词、代码仓库和触发条件,支持定时执行、API调用和GitHub事件三种启动方式。8月的升级进一步增强了上下文感知能力,使AI能根据频道讨论动态判断介入时机。对于企业用户而言,真正的实施门槛在于仓库权限配置、测试环境完备性和审查成本承受力——Pro版用户每日仅能运行5个Routines,而企业版可扩展至25个。
开源社区的反应折射出技术落地的现实考量。Rust项目近期制定的AI贡献指南明确要求:AI生成的代码必须提前声明、避开关键路径、提供充分测试,且维护者有权直接拒绝审查。这种谨慎态度源于对代码质量的担忧,特别是涉及系统安全性的核心修改,社区普遍认为不应完全交由AI处理。个体开发者若想借鉴类似方案,专家建议从验收标准明确的任务入手,例如界面元素定位检查、重复逻辑合并等可自动化验证的工作。











