在2026年中国国际服务贸易交易会期间,一场聚焦智能原生软件变革与创新的交流活动引发行业关注。中国信息通信研究院在此次活动上正式推出“方升-Code2.0”大模型基准测试体系,标志着我国AI代码能力评估进入更注重工程实践的新阶段。这一升级版本针对当前评测体系在产业应用中暴露的短板,构建了覆盖全流程的标准化评估框架。
据中国信通院人工智能所平台与工程化部主任曹峰介绍,原有评测体系存在三大核心问题:评测任务设计脱离真实开发场景、数据样本质量参差不齐、评估维度单一化。复旦大学计算与智能创新学院副院长彭鑫指出,行业现存的多数评测集更像“能力擂台赛”,而非检验模型能否胜任实际开发工作的“压力测试场”。这种评估导向导致部分模型在榜单上表现优异,却难以处理企业级代码库的复杂需求。
新发布的方升-Code2.0体系构建了5000余条源自真实项目的评测数据,涵盖代码生成、缺陷修复、单元测试、技术文档解析四大典型场景。测试团队特别设计了动态难度分级机制,从287条精选测试用例中划分出基础、进阶、专家三个难度层级。曹峰强调,评估重点已从“能否生成代码”转向“能否持续稳定完成复杂工程任务”,这要求模型具备更强的上下文理解能力和长周期任务处理能力。
在评估指标方面,方升-Code2.0突破传统正确率单一维度,构建了包含五类核心指标的立体化评估体系。除基础代码质量外,新增工程价值评估模块,重点考察模型生成的代码是否符合企业编码规范、能否通过静态代码扫描、是否具备可维护性等实际开发要素。效率成本分析模块则引入单位时间代码产出量、资源消耗率等量化指标,更真实反映模型在企业开发环境中的经济性。
这一评估体系的升级与我国软件产业智能化转型形成共振。工信部最新数据显示,2026年前五月软件业务收入达6.25万亿元,同比增长10.3%,智能编程工具的日均调用量突破500万亿次。刚出台的《“人工智能+软件”专项行动实施方案》明确提出,到2028年要培育100个智能体软件标杆应用,推动关键软件全面实现智能化升级。
中国信通院人工智能研究所高级业务主管秦思思在分享中指出,智能原生软件正在重塑行业研发范式。与传统功能型软件不同,新一代软件需要具备目标理解、任务拆解和自主执行能力,这对测试验证体系提出全新要求。例如在智能体协作场景中,不仅要评估单个模型的能力边界,还需测试多智能体系统的协同效率、异常处理机制等复杂指标。
据参与体系建设的专家透露,方升-Code2.0已与多家头部科技企业建立数据共建机制,未来将持续扩充高难度评测数据集。特别是在智能体协作、自动化测试等新兴领域,将开发更具挑战性的长周期任务用例,帮助企业更精准地评估模型在实际生产环境中的表现。这一评估体系的完善,将为我国软件产业智能化转型提供重要的技术参照系。









