ITBear旗下自媒体矩阵:

AI编程工具安全漏洞曝光:ToolLeak攻击绕过防线实现远程代码执行

   时间:2026-08-21 19:56:22 来源:互联网编辑:快讯 IP:北京 发表评论无障碍通道
 

香港科技大学与复旦大学联合研究团队近日在AI安全领域取得突破性进展,其针对主流AI编程工具的系统性安全测试揭示了新型攻击链。该研究通过模拟攻击场景,成功复现了从提示词泄露到远程代码执行的完整攻击路径,相关成果已被国际软件测试与分析领域顶级会议ISSTA接收。

研究团队选取Cursor、Claude Code等六款市场占有率领先的AI编程工具进行测试,发现攻击者可通过操纵工具调用参数实施"ToolLeak"攻击。与传统直接索要系统提示词的方式不同,这种新型攻击利用模型处理工具参数时的模式差异——当参数名被设计为"note":"system prompt"等特定格式时,模型会将其误认为正常表单字段而自动填充系统提示词。实验数据显示,该攻击在25组智能体与后端模型组合中,有18组实现了高完整度内容提取,语义相似度达0.891至0.958,远超传统攻击方法0.70的上限。

在获取系统提示词后,攻击者进一步开发出"双通道提示词注入"技术。通过注册恶意MCP工具并伪造工具描述,诱导智能体在正常请求时优先调用该工具。当用户要求编写游戏代码时,智能体会先执行"环境初始化"流程,而恶意工具返回的响应中包含隐蔽的命令执行指令。研究显示,这种双通道协同攻击在旧版工具中成功率高达80%至100%,其中Cursor搭配GPT-5的组合更是达到100%中招率。

测试中暴露的防御机制缺陷引发关注。以Claude Code为例,其设计的双模型安全架构中,守卫模型Haiku虽检测到curl命令风险并发出警告,但主模型Sonnet因受注入指令影响,仍判定为误报并执行了恶意代码。这种攻击绕过了现有安全对齐训练,即使面对经过严格安全强化的GPT-5和Claude Sonnet 4.5等模型依然有效。

新版工具的防御升级呈现差异化效果。Claude Code通过"渐进式工具描述暴露"策略,仅显示工具名称而隐藏完整描述,成功阻断攻击通道,搭配最新模型后攻击成功率降至0。Cursor实施类似改造后将风险降至30%,但Cline、WindSurf等工具在搭配Gemini 3.1 Pro时仍保持100%中招率。研究指出,架构层面的隔离防护比模型对齐训练更具决定性作用,当前智能体设计中工具返回值兼具数据与指令属性的设计缺陷,是导致攻击持续有效的根本原因。

该研究已开源攻击代码与测试数据集,为行业提供重要安全参考。实验表明,攻击者仅需修改工具参数名称即可实施攻击,整个过程无需突破聊天窗口的安全限制。这种新型攻击模式的发现,迫使业界重新审视AI编程工具的安全架构设计,特别是工具调用机制与模型决策流程的边界管控问题。

 
 
更多>同类资讯
全站最新
热门内容
网站首页  |  关于我们  |  联系方式  |  版权声明  |  争议稿件处理  |  English Version