绕过 AI 安全护栏极其简单,一句提问就能做到
作者: CBISMB
责任编辑: 邹大斌
来源: CBISMB
时间: 2026-08-05 09:57
浏览: 0
点赞: 0
收藏: 0
据思科 Talos 安全团队的研究人员称,如果你想绕过旨在阻止 AI 模型协助网络攻击的安全护栏,通常只需要“换个方式提问”。只需声称你拥有目标服务器的所有权,或者你正在参与“夺旗赛(CTF)”或漏洞赏金计划,往往就足以说服 AI 模型与你合作。
Talos 的研究人员一直在仔细分析从运行 Claude Code、Codex、Cursor 和 Gemini 等工具的威胁行为者端点中恢复的提示词日志和数字痕迹,以了解涉嫌威胁行为者是如何滥用大语言模型(LLM)的。研究人员在报告中指出,从这些“庞大的语料库”中得出的最大结论是:现有的安全护栏对那些愿意重新包装请求的攻击者几乎没有抵抗力。
Talos 解释道:“我们没有遇到任何复杂的编码或专门用来欺骗模型的技术。大多数情况下,攻击者只是简单地说一句‘我有权这么做’,模型就会照做。”
研究人员补充说,当安全护栏确实介入并试图阻止犯罪分子获取目标时,“它们起到的作用微乎其微”。
该报告的大部分内容列举了威胁行为者试图(且经常成功)诱使 AI 模型协助恶意活动的案例。在“安全护栏形同虚设”这一方面,Talos 记录了众多案例,且这些案例中很少有依赖高度复杂技术的。
常见的绕过手段
在轻松绕过安全护栏的方法中,最常见的是直接声称拥有攻击者想要利用的设备或基础设施的所有权。在许多情况下,只需告诉 AI 目标属于攻击者即可,根本无需提供任何实际证据来证明这一说法。
声称任务属于合法测试也是常见策略。告诉 AI 模型其被要求执行的操作是“夺旗赛”或漏洞赏金计划的一部分,似乎能有效解除聊天机器人的伦理约束。研究人员解释说,这使得 AI 能够毫无顾忌地在目标系统中寻找并利用漏洞,同样无需验证用户声称的“正在进行测试而非实际犯罪”的真实性。
此外,AI 辅助的网络犯罪分子还经常将任务拆分到多个会话和文件中,以逃避那些仅在检测到更广泛的恶意活动时才会触发的模型保护机制。Talos 还指出,其他人通过向聊天机器人添加记忆、Markdown 文件和其他系统级提示词来塑造 AI 的人设,从而成功绕过护栏。
最有趣的发现:Hephaestus 框架的滥用
研究人员表示,在他们研究的所有方法中,最有趣的是 Oasis Security 威胁研究人员在 5 月份报告的一种名为 Hephaestus 的红队测试工具集的恶意使用。据 Talos 称,Hephaestus 框架能够在无需人工干预的情况下,完成从入侵受害者到建立持久化驻留的所有操作。
Talos 表示:“在这种情况下,攻击者构建平台时通过使用中性动词代替明显的恶意词汇,从根本上避免了模型的拒绝。因此,他们能够成功让 AI 智能体执行看似无害的请求,而智能体完全没有意识到完整的操作上下文。”
换句话说,将攻击分解为脱离上下文的碎片,并用中性词汇表达每个请求,模型可能永远无法获取足够的上下文来意识到自己正在协助构建攻击。
专家观点:AI 是黑客的“力量倍增器”
在所有这些情况中,有一个亮点是:Talos 对 AI 聊天痕迹的审查表明,AI 可能是熟练黑客的“力量倍增器”,但普通的“脚本小子”仅靠一个 Claude Code 账号还无法走得太远。
研究人员表示:“不够老练的行为者可以使用 AI 拼凑出技术上可行的恶意项目,但由于缺乏将工具进一步发挥作用的专业技术,他们最终只能得到平庸的结果。相比之下,老练的攻击者已经突破了我们认为可能的极限。”
对安全专业人士的启示
那么,对于那些因担心基础设施遭受 AI 攻击而夜不能寐的安全专业人士来说,这意味着什么?答案可能是:你可能需要像威胁行为者那样部署 AI。
Talos 研究人员在谈及对企业的重要启示时表示:“随着攻击数量的增加,智能体(Agents)将成为安全运营中心(SOC)中更重要的一部分,识别可操作的警报将至关重要。那些尚未探索智能体能力以让人类分析师专注于最重要警报的组织,很快就会发现自己在这方面落后。”
这并非新兴威胁:AI 已经成为威胁行为者武器库中日益重要的一部分。
据 CrowdStrike 称,过去一年,由 AI 赋能的对手发起的攻击增加了 89%,而且攻击者利用 AI 武器化漏洞的速度,已将实际的补丁窗口缩短至 24 到 48 小时。在基础设施沦为统计数据之前,你最好现在就开始行动。