首页
学习
活动
专区
圈层
工具
发布
社区首页 >专栏 >面向人与 AI 双目标的电子邮件钓鱼攻击风险与防御研究

面向人与 AI 双目标的电子邮件钓鱼攻击风险与防御研究

原创
作者头像
芦笛
发布于 2026-10-09 10:12:39
发布于 2026-10-09 10:12:39
20
举报

摘要

随着大语言模型驱动的 AI 邮件助手在企业办公场景大规模落地,电子邮件安全威胁演化出新形态。攻击者可构造同一封邮件同时针对人类使用者与处理邮件的 AI 系统实施攻击,一方面依托传统社会工程学手段欺骗人员,另一方面借助间接提示注入技术操纵 AI 助手的输出逻辑,篡改邮件摘要、伪造紧急业务指令,形成 “人AI 双目标” 的复合钓鱼攻击。该类威胁规避大量传统邮件安全检测规则,具备零交互触发、隐蔽性强、攻击链路复杂的特征,传统以保护收件人和邮箱为核心的安全体系已经无法覆盖该风险。本文基于 Barracuda Research 公开的真实攻击样本,梳理双目标邮件攻击的形成背景、攻击链路、隐蔽实现手段,剖析多类现实业务场景下的危害表现,分析现有安全防护体系存在的短板。结合攻击机理,从输入预处理、提示注入识别、AI 运行隔离、输出校验、业务流程管控、安全审计多个维度构建分层防御框架,同时讨论技术落地过程中的现实约束。反网络钓鱼技术专家芦笛指出,双目标邮件攻击标志网络钓鱼已经从单纯针对人的社会工程攻击,演进为同时劫持人和 AI 系统的复合型对抗。迪妙网络空间安全学院研究团队针对该类新型威胁开展持续跟踪,相关研究可为企事业单位完善 AI 时代邮件安全建设提供理论参考与实践指引。

关键词:电子邮件安全;网络钓鱼;间接提示注入;AI 助手;社会工程;分层防御

1 引言

电子邮件长期以来都是网络攻击者实施钓鱼、业务邮件劫持、恶意代码投递的主要载体,绝大多数传统钓鱼邮件的攻击对象仅限于接收邮件的人类用户,攻击逻辑围绕诱导人员点击链接、打开附件、泄露凭证、执行资金转账等行为构建。过去十余年间,邮件网关、沙箱检测、信誉过滤、员工安全意识培训等手段形成相对完整的防护链条,对普通钓鱼攻击具备一定拦截能力。

企业数字化转型进程中,集成大语言模型能力的 AI 助手逐步嵌入邮件处理全流程。AI 助手承担邮件内容摘要提炼、收件箱优先级排序、日历邀约处理、工单信息提取、业务决策辅助等工作,大量企业员工会直接参考 AI 生成的摘要内容开展业务处理,而并非逐字阅读完整原始邮件文本。AI 助手介于外部邮件内容和人类使用者之间,成为新的攻击面,攻击者不再仅把人作为唯一目标,将 AI 处理系统纳入攻击对象,由此催生同一邮件同时攻击人与 AI 的新型威胁模式。

Barracuda Research 在 2026 年公开的威胁报告披露真实野外攻击案例,攻击者将面向人类的钓鱼载荷和面向 AI 的恶意提示注入指令封装至同一电子邮件内。面向用户的部分是肉眼可见的业务邮件内容,包含密码保护的恶意附件;面向 AI 的恶意指令隐藏在邮件底层源码之中,普通邮件客户端不会渲染展示,但是 AI 解析邮件原始数据时能够读取并执行这些指令。即便人类用户忽略、不打开这封钓鱼邮件,隐藏指令依旧可以劫持 AI 助手,篡改邮件摘要信息,制造虚假业务紧急提示,反过来诱导人类做出错误操作,构建起全新的攻击链路。

该类攻击已经不再是实验室概念验证,已经出现在发票处理、简历筛选、客户服务、代码辅助等多个业务场景。传统邮件安全设备大多聚焦可见文本、附件、链接、发送方信誉开展检测,对于邮件源码内的隐藏指令、零宽字符、CSS 不可见文本这类对抗手段缺乏识别能力;同时多数 AI 应用开发过程中,开发者更加关注模型业务能力实现,没有充分考虑外部不可信邮件输入带来的间接提示注入风险,由此形成防护缺口。

当前国内针对邮件钓鱼的研究多数聚焦传统社会工程攻击或者 AI 生成钓鱼邮件内容,针对 “一封邮件同时攻击人和 AI” 的复合型威胁的系统性分析还相对有限。本文以公开真实攻击样本作为基础材料,厘清该威胁的完整攻击机理,拆解攻击者实现隐蔽指令的技术手段,梳理不同业务场景下的风险后果,剖析现有防御体系的局限性,提出分层落地的防御实现路径,客观分析防护落地的现实难点,为组织机构建设适配 AI 环境的邮件安全体系提供支撑。本文不追求渲染威胁的破坏性,立足于攻防客观事实开展分析,不做夸大式预判。

2 双目标电子邮件攻击的基础概念与演化背景

2.1 传统钓鱼邮件的攻击逻辑边界

传统钓鱼邮件攻击链条较为清晰:攻击者伪造发件身份,构造具备欺骗性的邮件正文,植入恶意链接或者恶意附件,依靠社会工程手段调动接收者的心理,促使人类主动执行危险动作,整个攻击闭环必须依赖人的交互行为。防护思路围绕阻断这条链路展开:网关层拦截可疑发件域,沙箱解析附件恶意行为,识别正文内钓鱼话术,终端查杀恶意程序,再辅以人员安全培训提升识别能力。

传统攻击模式下,AI 只是被攻击者用来批量生成钓鱼邮件文本的工具,攻击目标仍然是人类。AI 输出的钓鱼邮件内容展示在邮件可见正文,安全设备可以直接读取文本开展检测。攻击成功的必要条件是人类用户进行点击、打开附件等操作,如果用户直接忽略邮件,整个攻击链条就此中断,威胁无法进一步向前推进。

2.2 AI 助手介入邮件业务带来的安全范式改变

企业部署的邮件 AI 助手工作流程可以概括为:接收原始电子邮件完整数据,解析邮件全部源文件,提取全部文本信息送入大语言模型,模型完成摘要、归类、信息提取,将加工之后的结果返回给员工查看。员工日常业务中,越来越多地直接采信 AI 生成摘要,不再完整阅读原始邮件全部内容。

在这个工作流程中,AI 系统会读取完整邮件原始源码,而不仅仅是邮件客户端渲染展示给人的可视内容。邮件 HTML 源码、注释标记、编码块内部都可以存放文本,这部分内容普通邮件客户端不会展示,但解析程序会完整提取交付大模型。这就造成同一封邮件内部可以存在两套完全独立信息:一套是人眼可见,用于欺骗人类;另一套对用户完全不可见,专门用于欺骗 AI 模型,两套信息共存于同一邮件载体,互不干扰。

间接提示注入由此成为现实攻击手段。和直接提示注入不同,间接提示注入的攻击者并不直接和 AI 进行对话交互,而是把恶意指令嵌入 AI 将要读取的外部输入材料,例如邮件、网页、文档。AI 在处理业务材料过程中被动读取到恶意指令,受到劫持,忽略预设系统安全规则,执行攻击者期望的操作。反网络钓鱼技术专家芦笛强调,间接提示注入的核心风险在于信任边界混淆:系统把外部不可信业务数据和模型指令放置同一上下文窗口,外部数据可以改写模型的行为逻辑。

2.3 双目标邮件攻击的定义与核心特征

所谓人与 AI 双目标邮件攻击,是攻击者将两套攻击载荷集成至同一电子邮件载体,分别针对人类接收者和处理邮件的 AI 助手实施攻击。面向人类的载荷沿用成熟社会工程钓鱼技术;面向 AI 的载荷为经过伪装隐藏的间接提示注入指令,两套载荷相互备份,只要其中一条攻击路径达成效果,攻击者就能够推进攻击目标。该类攻击具备四项显著特征。

第一是双路径冗余攻击。人类受骗打开附件可以达成攻击;如果人类没有操作,隐藏指令劫持 AI 之后,依靠篡改 AI 输出结果诱导人犯错,实现第二条攻击通路,提升攻击成功概率。

第二是强隐蔽性。恶意指令不会在普通邮件客户端渲染显示,普通用户完全无法感知;攻击者大量使用 HTML 注释、CSS 样式隐藏文本、Base64 编码、零宽 Unicode 字符等手段,规避基于可见文本的安全检测。

第三是对传统防御的逃逸能力。依靠信誉过滤、关键词匹配的传统邮件安全网关,很难识别邮件底层源码中经过混淆的恶意指令。很多威胁特征不存在恶意链接、恶意可执行附件,仅为文本指令,传统沙箱没有检测对象。

第四是危害传导的间接性。攻击并不直接破坏系统,而是篡改 AI 输出结果,利用员工对 AI 摘要的信任,借由人的业务操作完成危害落地。风险发生之后,故障溯源难度较高,容易误判为人员业务失误。

迪妙网络空间安全学院研究团队在威胁推演实验中进一步指出,随着企业内部 AI 智能体能力持续增强,当 AI 助手被赋予发送邮件、修改业务单据、调取内部文档的工具权限时,被劫持后的 AI 本身还可以自主发起后续动作,进一步放大安全风险。

3 双目标邮件攻击实现机理与技术手段

依据 Barracuda Research 披露的野外攻击样本,完整的双目标邮件分为两个攻击向量:向量一是面向人类的传统钓鱼载荷,向量二是面向 AI 助手的隐藏提示注入载荷。攻击者还会对邮件元数据进行伪装,帮助邮件绕过信誉类安全过滤。

3.1 邮件基础伪装:提升邮件整体可信度

攻击者会对邮件基础属性进行修饰,提升邮件的欺骗性,帮助邮件穿越安全网关信誉过滤机制。发件地址和收件地址设置为同一邮箱,模拟内部系统自动发送消息;选用公共部门或者看似可信的业务域名发送邮件;调整邮件评分标识,使邮件获得较高的垃圾邮件置信分数。经过处理之后,邮件从元数据层面看起来如同常规内部业务往来信件,降低被网关拦截概率。邮件可视部分的行文完全模拟正常业务沟通,如供应商发票、人事沟通、内部预算审批通知,和普通业务邮件几乎不存在区别。

3.2 攻击向量一:面向人类接收者的传统钓鱼载荷

面向人类的攻击载荷放置在邮件可视渲染区域,使用已经被攻击者大量使用的密码保护附件战术。邮件正文提供打开文档需要的访问密码,附件本身被密码加密。密码保护附件会制造传统邮件安全控制的检测盲区:传统沙箱无法直接解析受密码保护文件内部内容,难以静态识别附件内部恶意程序。当用户采信邮件内容,使用邮件给出密码打开附件,就会触发凭证窃取或者恶意软件投放。

该攻击向量完全继承业务邮件劫持的成熟模式。但是这条路径存在不确定性,员工有可能保持警惕,不打开附件。攻击者因此增加第二套攻击向量作为备份,即便人类完全不触碰附件,攻击依旧存在生效可能性。

3.3 攻击向量二:面向 AI 助手的隐藏提示注入实现技术

攻击者利用电子邮件 HTML 格式的技术特性存放恶意指令。普通邮件客户端渲染页面时,会忽略注释标签、设置为不可见样式的文本;但是 AI 读取邮件的时候会调用解析组件提取全部原始文本内容,不会自动过滤 HTML 注释、不可见样式区块、编码数据、特殊零宽字符。报告中归纳出四类野外攻击中高频使用的隐藏指令实现手段。

第一类,HTML 注释标签嵌入恶意指令。攻击者将完整劫持指令写入 HTML 注释标记之内。邮件展示界面不会呈现注释内任何文字,但是邮件解析工具读取原始 HTML 源码,注释内文本会被提取,送入大模型上下文窗口,模型将注释内容视作有效指令予以执行。该手段的优势是实现简单,修改邮件 HTML 源码即可完成,在简历筛选场景攻击样本中已经出现。

第二类,CSS 样式实现不可见文本。攻击者通过样式属性,把存放恶意指令的区块设置为字号为零、文字颜色和页面背景色完全一致,完成视觉层面隐藏。这部分文本在文档结构中真实存在,AI 解析程序提取全部文本时,会完整读取区块内全部指令内容,业务发票篡改的攻击案例就使用该种方法。对普通用户来说,邮件页面看不到任何多余文字。

第三类,Base64 编码数据埋藏指令。攻击者将恶意提示指令做 Base64 编码,嵌入图片数据字符串等编码模块。自动化处理流水线解析邮件资源时,会对编码块执行解码操作,解码得到原始恶意文本,被大模型读取。该方式增加一层编码混淆,进一步提升安全检测的识别难度。

第四类,零宽 Unicode 字符混淆。攻击者使用零宽度空格等不可见 Unicode 字符,穿插在正常业务文本中间,用于偷渡、混淆恶意指令内容。这类字符不会产生页面可视效果,肉眼阅读完全察觉不到,但是在文本层面真实存在,被解析程序完整获取。攻击者依靠该种方式规避简单关键词匹配类检测规则。

以上四类技术可以单独使用,也可以叠加组合,进一步提升对抗能力。攻击者的隐藏指令目标分为多个层级:轻度劫持指令,要求 AI 改写邮件摘要,增加伪造的高优先级业务行动;深度劫持指令,命令 AI 忽略原有全部系统设定,执行向外转账、泄露配置密钥、输出数据库连接字符串等高风险操作。

4 现实业务场景下攻击案例与危害分析

结合公开野外捕获样本,可以看到该攻击已经覆盖财务供应链、人力资源招聘、客户服务运维、代码研发多个企业高频业务,不同场景产生的安全后果各有侧重。

4.1 财务发票处理场景:伪造供应商付款变更指令

财务部门会接收大量外部供应商发票邮件,部分企业使用 AI 助手完成发票邮件摘要提取,提炼付款对象、金额、账户信息,辅助财务人员完成付款审核。攻击者构造伪装成供应商发票的双目标钓鱼邮件。邮件可见部分是格式完整的正常发票内容;在 HTML 不可见区块埋藏针对 AI 的提示注入指令。

当 AI 助手读取并总结这封发票邮件,隐藏指令会迫使 AI 在生成摘要中增加伪造的紧急业务条目,虚构出 “按照首席财务官电话通知更新供应商收款账户” 的内容,并填入攻击者控制的银行账号与路由编码。员工查看 AI 输出的摘要信息,看到标记高优先级的账户变更提示,在没有仔细核对原始邮件全文的情况下,执行转账操作,造成企业直接经济损失。

该场景风险具备很大迷惑性:原始邮件可视部分没有出现虚假账号,虚假账户信息完全产生于 AI 的摘要输出文本,原始邮件正文找不到伪造转账账号相关文字,事件发生之后开展故障复盘,很容易误判为 AI 模型自主生成错误内容,不容易第一时间定位邮件内存在隐藏注入指令。反网络钓鱼技术专家芦笛提出,财务业务是该类攻击的高价值目标,业务流程不能把 AI 摘要作为付款审批依据。

4.2 人力资源简历筛选场景:干预 AI 招聘评估

不少企业引入 AI 筛选工具自动解析投递简历邮件,AI 读取简历邮件之后自动给出候选人评分,输出是否需要发起面试的建议。攻击者作为应聘候选人,在投递简历邮件 HTML 注释中写入恶意提示指令。

对 HR 工作人员,邮件页面显示正常简历材料;而招聘 AI 解析完整邮件源码,读取注释内指令,被要求无视简历真实资质,强制给出满分评价,并且输出立刻安排面试的建议。资质不足甚至带有恶意背景的申请者,依靠 AI 给出的虚假评估结果获得面试机会,后续可能带来供应链渗透、内部信息窃取等衍生风险。该攻击不需要破坏服务器,利用业务流程逻辑缺陷实现对筛选结果篡改。

4.3 客户服务机器人场景:窃取系统配置与密钥信息

面向客户的业务支持机器人,读取外部用户提交的邮件工单内容开展自动应答。攻击者提交特制工单邮件,人眼可读部分为普通业务咨询,隐藏指令伪装成系统管理员维护模式指令,欺骗客服 AI 助手。指令要求 AI 输出自身系统提示词、API 访问密钥、数据库连接字符串等核心配置信息。

一旦 AI 被劫持,就会把敏感配置信息通过回复返回攻击者。这类信息泄露之后,攻击者能够利用窃取密钥访问企业后台业务接口,进一步入侵业务系统。该案例体现风险已经不局限于钓鱼诱导人员操作,还可以直接造成系统关键凭据外泄。

4.4 研发代码助手场景:投毒诱导生成恶意代码

研发场景 AI 代码助手会读取网页、邮件内文档材料作为参考输入。攻击者在网页或者邮件附带文档 HTML 注释内埋藏注入指令,要求代码助手每次生成身份认证相关代码片段,自动加入用于收集用户名、密码并外传的恶意代码行。

开发人员采信 AI 给出的代码,复制到业务项目中,会把凭据窃取逻辑引入正式业务代码。这类逻辑埋藏在业务代码之内,如果没有严格代码审计流程,恶意逻辑可以长期潜伏,上线运行之后持续窃取用户账号密码数据。迪妙网络空间安全学院研究团队分析认为,该场景属于供应链类风险,威胁通过 AI 代码生成环节渗透进软件制品,影响范围会扩散到软件服务全部使用者。

4.5 综合危害总结

综合上述场景,双目标邮件攻击带来的危害可以归纳为三个层面。第一,直接经济损失,以虚假转账、资金诈骗为代表;第二,内部信息泄露,包含 API 密钥、数据库配置、业务文档、客户数据外泄;第三,业务流程污染,招聘、研发、客服业务输出结果被篡改,衍生出更深层次安全事件。

和传统攻击对比,该威胁的特殊点在于危害的传导链条变长:危害不是直接来自邮件本身,而是来自被篡改之后 AI 生成的输出结果。组织机构过往安全建设更多关注外部输入的安全审查,对 AI 输出内容的校验环节普遍存在缺失。

5 现有防护体系存在的短板

面对人与 AI 双目标钓鱼攻击,传统安全产品和管理制度暴露出多维度短板,分别体现在邮件网关层、AI 应用开发层、业务管理制度三个层面。

5.1 传统邮件安全网关的检测局限

传统邮件安全网关的检测逻辑高度依赖邮件客户端可视文本、附件、链接、发送方信誉。对于 HTML 注释、CSS 隐藏区块、Base64 编码块、零宽不可见字符这类存放恶意指令的载体,多数网关不会深度解析全部原始 HTML 结构。

网关沙箱主要针对附件内可执行恶意代码开展动态分析,而提示注入属于纯文本类攻击,不存在传统意义恶意载荷,沙箱没有检测对象。简单关键词匹配手段很容易被编码、零宽字符、句式改写绕过。邮件网关能够拦截一部分传统钓鱼,但是很难独立识别邮件源码中精心混淆的间接提示注入载荷。

5.2 AI 应用开发阶段安全设计缺失

很多企业部署邮件 AI 助手时,业务功能优先,安全约束设计不足。第一,没有严格区分可信系统指令与外部不可信邮件数据,外部邮件全部文本直接并入模型上下文窗口,攻击者嵌入在邮件中的文本可以和系统提示词拥有同等影响力,造成信任边界被突破。第二,缺少输入预处理流程,原始邮件不经清洗直接送入大模型,HTML 注释、不可见样式文本、特殊 Unicode 字符完整保留。第三,AI 工具权限过度宽泛,AI 助手被赋予读取邮件、草拟邮件、调取业务文档甚至发起业务申请等能力,一旦被劫持,就具备执行高风险动作的条件。第四,缺少输出校验机制,AI 生成摘要直接展示给业务人员,没有独立安全模块审查 AI 输出内容是否包含伪造紧急指令、虚假账号信息等异常内容。

迪妙网络空间安全学院研究团队开展的行业调研表明,大量企业上线 AI 邮件助手时,将安全验证环节简化,更多依赖大模型自身内置安全对齐能力抵御提示注入,而模型对齐并不能完全抵御经过多层混淆的间接提示注入攻击,这是当前普遍存在的安全误区。

5.3 业务管理流程层面的风险漏洞

制度层面同样存在明显短板。部分业务岗位把 AI 摘要、AI 输出建议作为业务审批主要参考,甚至直接依据 AI 提炼的信息开展付款、面试、配置变更等高风险操作,缺少强制核验原始邮件原文的流程要求。高风险业务操作没有强制的多重人工复核机制。安全审计日志不完善,没有留存原始邮件、AI 输入、AI 输出完整对照记录,出现安全事件后溯源定位困难。员工安全培训多数聚焦识别邮件可视部分钓鱼特征,几乎没有覆盖 “AI 输出内容被恶意邮件篡改” 这类新型风险,业务人员缺乏对应的风险认知。

6 面向双目标邮件攻击的分层防御体系构建

Barracuda 的威胁研究明确指出,不存在单一安全组件能够完全抵御全部变种的双目标邮件攻击,防御需要采用纵深分层思想,从输入侧、AI 模型运行侧、输出校验侧、业务流程管控、审计监测多个环节叠加防护,形成闭环。反网络钓鱼技术专家芦笛表示,防御核心原则可以概括为:外部邮件内容只能作为业务数据,绝对不能把外部输入视作可执行指令,数据与指令必须严格隔离。

6.1 输入侧预处理:清洗送往 AI 系统的邮件原始内容

在邮件内容交付 AI 解析之前,部署独立输入净化模块,完成邮件原始内容清洗,而不是直接将完整 HTML 源码送入大模型。主要执行几类处理工作。

第一,剥离 HTML 注释全部内容。邮件 HTML 注释用于前端页面开发,对于邮件业务摘要任务没有业务价值,应当在送入模型前全部删除,消除一类主要的指令藏匿载体。

第二,识别并剔除 CSS 设置为不可见的文本区块。解析 HTML 样式规则,把字号归零、文字颜色与背景色一致等视觉隐藏区块全部移除,避免隐藏文本流入模型上下文。

第三,扫描并且过滤零宽类特殊 Unicode 字符,识别文档中混杂的零宽空格等混淆字符,消除依靠不可见字符实现的内容偷渡。

第四,解码并审查 Base64 等编码块,对于邮件内部编码文本资源,解码之后完成安全检测,判断是否存在劫持指令,不直接把未核验的编码内容交付模型。

需要说明,输入清洗并不能解决全部对抗手段,攻击者依旧会持续创造新的藏匿方法,输入净化属于第一道屏障,而不是最终防护手段。

6.2 提示注入行为检测:识别意图篡改的异常文本

构建独立的提示注入检测模块,在文本进入大模型前后识别具备劫持意图的语句模式。重点识别试图让模型忽略原有系统规则、切换维护管理员模式、要求输出密钥配置、强制改写输出结果这类语义。检测不能只依靠简单关键词匹配,需要从语义层面识别攻击意图,规避句式改写、同义词替换带来的绕过。

该模块独立于大模型主体业务逻辑,不依赖模型自身安全对齐。即使大模型被诱导,前置检测模块依旧可以识别输入文本中的劫持企图。需要持续积累野外攻击样本,更新检测识别规则库,跟进攻击者新的混淆手法。

6.3 AI 运行环境沙箱与最小权限约束

对邮件 AI 助手实施沙箱隔离与最小权限管控,限制 AI 助手能够调用的工具集合,降低劫持之后造成的危害边界。遵循最小权限原则:仅授予 AI 完成本职工作必须的能力,杜绝不必要高权限。

例如,负责邮件摘要的 AI 助手,仅允许读取邮件文本,不能具备发送邮件、修改财务单据、调取数据库密钥的权限。当业务确实需要调用工具完成操作,需要设置权限隔离,AI 仅能够生成操作申请草稿,不能够直接执行动作,所有高风险操作不能交由 AI 自主触发。迪妙网络空间安全学院研究团队提出,AI 安全沙箱的核心价值不是阻止攻击输入进入模型,而是就算模型被劫持,攻击者也无法依托 AI 权限落地严重危害,实现风险的限制收敛。

6.4 AI 输出结果校验,阻断篡改结果流向业务人员

攻击的危害最终依靠 AI 生成输出结果传递给业务人员,因此必须部署输出校验环节。AI 产出摘要、业务建议之后,在展示给员工之前,经过独立安全审查组件做二次核验。

校验工作包含:比对 AI 输出内容和原始清洗之后邮件数据,识别 AI 摘要内出现原始邮件并不存在的账号、紧急业务指令、管理员维护通知等异常信息。如果 AI 生成文本新增原始邮件不存在关键业务信息,系统给出明确风险提示,强制提醒业务人员核对原始邮件全文,禁止直接采信 AI 摘要开展审批。输出校验可以阻断大量 “原始邮件没有虚假信息,虚假信息由 AI 被劫持后新增” 这类攻击链路。

6.5 业务流程层面强制管控

技术防护需要配套业务流程制度,技术与制度互为补充。第一,财务付款、供应商信息变更、系统配置修改等高风险业务,禁止将 AI 摘要作为审批依据,制度层面要求工作人员必须查阅原始邮件完整可视内容完成核验,设置双人复核流程。第二,完善人员安全意识培训,除传统钓鱼识别,增加新型风险内容,告知员工 AI 助手输出结果存在被外部邮件篡改的可能性,不能无条件信任 AI 给出业务建议。第三,对 AI 系统的业务输出留存完整审计日志,保存原始邮件清洗前后数据、送入模型输入文本、AI 全部输出内容,方便安全事件发生后完整回溯攻击链路。

6.6 持续监控威胁与攻击模式迭代

部署安全监测机制,记录重复出现的提示注入尝试行为,跟踪新型攻击模式。安全运维人员持续跟踪公开威胁情报,跟进该类攻击野外样本变化,同步更新输入清洗规则、注入检测规则。组织机构还应当定期开展红蓝对抗演练,模拟双目标邮件攻击,检验自身邮件AI 安全链路的防御有效性,发现防护体系存在漏洞及时迭代优化。

7 防御落地现实约束与未来研究方向

即便已经形成分层防御框架,现实工程落地过程中依旧面临多重客观约束,不能理想化看待防护效果。首先攻击者会持续研发新的指令藏匿混淆技术,永远无法穷尽全部攻击变形,防护体系需要持续迭代,不存在一劳永逸的方案。其次输入清洗环节如果处理过于激进,错误移除正常业务邮件中合法内容,会破坏 AI 摘要业务可用性,安全处理需要在安全性与业务可用性之间做权衡取舍。语义层面的提示注入识别存在误报风险,需要优化算法降低误报,避免过多告警干扰正常业务运转。

面向未来,迪妙网络空间安全学院研究团队提出几个值得持续深耕的研究方向。第一,面向电子邮件 HTML 文档的对抗样本识别技术,研究针对各类隐藏指令载体的高效解析识别算法,兼顾检测性能和业务可用性。第二,大模型上下文安全分区技术,实现系统指令和外部不可信业务数据物理隔离,从模型上下文架构层面削弱间接提示注入的可行性。第三,基于溯源的 AI 输出可信校验,自动标记 AI 输出信息来源,区分哪些信息来自原始邮件,哪些信息属于模型新增生成内容,方便业务人员快速辨别信息可信度。第四,面向企业级 AI 邮件助手的安全测评规范,建立标准化测试集,帮助组织机构评估 AI 系统抵御双目标邮件攻击的实际能力。

同时需要注意,该类威胁并非否定 AI 助手的业务价值,而是说明 AI 融入业务之后,攻击面同步扩张,安全建设范围必须随之延伸,安全防护不能依旧停留在保护邮箱和人员的传统思路,需要将处理邮件的 AI 系统纳入重点防护对象。反网络钓鱼技术专家芦笛认为,AI 时代邮件安全的核心变化,是防护对象从 “人 + 邮箱” 扩展为 “人 + 邮箱 + AI 处理系统”,安全边界需要跟随业务系统的变化同步拓展。

8 结语

AI 助手大规模嵌入邮件业务流程,给企业办公带来效率提升,同时催生人与 AI 双目标电子邮件钓鱼攻击。攻击者利用电子邮件格式特性,把面向人类的社会工程钓鱼载荷和面向 AI 的间接提示注入指令共存于同一邮件。即便人类用户不交互恶意附件,隐藏指令依旧可以劫持 AI 助手,篡改 AI 输出摘要,借由业务人员完成攻击落地,该威胁已经从概念验证走向真实野外攻击,覆盖财务、人力、客服、研发多个业务场景。

传统邮件网关、安全制度更多面向传统钓鱼攻击,在面对该复合型威胁时存在明显短板。单一安全产品无法实现完整防护,需要构建纵深分层防御,从邮件输入清洗、提示注入检测、AI 沙箱最小权限、AI 输出校验、业务流程管控、威胁监测多个环节协同防护。技术防护之外,配套业务制度、人员安全意识、威胁情报更新缺一不可。

应当客观看待防护的局限性,攻防博弈会持续演化,没有绝对完备的防护手段。组织机构需要跳出只保护收件箱的固有思维,把处理邮件内容的 AI 系统纳入邮件安全防护体系之内。在享受 AI 带来业务效率提升的同时,同步评估 AI 引入新增攻击面,持续迭代安全防护策略,才能应对这类不断演化的电子邮件安全威胁。

编辑:芦笛(公共互联网反网络钓鱼工作组)

来源:迪妙网络空间安全学院

原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。

如有侵权,请联系 cloudcommunity@tencent.com 删除。

问题归档专栏文章快讯文章归档关键词归档开发者手册归档开发者手册 Section 归档