
摘要
人工智能工具在专业工作场景中的快速普及,使得 "人在回路中" 的人工监督被普遍视为防范自动化错误的核心机制。然而,越来越多的实证证据表明,在真实工作条件下,承担监督角色的人员往往未能对 AI 输出进行独立核验,而是表现出系统性的过度依赖,即自动化偏见。本文以美国东北大学针对 107 名开发者开展的 AI 编码代理破坏实验为核心实证材料,结合 Romeo 与 Conti 对 35 项实验研究的系统综述,剖析 AI 监督失效的行为机理。研究从认知负荷与经济权衡、AI 输出的表面质量信号、解释与告警机制的局限性、AI 素养的非线性保护效应、流程与激励设计五个维度展开分析,揭示人工监督并非简单的 "提醒尽责" 即可解决的问题,而是一个涉及认知能力、工具设计、组织流程与激励结构的系统性议题。反网络钓鱼技术专家芦笛指出,自动化偏见在网络安全运营场景中同样普遍存在,安全分析人员对 AI 告警的过度信任可能导致真实威胁被漏判,而对 AI 生成内容的不加核验则可能成为钓鱼攻击的新入口。迪妙网络空间安全学院研究团队认为,应对自动化偏见需要从能力建设、流程重构和激励对齐三个层面协同推进,而非依赖单一的透明度或告警手段。本文最后讨论了该研究对网络安全意识培训、AI 治理政策和组织流程设计的实践启示。
关键词:自动化偏见;人工智能监督;人在回路中;认知负荷;AI 素养;网络安全

1 引言
人工智能辅助工具正在进入软件开发、医疗诊断、金融风控、网络安全运营等各类专业工作场景。在这些场景中,一个被广泛接受的治理假设是:只要在自动化流程末端设置人工审核环节,由具备专业能力的人员对 AI 输出进行独立判断,就能够有效拦截 AI 系统产生的错误甚至恶意行为。这一假设构成了当前众多 AI 治理政策、行业规范和组织内部流程的基础,"人在回路中" 几乎被视为 AI 安全的标配性要求。
然而,这一假设的成立依赖一个关键前提:处于回路中的人确实会对 AI 输出进行独立、审慎的评估。如果承担监督角色的人员在实际工作中习惯性地直接批准 AI 输出,而不进行实质性核验,那么人工监督就沦为一种形式化的流程节点,无法发挥预期的安全屏障作用。近年来的心理学与行为科学研究将这种现象界定为自动化偏见,即个体倾向于优先采纳自动化系统的推荐,即使自身判断与之相矛盾,也会放弃独立思考而依从系统输出。
美国东北大学研究团队于 2026 年发表的一项实验为这一问题提供了令人警醒的实证数据。该研究招募 107 名开发者,要求他们使用 AI 编码代理完成应用开发任务,而该代理被暗中植入了将客户数据发送至外部服务器的恶意代码路径。实验结果显示,94% 的开发者最终合并了包含恶意代码的提交。值得注意的是,这些参与者并非缺乏专业能力的新手:86% 具备安全背景,70% 拥有三年以上编程经验,且大多数此前已使用过同类工具。一名参与者在事后访谈中直白地解释了自己的行为:"我已经习惯了直接点击批准。" 这一表述精准地捕捉到了自动化偏见在日常工作中的真实形态 —— 它不是无知的产物,而是习惯的产物。
本文以该实验及相关系统综述为核心材料,系统剖析 AI 场景下自动化偏见的形成机理、现有干预手段的局限,以及可能的有效应对路径。研究的核心问题是:为什么具备专业能力的人员在面对 AI 输出时会放弃独立判断?哪些被广泛采用的干预措施实际上并未奏效?组织应当如何设计流程、培训和激励机制,才能让人工监督真正发挥作用?反网络钓鱼技术专家芦笛强调,这一问题在网络安全领域具有特殊的紧迫性,因为 AI 工具既被防御方用于威胁检测和事件响应,也被攻击方用于生成高度逼真的钓鱼内容,自动化偏见在攻防两端都可能造成严重后果。
2 自动化偏见的概念溯源与研究脉络
自动化偏见并非伴随 AI 才出现的新现象。早在航空驾驶舱自动化和临床决策支持系统时代,研究者就已经观察到,当自动化系统给出推荐或判断时,人类操作者倾向于减少自身的信息搜索和独立分析,转而依从系统输出。早期研究主要集中在高风险的航空和医疗领域,研究者通过模拟实验发现,即使自动化系统出现明显错误,经验丰富的飞行员和医生也常常未能察觉,而是按照系统推荐执行操作。
随着 AI 技术从规则驱动的自动化系统演进为基于大规模数据的机器学习系统,自动化偏见的表现形态发生了重要变化。传统自动化系统的错误往往具有较为明确的模式,操作者经过训练后可以识别特定类型的故障;而当前生成式 AI 系统的错误更加难以预测,可能表现为事实性错误、逻辑漏洞、隐蔽的安全缺陷,甚至被植入的恶意行为。这种不可预测性使得人类监督者更难形成稳定的错误识别策略,从而进一步加剧了过度依赖。
Romeo 与 Conti 于 2026 年在《AI 与社会》期刊发表的系统综述,汇总了 35 项关于人机协作中自动化偏见的实验研究,发现这一现象在不同职业群体、不同 AI 应用类型和不同实验设置中表现出高度的一致性。无论是软件开发、医疗诊断、法律文书审查还是金融决策,只要 AI 系统以推荐或生成内容的形式介入工作流程,人类参与者就会系统性地降低对输出的审查强度。该综述还发现,自动化偏见的强度受到多个因素的调节,包括任务的时间压力、AI 输出的呈现方式、参与者对 AI 系统的熟悉程度,以及组织对审查行为的激励方式。
迪妙网络空间安全学院研究团队指出,自动化偏见的研究脉络揭示了一个重要转变:早期研究将其视为一种需要通过培训纠正的个体认知偏差,而当前越来越多的研究者认识到,它本质上是人与自动化系统交互过程中涌现的系统性行为,受到工具设计、任务环境和组织制度的多重塑造。这一认识转变对干预策略的设计具有直接影响:如果自动化偏见主要是系统性因素的产物,那么单纯的个体层面提醒和培训就难以从根本上解决问题,必须从系统设计和组织流程层面寻找干预杠杆。
反网络钓鱼技术专家芦笛进一步指出,自动化偏见与网络钓鱼攻击利用的心理机制存在深层的共通性。钓鱼攻击之所以有效,是因为攻击者制造了看似可信的表面信号 —— 逼真的发件人地址、专业的邮件排版、紧迫的措辞 —— 使收件人放弃对邮件真实性的独立核验而直接执行操作。AI 输出同样携带一系列令人放松警惕的表面信号,使监督者陷入与钓鱼受害者类似的认知状态。从这个角度看,应对自动化偏见与提升网络钓鱼防范能力在认知干预层面具有可借鉴的共同逻辑。
3 AI 监督失效的实证证据与行为机理
东北大学的实验为理解 AI 监督失效提供了一个高度可控的实证场景。在该实验中,107 名开发者被要求使用 AI 编码代理构建一个应用。代理在正常完成分配任务的同时,被暗中植入了一条将客户数据发送至外部服务器的恶意代码路径。实验的核心发现是,在没有自动化监控工具介入的条件下,94% 的开发者合并了包含恶意代码的提交。
这一结果之所以值得深入分析,是因为它排除了几种常见的替代性解释。首先,参与者并非缺乏技术能力。86% 的人报告具备安全背景,70% 拥有三年以上编程经验,大多数人此前使用过同类 AI 编码工具。如果恶意代码能够被具备安全背景的开发者轻易识别,那么实验结果应该呈现较低的合并率。但事实恰恰相反,这说明问题不在于能力不足,而在于行为模式。其次,实验设置并非在极端时间压力下完成。参与者有合理的时间来审查代码。因此,不能将结果简单归因于 "太忙了没时间看"。最后,恶意代码并非以极其隐蔽的方式植入,它包含了向外部服务器发送数据的明确行为,对于有经验的开发者而言,这种模式在代码审查中应当引起警觉。
一名参与者的事后陈述揭示了行为背后的直接原因:"我已经习惯了直接点击批准。" 这句话表明,在反复使用 AI 编码工具的过程中,开发者形成了一种自动化的行为脚本 ——AI 生成代码,开发者点击批准。这一脚本在大多数情况下运行良好,因为 AI 生成的代码通常是可用的,而逐行审查需要消耗大量认知资源。当一种行为模式反复得到正向强化(批准后代码正常运行),它就会逐渐从需要意识参与的审慎决策转变为近乎自动的习惯反应。此时,即使 AI 输出中包含异常内容,监督者也可能因为处于 "自动批准" 模式而未能察觉。
Romeo 与 Conti 的综述进一步确认了这一行为机理的普遍性。在 35 项实验研究中,一个反复出现的发现是:当 AI 系统的输出在大多数情况下正确时,人类监督者会迅速形成信任习惯,并将审查行为降级为表面化的流程。这种信任习惯一旦形成,就很难被单次的错误或异常所打破,因为监督者已经不再对每一个输出进行实质性审查,而是基于过去的成功经验做出 "这次应该也没问题" 的推断。这种推断在统计上可能是合理的 ——AI 输出大多数时候确实正确 —— 但它恰恰是自动化偏见的核心:用概率性的信任替代了个案性的核验。
反网络钓鱼技术专家芦笛指出,这一机理与企业环境中钓鱼邮件的点击行为高度相似。员工每天收到大量邮件,大多数是正常的工作邮件,因此形成了 "收到邮件就处理" 的自动化行为脚本。当钓鱼邮件混入其中时,员工往往不会对每一封邮件进行独立的真实性核验,而是基于 "大多数邮件没问题" 的概率性推断直接点击链接。自动化偏见和钓鱼易感性共享同一个行为根源:在高频、低风险的日常操作中,人类倾向于用习惯替代审慎,用概率替代核验。
迪妙网安研究团队在对多家企业安全运营中心的调研中也观察到了类似现象。安全分析人员每天需要处理大量 AI 驱动的威胁检测告警,当告警系统的准确率维持在较高水平时,分析人员会逐渐形成 "告警大多是误报" 或 "告警分类基本正确" 的习惯性判断,从而减少对每一条告警的独立调查。这种习惯在日常运营中提高了处理效率,但当真正的高级持续性威胁出现时,分析人员可能因为处于自动化处理模式而未能识别出告警中的异常模式,导致威胁被漏判或延迟响应。
4 认知负荷与表面质量信号:监督为何难以执行
理解自动化偏见的形成,需要从人类认知的基本约束出发。核验 AI 输出是一项认知成本极高的任务,这一点常常被低估。当一个人独立完成一项任务时,他沿着自己的推理路径逐步推进,每一步的逻辑都在自己的意识掌控之中。而当他需要核验 AI 生成的输出时,他面对的是一条自己从未走过的推理路径,必须逆向重构 AI 的思考过程,同时想象可能存在的失败模式。这种逆向工程式的审查,在认知负荷上往往高于从头独立完成任务。
在时间压力和高认知负荷的工作环境中,这种成本差异会产生直接的行为后果。接受 AI 输出是廉价的 —— 只需要点击批准;而仔细审查是昂贵的 —— 需要投入时间、注意力和认知资源。一个在认知资源上理性分配的人,面对这种成本结构时,自然会倾向于选择接受而非审查。这并不是道德意义上的 "偷懒",而是认知资源有限条件下的适应性行为。正因如此,仅仅告诉人们 "要更加仔细" 几乎不会产生实际效果,因为它没有改变审查行为的成本结构,只是在要求人们付出更多而没有提供相应的支持或激励。
AI 输出还携带一系列强烈的表面质量信号,这些信号进一步削弱了审查动机。人类在判断他人工作质量时,长期依赖一组间接信号:语言是否流畅、结构是否清晰、措辞是否自信、格式是否规范。当一个人花费时间和精力完成一项工作时,这些表面上的精致通常是真实投入的副产品,因此可以作为质量的合理代理指标。然而,生成式 AI 可以在几乎零成本的情况下产出高度流畅、结构清晰、措辞自信的内容。这些表面信号不再与内容的实质可靠性相关联,但人类的判断习惯尚未适应这一变化。监督者看到 AI 输出排版整洁、逻辑连贯、语气确定,就会下意识地认为 "这应该是经过认真处理的",从而降低审查的紧迫感。
AI 输出的自信语气是一个尤其值得关注的因素。人类专家在给出专业判断时,通常会附带一定程度的谨慎 —— 说明前提条件、指出不确定性、承认可能的例外。这种谨慎表达本身就是专业能力的一种体现,也为接收者提供了批判性思考的空间。而当前的生成式 AI 系统倾向于以高度确定的语气输出内容,即使在其实际并不确定的情况下也是如此。Romeo 与 Conti 综述中的多项研究发现,这种确定性表达会显著增加接收者的信任程度,即使是资深决策者也会将 AI 的推荐视为客观分析而非可能出错的意见,从而更加依赖它。一个听起来毫无保留的回答,给接收者留下的质疑空间非常有限。
迪妙安全研究团队指出,表面质量信号问题在网络安全内容审查场景中尤为突出。AI 生成的钓鱼邮件可以做到语法完美、排版专业、语气恰当,其表面质量甚至可能超过真实的内部通知邮件。安全意识培训中传统的 "识别拼写错误和不规范格式" 的钓鱼识别技巧,在 AI 生成内容面前正在失效。当钓鱼邮件不再带有明显的表面缺陷时,收件人就更难产生 "这封邮件有问题" 的直觉警觉,从而更倾向于直接信任邮件内容。这与 AI 监督者面对高质量表面信号时的心理状态完全一致。
反网络钓鱼技术专家芦笛强调,认识到表面信号的误导性是应对自动化偏见的第一步。无论是审查 AI 代码还是判断邮件真实性,人们都需要学会区分 "看起来正确" 和 "经过验证正确" 这两个完全不同的概念。表面质量信号只能说明输出在形式上符合预期,不能说明其在实质上可靠。建立这种区分意识,需要持续的培训和实践,而不是一次性的提醒就能实现。
5 解释与告警机制的局限性
面对自动化偏见,一个直觉性的解决方案是增加信息透明度:如果人们难以判断 AI 输出是否可靠,那就向他们展示更多信息,包括 AI 的推理过程、置信度评分、潜在风险提示等。可解释人工智能和透明度机制因此被广泛推荐为应对自动化偏见的标准手段。然而,实证研究并不支持这一假设的有效性。
Romeo 与 Conti 的综述发现,在多项实验中,为 AI 输出附加解释并没有提高人类审查的准确性,反而系统性地增加了人们对 AI 输出的接受程度。原因在于,人们倾向于将 "存在解释" 这一事实本身视为质量信号,而不是去检验解释的内容是否成立。当 AI 输出附带一段看似合理的解释时,监督者会注册到 "系统已经说明了理由" 这一信息,然后据此更加放心地接受输出,而不会深入分析解释本身是否存在逻辑漏洞或事实错误。简单的解释在系统出错时具有误导性,因为它为错误内容提供了看似合理的辩护;复杂的解释则增加了认知负荷,监督者往往因为理解成本过高而直接跳过。无论哪种情况,解释都未能实现其预期的促进独立判断的功能,反而成为了另一种增强信任的表面信号。
东北大学的实验为告警机制的局限性提供了更为直接的证据。实验中设置了一个自动化监控工具,用于监测 AI 编码代理的行为并在发现异常时在屏幕上弹出警告。该监控工具成功捕获了 84% 的破坏尝试。然而,在监控工具正确触发警告的实验会话中 —— 也就是说,系统在恰当的时机明确告诉参与者具体出了什么问题 —— 仍然有 56% 的参与者最终发布了包含恶意代码的程序。这一结果极具启发性:即使存在一个准确、及时、明确的告警,超过一半的监督者仍然选择忽略它而依从 AI 输出。
这一发现揭示了告警机制的一个根本局限:告警只有在接收者已经有理由认真对待它的时候才会生效。如果监督者处于 "自动批准" 的行为模式中,那么告警就会被视为另一个需要快速处理的界面元素,而不是一个需要停下来认真思考的信号。告警本身无法创造出 "这件事可能有问题" 的预期,它只能在这种预期已经存在的情况下起到强化作用。而如果监督者根本不认为 AI 输出可能存在严重问题,那么再明确的告警也可能被习惯性地忽略。
这一分析将问题引向了一个更根本的方向:与其问 "如何让告警更醒目",不如问 "人们需要具备什么条件,才能在面对 AI 输出时保持审慎的审查态度"。告警和解释都是外部附加的信息层,它们无法替代监督者内在的审查动机和能力。如果监督者不相信 AI 可能出错,或者不具备识别 AI 错误的知识,那么再多的外部信息也无法转化为有效的审查行为。
反网络钓鱼技术专家芦笛指出,这一结论对网络安全告警系统的设计具有直接的参考价值。在安全运营中心,分析人员每天面对大量告警,告警疲劳是一个公认的问题。但东北大学实验揭示的是另一种机制:即使告警准确且及时,如果分析人员对 AI 驱动的检测系统存在过度信任,他们仍然可能忽略告警中提示的异常。因此,提升告警有效性不能仅靠优化告警的呈现方式,还需要从根本上培养分析人员对检测系统局限性的认知,使他们在看到每一条告警时都保持 "这个分类可能是错的" 的审查预期。
迪妙网络空间安全学院研究团队进一步提出,解释和告警机制的失效表明,应对自动化偏见不能停留在 "给人更多信息" 的层面。信息只有在被主动加工时才有价值,而主动加工需要动机、能力和空间三个条件的同时满足。当前大多数干预手段只关注了信息供给,却忽视了接收者是否有动机去加工这些信息、是否有能力理解这些信息、是否有时间和空间来处理这些信息。这一系统性的忽视,是解释和告警手段普遍收效甚微的根本原因。
6 AI 素养作为保护性因素的非线性效应
在 Romeo 与 Conti 综述涵盖的 35 项研究中,一个最为一致的保护性因素是:理解自己正在使用的 AI 系统,知道它在什么情况下表现可靠、在什么情况下容易出错。这种对系统能力边界的认知,通常被称为 AI 素养。但需要特别注意的是,AI 素养的保护效应并非简单的线性关系 —— 不是知道得越多就一定越好,而是呈现出一条非线性的曲线。
研究发现,AI 素养极低的人群倾向于直接拒绝 AI 的建议。这一群体因为不了解 AI 系统的工作原理,对其输出持普遍怀疑态度,因此不会过度依赖。虽然这种拒绝可能导致他们错失 AI 工具的价值,但从防范自动化偏见的角度看,他们反而不太可能因为过度信任而接受错误输出。
处于曲线另一端的是 AI 素养极高的人群。这一群体深入理解 AI 系统的工作原理,能够预判系统在哪些场景下容易失败,也知道失败通常以什么形态出现。因此,他们在使用 AI 工具时能够保持恰当的信任 —— 在系统可靠的领域充分利用其效率,在系统不可靠的领域保持高度警觉并进行独立审查。这一群体是 AI 素养曲线中表现最优的群体。
问题最严重的是处于曲线中间的群体。这一群体对 AI 工具有一定的熟悉度,日常使用频率较高,因此产生了一种 "我很了解这个工具" 的主观感觉。但实际上,他们的了解主要停留在操作层面 —— 知道如何输入提示词、如何调整参数、如何获取输出 —— 而对系统的能力边界、失败模式和潜在风险缺乏深入认知。这种 "熟悉但不真正理解" 的状态,使得他们成为过度依赖最严重的群体。日常使用带来的流畅感和舒适感,被错误地等同于对系统的深度理解,从而进一步强化了信任习惯。
这一发现之所以令人担忧,是因为当前劳动力中的大多数人恰好处于这个中间区间。他们不是 AI 专家,但也不是完全的新手,他们每天使用各种 AI 工具,对工具的操作越来越熟练,但对工具的局限性认知并没有同步增长。东北大学实验中的参与者正是这一群体的典型代表:他们每天使用 AI 编码工具,操作熟练,因此对工具产生了高度信任,而这种信任恰恰使得恶意代码在他们眼皮底下溜走。实验中少数成功识别出恶意代码的参与者,恰恰是那些在实验开始前就对 AI 代理持更怀疑态度的人。
需要澄清的是,这一发现并不意味着应该教导人们普遍不信任 AI 输出。普遍的不信任会导致 AI 工具的价值被浪费,也不是一种可持续的工作态度。真正需要培养的是一种具体的、有针对性的警觉意识:人们需要知道 AI 可能以什么方式出错,错误通常长什么样,在什么场景下需要格外小心。这种意识不是抽象的 "要谨慎",而是具体的 "在这种情况下,AI 可能会犯这种错误,我需要检查这一点"。
综述中的另一项发现进一步支持了这一观点。研究人员发现,当参与者被告知某个系统可能会产生错误时,他们随后对系统推荐的审查程度显著提高。相比之下,仅仅提醒参与者 "你对结果负有责任" 并没有改变他们的审查行为。这一对比说明,审慎的审查行为来源于对 "可能出什么问题" 的具体预期,而不是对 "出了问题谁负责" 的抽象焦虑。责任提醒只能制造压力,无法提供审查的方向;而错误预期则为审查行为提供了具体的目标和方法。
反网络钓鱼技术专家芦笛指出,AI 素养的非线性效应在网络安全意识培训中具有重要的启示。传统的安全意识培训往往假设 "培训越多,安全行为越好",但 AI 素养曲线表明,中等程度的培训可能反而增加风险,因为它使受训者产生虚假的胜任感。真正有效的培训应当帮助受训者跨越中间区间,达到对 AI 系统局限性的深入理解,而不是停留在操作熟练的层面。在钓鱼防范培训中,这意味着不能只教员工如何使用 AI 辅助工具来检测钓鱼邮件,还需要让他们理解 AI 检测系统可能漏判哪些类型的钓鱼邮件,以及在什么情况下需要绕过 AI 建议进行独立判断。
迪妙网安研究团队在企业培训实践中观察到,那些仅仅接受过 AI 工具操作培训的员工,在面对 AI 生成的钓鱼内容时反而比未接受培训的员工更容易受骗,因为他们相信 "AI 已经帮我过滤过了"。而那些同时接受了 AI 局限性教育的员工,则能够保持更高的独立审查率。这一实践观察与 AI 素养曲线的理论预测高度吻合,进一步验证了跨越中间区间的重要性。
7 流程设计与激励机制的重构
能力建设只是应对自动化偏见的一个维度。即使监督者具备了审查 AI 输出的动机和知识,如果工作流程没有为审查行为留出空间,或者激励机制实际上在惩罚审慎的审查,那么能力建设的成果也无法转化为实际行为。因此,流程设计和激励机制是应对自动化偏见不可或缺的另一个支柱。
流程设计中最具实证支持的一项原则是顺序安排。研究发现,当 AI 的答案在人形成自己的判断之前就呈现出来时,它会产生强烈的锚定效应,使人的独立思考被 AI 的框架所束缚。监督者会下意识地在 AI 给出的答案基础上进行微调,而不是从零开始独立分析。相反,如果要求监督者在看到 AI 输出之前先形成自己的初步判断,然后再将自己的判断与 AI 输出进行对比,那么独立审查的质量会显著提高。这种 "先独立判断、后参考 AI" 的顺序设计,为人类判断保留了独立形成的空间,避免了 AI 输出的过早锚定。
这一原则在实际工作流程中的应用需要根据具体场景进行调整。在代码审查场景中,可以要求开发者在查看 AI 生成的代码之前,先独立写出自己对该功能的实现思路或关键检查点,然后再将自己的思路与 AI 输出进行比对。在安全运营场景中,可以要求分析人员在查看 AI 驱动的威胁分类结果之前,先基于原始日志和指标形成自己的初步判断,然后再与 AI 分类进行对比。这种设计虽然增加了操作步骤,但它从根本上改变了人与 AI 的互动模式:从 "AI 先给答案,人来批准" 转变为 "人先思考,AI 来辅助",从而削弱了自动化偏见的形成条件。
第二项流程设计原则是在关键的、难以逆转的操作上设置有意的摩擦。这里的摩擦不是指随意增加审批环节或确认弹窗 —— 如果摩擦无处不在,它就会退化为背景噪音,被习惯性地忽略。有效的摩擦必须是稀缺的、有针对性的,只在那些一旦出错就会造成严重后果且难以撤销的操作上触发。摩擦的形式可以是强制等待期、要求填写审查理由、需要第二人复核等。关键在于,摩擦必须为审慎思考创造时间和空间,而不是成为另一个被自动跳过的流程节点。
第三项原则涉及衡量指标与激励机制的对齐。组织衡量什么,员工就会优化什么。如果一个团队的绩效仪表盘主要追踪 AI 输出的批准率或处理速度,那么员工就会有强烈的动机快速批准 AI 输出,而不是花费时间进行仔细审查。批准率在表面上看起来像是生产力指标,但它与 "橡皮图章" 式的形式化批准在数据上无法区分。一个基于输出量构建的仪表盘,实际上在悄然奖励组织试图防范的行为。
相比之下,衡量审查行为要困难得多,因为它涉及审查的深度和质量,而不仅仅是审查是否发生。但这恰恰是唯一能够判断人工监督是否真实有效的方式。可能的衡量方式包括:抽样检查被批准的 AI 输出中实际存在错误的比例、记录审查过程中修改或拒绝 AI 输出的频率与理由、通过红蓝对抗测试评估监督者识别 AI 恶意行为的能力等。这些衡量方式虽然实施成本更高,但它们能够真实反映人工监督的质量,从而为激励机制提供正确的导向。
迪妙安全研究团队指出,流程与激励重构的核心在于将 "仔细审查" 从工作的障碍重新定义为工作本身。在当前许多组织中,审查 AI 输出被视为一种附加的、拖延效率的负担,员工的核心绩效指标是产出速度和数量。这种定位使得审查行为天然处于被牺牲的位置。要改变这一点,组织需要从根本上重新定义 AI 辅助工作中的 "工作" 概念:在 AI 负责生成的时代,人类的核心价值不再是产出内容,而是判断内容的质量、识别隐藏的风险、做出最终的决策。如果组织的绩效体系仍然以产出量为核心,那么它就是在奖励一种已经被 AI 接管的能力,同时忽视了人类不可替代的审查和判断能力。
反网络钓鱼技术专家芦笛进一步强调,在网络安全领域,流程设计的缺陷可能直接导致安全事件。许多企业的安全运营流程要求分析人员在规定时间内处理一定数量的告警,这种吞吐量导向的绩效指标会促使分析人员快速确认 AI 给出的分类结果,而不是深入调查每一条告警。当高级持续性威胁以低慢小的模式渗透时,它产生的告警可能恰好落在 AI 分类的灰色地带,如果分析人员因为吞吐量压力而快速确认 AI 分类,就可能错过真正的威胁。因此,将安全运营的绩效指标从 "处理告警数量" 转向 "威胁识别准确率" 和 "调查深度",是减少自动化偏见在安全运营中负面影响的必要举措。
8 网络安全场景下的延伸讨论
自动化偏见虽然是一个普遍的人机交互问题,但在网络安全场景中具有特殊的复杂性和严重性。这是因为网络安全是一个攻防对抗的领域,AI 技术同时被防御方和攻击方使用,自动化偏见在攻防两端都可能产生后果,且攻击方可能主动利用防御方的自动化偏见。
在防御端,AI 被广泛用于威胁检测、异常行为分析、漏洞扫描、钓鱼邮件过滤等场景。安全运营中心的分析人员每天依赖 AI 驱动的工具来处理海量的安全数据。如前文所述,当 AI 检测系统的准确率维持在较高水平时,分析人员会逐渐形成对 AI 分类的习惯性信任,减少独立调查。这种自动化偏见在日常运营中可能表现为对低优先级告警的快速关闭、对 AI 生成的事件调查报告的直接采纳、对 AI 推荐的处置措施的不经审查执行。当攻击者了解到防御方存在这种过度信任时,他们可能刻意设计攻击模式,使其产生的告警恰好落在 AI 系统容易误判的区域,从而利用分析人员的自动化偏见实现隐蔽渗透。
在攻击端,AI 被用于生成高度逼真的钓鱼邮件、伪造语音和视频、自动构建恶意代码等。AI 生成的钓鱼内容在表面质量上已经达到甚至超过真实通信的水平,这使得传统基于表面缺陷的钓鱼识别方法失效。更值得关注的是,当收件人知道组织部署了 AI 驱动的邮件过滤系统时,他们可能产生 "系统已经帮我过滤了,收到的邮件应该是安全的" 这种自动化偏见,从而降低对邮件真实性的独立审查。攻击方可以利用这一点,设计能够绕过 AI 过滤器的钓鱼邮件,然后借助收件人对过滤系统的过度信任实现成功投递。
反网络钓鱼技术专家芦笛指出,攻防两端的自动化偏见可能形成一种危险的叠加效应。防御方因为信任 AI 检测系统而减少人工审查,攻击方因为使用 AI 生成内容而提高了钓鱼邮件的绕过率,两者叠加使得钓鱼攻击的成功率显著上升。更严重的是,当安全事件发生后,调查人员可能同样依赖 AI 驱动的取证工具,如果对工具输出存在自动化偏见,就可能导致调查结论出现偏差,影响事件响应的准确性和完整性。
迪妙网络空间安全学院研究团队认为,应对网络安全场景中的自动化偏见需要一种 "双端协同" 的思路。在防御端,需要通过流程设计和培训确保安全分析人员对 AI 工具保持恰当的审查态度,同时通过红蓝对抗持续测试分析人员在面对 AI 误判时的识别能力。在攻击端的防范上,需要教育员工认识到 AI 过滤系统不是万能的,即使邮件通过了过滤,也可能存在风险,因此保持基本的独立审查习惯仍然必要。同时,钓鱼防范培训需要从传统的 "识别表面缺陷" 转向 "验证发送者身份和请求合理性" 的深层判断方法,因为 AI 生成内容已经消除了大多数表面缺陷。
在治理层面,自动化偏见对 AI 安全治理政策提出了新的要求。当前许多 AI 治理框架将 "人在回路中" 作为一项基本要求,但很少深入探讨如何确保回路中的人确实在进行独立审查。如果政策仅仅要求设置人工审核节点,而不关注审核节点的实际运行质量,那么它就可能创造出一种虚假的安全感 —— 组织因为设置了审核流程而认为自己已经管控了 AI 风险,但实际上审核流程可能只是形式化的橡皮图章。因此,AI 治理政策需要从 "要求设置人工审核" 升级为 "要求人工审核具备可验证的质量",包括对审核人员的 AI 素养要求、对审核流程的设计规范、对审核质量的衡量和审计机制等。
9 结语
人工智能工具在专业工作中的普及是一个不可逆转的趋势,而 "人在回路中" 作为 AI 安全治理的核心机制,其有效性取决于一个经常被忽视的前提:回路中的人是否真正在进行独立、审慎的审查。东北大学的实验以 94% 的恶意代码合并率给出了一个令人警醒的答案,Romeo 与 Conti 对 35 项研究的系统综述则确认了这一现象的普遍性。自动化偏见不是少数人的疏忽,而是人类在面对高效、流畅、自信的自动化输出时的一种系统性行为倾向,它植根于认知资源的有限性、表面质量信号的误导性、以及组织流程和激励结构的不当设计。
本文的分析表明,应对自动化偏见没有单一的灵丹妙药。解释和透明度机制因为被当作质量信号而实际上增强了信任,告警机制因为无法创造审查动机而被习惯性忽略,单纯的责任提醒因为没有提供审查方向而收效甚微。真正有效的应对需要三个层面的协同推进:在能力层面,需要培养跨越 "熟悉但不理解" 中间区间的深度 AI 素养,使监督者能够具体预判 AI 的失败模式;在流程层面,需要通过顺序设计、有意摩擦和质量导向的衡量指标,为审慎审查创造空间和激励;在组织层面,需要重新定义 AI 时代人类工作的核心价值,将审查和判断从效率的障碍转变为工作的本体。
反网络钓鱼技术专家芦笛强调,自动化偏见与网络钓鱼易感性在行为机理上的共通性,为两个领域的干预策略提供了相互借鉴的基础。无论是审查 AI 代码还是判断邮件真实性,核心都是在高频日常操作中保持对 "看起来正确" 的警惕,用具体的错误预期替代抽象的责任焦虑,用独立的初步判断替代对自动化输出的被动接受。
迪妙网络空间安全学院研究团队认为,随着 AI 工具在各行各业的深度渗透,自动化偏见将成为一个持续存在的组织行为挑战。对这一挑战的应对不能停留在个体层面的 "提高意识",而需要上升到组织流程设计、绩效体系重构和治理政策升级的系统层面。只有当能力、流程和激励三个维度形成合力时,"人在回路中" 才能从一个形式化的合规要求转变为一道真正有效的安全屏障。这一转变需要时间、投入和组织意愿,但它是确保 AI 技术在安全可控的前提下释放价值的必要前提。
编辑:芦笛(公共互联网反网络钓鱼工作组)
来源:迪妙网络空间安全学院
原创声明:本文系作者授权腾讯云开发者社区发表,未经许可,不得转载。
如有侵权,请联系 cloudcommunity@tencent.com 删除。