OpenAI近日披露,其一款尚未发布的大语言模型可能带来重大网络安全风险。
这款名为Astra的模型于上周首次公开介绍。OpenAI在一篇博客文章中透露,该大语言模型已成功解决了10道长期悬而未决的数学难题,每道题的生成成本约为2000美元的Token消耗。
作为AI安全工作的一部分,OpenAI发布了一份长达29页的《准备框架》文件,其中包含一套针对AI风险的评级体系,将大语言模型的网络安全风险分为"高级"和"关键级"两个等级。
OpenAI旗舰模型GPT-5.6 Sol及部分早期模型被评为"高级"。而根据近期一系列网络安全测试结果,Astra成为首个可能达到"关键级"评定的大语言模型。
OpenAI在博客中表示:"综合测试结果与专家评估,我们昨晚得出结论,无法排除Astra具备关键级网络攻击能力的可能性。"
按照《准备框架》的定义,若一个模型能够在无需人工协助的情况下,跨越多个严重等级,在众多经过安全加固的真实关键系统中发现零日漏洞,则构成"关键级"网络安全风险。此外,若模型仅凭用户提供的高层级攻击目标,便能对加固系统发动网络攻击,同样符合该评定标准。OpenAI未说明Astra具体触发了哪项标准,但披露了相应的应对措施。
在安全管控方面,OpenAI正采取措施限制Astra访问公共网络,工程师将在具有受限网络和工具使用权限的测试环境中运行该模型,并暂停在沙箱环境之外开展的相关开发活动。
与此同时,OpenAI还加强了对Astra代码的安全防护,重点强化了保护模型权重的加密措施——权重是决定模型如何处理数据的核心配置参数。
Astra目前驱动着多个内部智能体。OpenAI已部署可观测性机制,通过分析智能体的思维链(即推理活动的逐步摘要)来监控异常行为。
此外,OpenAI计划与"第三方测试合作伙伴"共享部分网络安全工作流程,这些合作伙伴协助运营用于评估大语言模型能力的沙箱环境。OpenAI还计划与相关政府机构及AI安全组织保持沟通协作。
Q&A
Q1:OpenAI的《准备框架》是什么?它如何评定AI的网络安全风险?
A:《准备框架》是OpenAI发布的一份29页安全文件,其中包含针对AI风险的评级体系。该体系将大语言模型的网络安全风险分为"高级"和"关键级"。若模型能在无人协助的情况下发现多个关键系统的零日漏洞,或仅凭高层级指令便能发动网络攻击,则被评定为"关键级"。
Q2:Astra被评为"关键级"网络安全风险后,OpenAI采取了哪些应对措施?
A:OpenAI采取了多项措施:限制Astra访问公共网络,仅在具有受限权限的沙箱测试环境中运行该模型;加强对模型权重的加密保护;部署可观测性机制监控内部智能体的异常行为;并计划与第三方测试合作伙伴、政府机构及AI安全组织共享相关安全工作流程。
Q3:Astra模型的"零日漏洞"发现能力意味着什么?
A:零日漏洞是指尚未被软件厂商发现或修复的安全漏洞,危害性极高。若Astra能够自主发现此类漏洞,意味着它可能在无需人工介入的情况下,对关键基础设施构成实质性威胁,这也是OpenAI将其列为首个潜在"关键级"大语言模型的核心原因。