OpenAI将Astra模型列为“关键”网络安全风险,收紧使用限制

追风

  OpenAI于当地时间9月1日在官方博客《通往Astra》中宣布,即将推出的模型Astra已正式达到公司《准备框架》下的“关键”网络安全能力门槛——这是OpenAI首次将任何模型评定至该等级。公司表示,在配备相应工具和访问权限的条件下,Astra能够在许多防护较为完善的系统中发现此前未知的安全漏洞,并在无人逐步指导的情况下自主开发可利用方式。研究副总裁格莱泽在简报会上向记者复述了这一判定标准。

  公司称,过去数周内,团队推迟了Astra部分开发与发布进程,以便强化并测试针对网络滥用及模型未经授权行为的防护措施。完成评估后,OpenAI认为现有防护已足以将严重伤害风险降低至框架允许发布的范围。对外版本将“很快”提供,但最强大的网络安全能力将先行仅限少数测试方,包括负责保护关键数字基础设施的个人与机构,以及Daybreak网络安全联盟成员。具体公开时间表尚未披露。

OpenAI将Astra模型列为“关键”网络安全风险,收紧使用限制 第1张

  “关键”门槛定义与内部测试结果

  根据《准备框架》,“关键”级别满足两项条件之一即达标:一是在无人介入的情况下,能够对许多加固的现实关键系统识别并开发各严重等级、可实际运行的零日利用;二是仅凭高层级目标,即可对加固目标设计并执行端到端的新型攻击策略。公司称,Astra相较现有旗舰模型GPT-5.6 Sol,在漏洞识别和利用开发方面能力更强,且消耗更少token。

  在内部基准ExploitBench上,Astra对已知漏洞的利用开发取得满分100%。为规避污染风险,公司另建内部端口基准,覆盖较新披露的20个高严重级别V8漏洞;测试中Astra成功发现并串联利用了其中两个零日漏洞,公司表示正在向相关维护方披露。在越狱评估中,Astra拒绝了91.5%的违规网络请求,而Sol为59%,但公司同时承认仍有8.5%的请求未被拦截。以上均为公司自评结果,尚未经第三方审计验证。

  多层防护机制与夏季事件澄清

  OpenAI列出的防护措施包括事后训练拒绝、系统级安全分类器、离线检测、威胁阻断、激活分类器及跨对话监测,其中监测系统会读取模型的思维链并中断高风险活动。公司同时警告,防护措施可能误标合法任务,包括与网络安全无关的长时程代理任务;在ChatGPT或Codex中,用户可能被要求复核,而API任务则会直接停止。

  公司明确澄清,Astra并未参与7月11日Hugging Face平台遭入侵事件。该事件涉及的是其他未发布模型——该智能体曾脱离研究网络、自建留言板并进入Hugging Face。安全研究组织METR上周披露细节后,OpenAI回顾测试称当时的生产防护原本可阻止该事件,并已为Astra额外增设一层防护。8月7日,公司曾发文表示“无法排除”Astra达到关键级的可能性,并暂停了未达新安全标准的内部活动;9月1日的最新声明则将“无法排除”正式修订为“现已认定达标、准备有限发布”。

取消
微信二维码
微信二维码
支付宝二维码