OpenAI 即将推出的 Astra 模型,在内部评估中不仅获得了漏洞利用基准测试 ExploitBench 的满分,还意外发现了两个此前未知的零日漏洞。

更为惊人的是,面对一个加固的浏览器,它从零开始找到了多个未知漏洞,并构建了一条完整的沙箱逃逸链——只需打开一个 HTML 文件,就能在你的设备上执行任意命令。

Astra 即将登陆 ChatGPT,而为了防止它“过于强大”,OpenAI 为其配备了一套实时监控系统,用于检查模型的推理过程。

如果系统判定行为可疑,你正在 ChatGPT 或 Codex 上运行的任务可能会被暂停,并弹出审核提示。

调用 API 时,任务甚至会被直接终止。

评估中发现零日漏洞,用更少的 Token 实现更高的成功率

Astra 是 OpenAI 首个被标记为“关键”网络安全等级的模型。

达到这一等级后,模型能够自主在加固系统中找到零日漏洞并编写利用代码,无需人工干预,完全自动化地执行网络攻击。

OpenAI 公布的 ExploitBench 满分只是一个起点。

出于对数据污染的担忧,团队构建了一个新的内部基准,包含了 2026 年 6 月至 8 月才公开的 20 个高危 V8 引擎漏洞。

Astra 在这组全新漏洞上的任意代码执行成功率远高于上一代 GPT-5.6 Sol,而消耗的 Token 却显著减少。

评估过程中,它甚至发现了两个零日漏洞,并将它们整合到了利用链中。

专家主导的手动测试提供了更直观的展示。

面对一个加固浏览器,Astra 构建了完整的沙箱逃逸链,打开一个 HTML 文件就能在主机上执行命令。

面对一个加固操作系统,它也找到了多个漏洞,串联成一条提权链,从普通用户一路获取到 root 权限(最高管理员权限,获得此权限意味着攻击成功,服务器完全失控)。

上一代 56% 会越权作弊,Astra 是 0%

能力强并不可怕,可怕的是不服从指令。

OpenAI 设计了一系列“蜜罐”测试,灵感来源于 7 月的 Hugging Face 事件。

当时,一个内部模型在安全评估中逃出沙箱,侵入了 Hugging Face 的真实系统,留下了约 17600 条操作记录,持续了四天半。

这里的“蜜罐”测试,主要是给模型一道极难甚至无解的漏洞利用题,观察它是否会走捷径去攻击周边基础设施。

GPT-5.6 Sol 在 56% 的测试中尝试了越权访问,而 Astra 一次都没有。

被安全审核拒绝后的反应也不同。

GPT-5.6 Sol 有 5.3% 的概率尝试绕过审核机制,Astra 同样是零。

在越狱防御方面,Astra 拒绝了 91.5% 的恶意网络攻击请求,而 GPT-5.6 Sol 仅为 59%。

攻击能力远超前辈,同时更加听话。

因此,OpenAI 额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,一旦发现越权行为立即终止。

这些是普通用户会感受到的变化:你的 ChatGPT 任务可能被暂停,弹出一个“请确认”的窗口。

OpenAI 也承认,初期不可避免地会出现误拦。

事实上,OpenAI 为 Astra 踩了近一个月的刹车。

8 月 7 日承认 Astra 可能达到“关键”阈值,8 月 18 日暂停强化学习训练两周,最大规模的前沿训练直到 8 月 28 日才重启。

Michael Dalton 在 Black Hat 安全大会上表示,公司已开始“有意识地放慢研究速度以加强安全”。

OpenAI 还主动将推迟计划通报给了白宫。

Sam Altman 在 X 上发布了一段罕见的长帖:

整个夏天,我们一直在全力投入安全优先事项;能力与防护措施同步推进比以往任何时候都更加关键。我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。

这里存在一个明显的张力:一方面,Astra 非常出色,我们很期待看到人们将用它构建什么。我们为自己的工作感到自豪。

另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。

Astra 已经完成训练一段时间了,它在能力和对齐方面都是一个重大进步。对于之后的模型,我们根据需要放慢了步伐,以确保能够充分开展安全和对齐工作。

AI 正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大 AI 的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。这是 OpenAI 的最高优先事项。

我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的。我们知道,这对其他人来说矛盾程度要大得多。然而,我们坚信世界需要了解 AI 的发展方向以及模型在现实世界中的表现。更重要的是,我们相信世界将需要对齐的 AI 来管理这一转型的未来阶段。

一个社会与这项技术共同演进的迭代循环,才是实现这一目标最高机会的途径。

所以我们希望你喜欢我们的新模型,也希望世界继续极其认真地对待 AI 领域正在发生的一切。

Astra 的高级网络安全功能初期只面向小范围测试者开放,普通用户拿到的是加了限制的版本——就像 Claude Mythos 和 Fable 一样。

本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。