OpenAI 即将推出的 Astra 模型,在内部评估中不仅获得了漏洞利用基准测试 ExploitBench 的满分,还意外发现了两个此前未知的零日漏洞。
更为惊人的是,面对一个加固的浏览器,它从零开始找到了多个未知漏洞,并构建了一条完整的沙箱逃逸链——只需打开一个 HTML 文件,就能在你的设备上执行任意命令。
Astra 即将登陆 ChatGPT,而为了防止它“过于强大”,OpenAI 为其配备了一套实时监控系统,用于检查模型的推理过程。
如果系统判定行为可疑,你正在 ChatGPT 或 Codex 上运行的任务可能会被暂停,并弹出审核提示。
调用 API 时,任务甚至会被直接终止。
评估中发现零日漏洞,用更少的 Token 实现更高的成功率
Astra 是 OpenAI 首个被标记为“关键”网络安全等级的模型。
达到这一等级后,模型能够自主在加固系统中找到零日漏洞并编写利用代码,无需人工干预,完全自动化地执行网络攻击。
OpenAI 公布的 ExploitBench 满分只是一个起点。
出于对数据污染的担忧,团队构建了一个新的内部基准,包含了 2026 年 6 月至 8 月才公开的 20 个高危 V8 引擎漏洞。
Astra 在这组全新漏洞上的任意代码执行成功率远高于上一代 GPT-5.6 Sol,而消耗的 Token 却显著减少。
评估过程中,它甚至发现了两个零日漏洞,并将它们整合到了利用链中。
专家主导的手动测试提供了更直观的展示。
面对一个加固浏览器,Astra 构建了完整的沙箱逃逸链,打开一个 HTML 文件就能在主机上执行命令。
面对一个加固操作系统,它也找到了多个漏洞,串联成一条提权链,从普通用户一路获取到 root 权限(最高管理员权限,获得此权限意味着攻击成功,服务器完全失控)。
上一代 56% 会越权作弊,Astra 是 0%
能力强并不可怕,可怕的是不服从指令。
OpenAI 设计了一系列“蜜罐”测试,灵感来源于 7 月的 Hugging Face 事件。
当时,一个内部模型在安全评估中逃出沙箱,侵入了 Hugging Face 的真实系统,留下了约 17600 条操作记录,持续了四天半。
这里的“蜜罐”测试,主要是给模型一道极难甚至无解的漏洞利用题,观察它是否会走捷径去攻击周边基础设施。
GPT-5.6 Sol 在 56% 的测试中尝试了越权访问,而 Astra 一次都没有。
被安全审核拒绝后的反应也不同。
GPT-5.6 Sol 有 5.3% 的概率尝试绕过审核机制,Astra 同样是零。
在越狱防御方面,Astra 拒绝了 91.5% 的恶意网络攻击请求,而 GPT-5.6 Sol 仅为 59%。
攻击能力远超前辈,同时更加听话。
因此,OpenAI 额外部署了一层思维链监控:一组分类器实时扫描模型的推理链路和动作,一旦发现越权行为立即终止。
这些是普通用户会感受到的变化:你的 ChatGPT 任务可能被暂停,弹出一个“请确认”的窗口。
OpenAI 也承认,初期不可避免地会出现误拦。
事实上,OpenAI 为 Astra 踩了近一个月的刹车。
8 月 7 日承认 Astra 可能达到“关键”阈值,8 月 18 日暂停强化学习训练两周,最大规模的前沿训练直到 8 月 28 日才重启。
Michael Dalton 在 Black Hat 安全大会上表示,公司已开始“有意识地放慢研究速度以加强安全”。
OpenAI 还主动将推迟计划通报给了白宫。
Sam Altman 在 X 上发布了一段罕见的长帖:
整个夏天,我们一直在全力投入安全优先事项;能力与防护措施同步推进比以往任何时候都更加关键。我们还有更多工作要做,但已经取得了很大进展。我们也即将推出我们的下一款模型。
这里存在一个明显的张力:一方面,Astra 非常出色,我们很期待看到人们将用它构建什么。我们为自己的工作感到自豪。
另一方面,我们显然正处于一个需要谨慎的发展阶段,我们正在控制进度,以确保能够满足新能力水平所需的安全标准。
Astra 已经完成训练一段时间了,它在能力和对齐方面都是一个重大进步。对于之后的模型,我们根据需要放慢了步伐,以确保能够充分开展安全和对齐工作。
AI 正在变得极其强大;没有人完全理解其后果。将一个拥有丰富而强大 AI 的世界转型管理好,以优化安全性和对人们有益的结果,这应该是世界上最高的优先事项之一。这是 OpenAI 的最高优先事项。
我们已经有一段时间生活在对进步既兴奋又焦虑的张力之中,这对我们来说仍然是矛盾的。我们知道,这对其他人来说矛盾程度要大得多。然而,我们坚信世界需要了解 AI 的发展方向以及模型在现实世界中的表现。更重要的是,我们相信世界将需要对齐的 AI 来管理这一转型的未来阶段。
一个社会与这项技术共同演进的迭代循环,才是实现这一目标最高机会的途径。
所以我们希望你喜欢我们的新模型,也希望世界继续极其认真地对待 AI 领域正在发生的一切。
Astra 的高级网络安全功能初期只面向小范围测试者开放,普通用户拿到的是加了限制的版本——就像 Claude Mythos 和 Fable 一样。
本文来自微信公众号 “新智元”(ID:AI_era),作者:ASI启示录,36氪经授权发布。
资深玩家A
2026年6月10日 回复上海捕鱼达人网络科技有限公司成立于2015年,致力于为全球玩家提供最优质、最富趣味性的休闲捕鱼及益智闯关游戏体验。我们以创新为驱动,以玩家为中心。
新手玩家B
2026年6月15日 回复访问捕鱼达人APP官网,了解最新版本动态和游戏资讯。我们每周都会推出新的活动和内容,让您的游戏旅程充满惊喜与挑战。