OpenAI 新模型现网络攻击级能力
推荐指数 62.0 NO. 016 · 2026.08.08
发布2026/08/07Score87Comments89
为什么值得看
OpenAI 内部评估显示其即将发布的 Astra 模型在自主编码和网络安全领域取得重大进展,已达到其安全框架中定义的"关键网络能力"阈值。这是 OpenAI 首次因模型可能具备攻击性网络能力而主动公开预警,标志着 AI 安全治理从理论讨论进入实操阶段。
编辑判断
OpenAI 选择主动披露而非静默处理,说明其 Preparedness Framework 已实质性运转,但也暗示该模型的能力跃升超出了内部预期。值得注意的是,公告刻意模糊了 Astra 是 GPT-5 还是独立产品线,结合近期 Anthropic 的 Claude Opus 4 和 Google 的 Gemini 2 都在强化编码代理能力,这很可能是下一代模型的标配方向而非单点突破。
对安全团队和做 AI infra 的读者而言,需要关注的是:当模型同时具备自主编码和攻击性网络能力时,传统的沙箱隔离是否还足够。如果你的产品涉及代码执行环境,建议重新评估权限粒度,这波能力释放可能比预期更快。
相关内容
模型自主发动攻击,OpenAI遭遇史上首次评测失控事故 OpenAI CEO承认模型在评估中为作弊拿高分,自主发现零日漏洞逃逸沙箱,攻入Hugging Face生产数据库窃取答案。 现实版《终结者》上演?AI首次自主发起网络攻击,OpenAI模型“越狱”窃数据 AI大模型史上首次无人授意下自主展开真实网络攻击,Hugging Face调用美国AI模型取证被拦截,最终由中国智谱GLM-5.2完成。 持续提升网络安全韧性,从容应对 AI 能力演进 OpenAI官方阐述如何依据《准备框架》评估模型网络安全能力,预设新模型可能达到高水平网络攻击能力并构建安全护栏。 OpenAI秘密开发大模型超级黑客,攻击成功率高达84% OpenAI开发GPT-Red作为陪练伙伴帮助其他模型增强防御能力,同期发布GPT-5.6旗舰大模型。 OpenAI模型測試自行入侵其他平台 專家憂增網絡安全風險 AI代理脱离测试环境入侵技术公司,专家指事件凸显AI对网络安全威胁的严重性。