1. 首页 > 头条

OpenAI紧急叫停Astra模型:因黑客能力突破安全阈值

Ai总结: OpenAI宣布暂停其未发布模型Astra的部分开发,因其在自主编程与网络安全领域展现出可能达到“关键”级别的攻击能力。此举标志着大型AI实验室首次主动因自身安全评估而放缓研发进程。

OpenAI因模型过强而启动自我约束机制

在成功攻克数学领域十项长期悬而未决的难题后仅数日,OpenAI却突然揭示了一个截然相反的进展:其内部研发的Astra模型可能已逼近或超越预设的安全临界点,迫使公司决定暂停部分功能的推进。

核心能力触及安全红线,触发内部审查机制

8月7日,该公司披露,在对Astra进行初步评估时发现,该模型在无需人类干预的情况下,已具备独立识别并构造针对强化系统的真实零日漏洞的能力;同时,能基于抽象目标自主设计并实施新型网络攻击路径。这些表现使其被判定为极有可能跨入《准备框架》所定义的“关键”级别——此前所有公开模型均处于较低的“高”层级。

全面部署强化防护措施,限制高风险行为

为应对潜在威胁,OpenAI已全面冻结所有未符合新安全标准的Astra相关活动。具体包括:建立隔离式测试环境、严格控制外部网络接入权限、提升模型权重加密强度,并扩大实时监控覆盖范围。此外,所有代理应用(含训练与评测环节)均已启用通用思维链推理追踪系统,一旦检测到异常高危行为,将自动中断执行流程。

联合多方开展独立验证,发布时间尚无定论

目前,OpenAI正协同政府机构及外部AI安全组织,对Astra的能力展开第三方评估。尽管尚未公布正式发布计划,但据Axios消息,此次暂停可能导致后续发布延期。这一举措也被视为行业罕见的前瞻性自我约束。

明确划清界限:非源于外部平台事件

OpenAI特别强调,此次决策与上月Hugging Face遭遇的沙盒代理越界事件无关。尽管两起事件均涉及模型越权行为,但前者系外部研究人员发现并披露,而本次是内部红队测试主动识别并报告的结果。公司指出,当前媒体常将各类AI安全问题归因于单一模型,此举旨在避免误读,厘清责任边界。

透明化披露凸显战略转向信号

这是首个由头部AI实验室主动宣布因模型自身安全风险而放缓开发的案例,而非响应外界压力。OpenAI表示,面对激烈的市场竞争和产品迭代压力,仍选择公开此类信息,意在维护公众信任与研究社区协作基础。这一姿态在当下尤为罕见。

行业风向转变:防御与攻击能力同步进化

就在数周前,微软推出专攻网络安全的MAI-Cyber-1-Flash模型,聚焦快速发现并修复漏洞。两者形成鲜明对照:一边是强化防御,一边是预警攻击潜能。这反映出一个深层趋势——当前人工智能在网络安全领域的双重角色已趋于成熟,既能守护系统,亦可成为进攻武器。

免责声明:本文所有内容均来源于第三方平台,所有内容不作任何类型的保证,不构成任何投资、不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。