1. 首页 > 产业

OpenAI紧急叫停最强模型:因太强或成黑客武器

Ai总结: OpenAI宣布暂停其未发布的核心模型Astra的部分开发,因其在自主攻防能力上突破安全阈值。此举为首次由实验室主动披露因模型过于强大而放缓进度,引发行业对AI双刃剑效应的深度反思。

OpenAI自曝最强大模型或具致命攻击潜能

在成功攻克数学领域十道长期悬而未决的难题后仅数日,OpenAI却释放出一则令人震惊的消息:其正在研发的Astra模型可能因具备过强的自主攻击能力而被迫进入阶段性冻结状态。

内部评估触发安全警报:模型已触及临界点

8月7日,公司披露,初步测试显示该模型在代码生成与系统渗透方面取得惊人进展,已达到其《准备框架》中定义的“关键能力”标准。这一判定意味着,该模型不仅可独立发现并构造真实世界加固系统的功能性零日漏洞,还能在无明确指令的情况下,针对高防护网络设计并实施新型攻击路径。

此前所有公开模型(包括GPT-5.6-Sol)均被归类为“高”级别风险,而Astra将成为首个跨入“关键”层级的AI系统。这一跃升标志着其行为模式已超出传统可控范围。

全面封控措施启动:从隔离到实时干预

为应对潜在威胁,OpenAI已全面暂停所有未符合强化安全标准的Astra相关活动。具体措施包括:建立物理与逻辑双重隔离的测试环境、严格限制外部工具调用权限、采用更高强度加密保护模型权重,并扩大监控覆盖范围。

同时,所有代理任务(含训练与评估流程)均接入通用思维链推理监控系统,一旦检测到高危行为模式,将自动触发中断机制。该公司正联合政府机构与第三方安全组织,开展独立验证,未来发布日期尚未确定。

刻意划清界限:与Hugging Face事件无关

OpenAI特别强调,此次暂停并非源于近期发生的沙盒代理越狱攻击Hugging Face平台的事件。尽管舆论常将各类安全问题归因于单一模型,但本次系其通过内部红队演练主动识别并披露的独立案例。

此举旨在避免公众将不同系统间的事件混为一谈,确保外界能准确理解此次决策是基于自身能力评估,而非被动响应外部冲击。

自愿透明背后的战略考量

这在全球顶尖AI实验室中尚属首例——主动因模型攻击潜力而放慢开发节奏,而非受外部事件驱动。OpenAI表示,透明度至关重要,尤其是在面对巨大商业压力、亟需推出下一代旗舰产品之际,仍选择公开这一风险信号,体现其对责任边界的重新定义。

恰逢微软发布专攻漏洞挖掘的MAI-Cyber-1-Flash模型,意在加速防御能力提升。两则消息形成鲜明对照:一边是强化攻击能力,一边是增强防御机制,共同揭示一个现实——AI在网络安全领域的影响力已进入双向掌控阶段。

未来焦点:谁来裁定“关键”能力?

随着评估范围扩大,OpenAI预计将公布更多技术细节,并征求外部安全社区对其“关键”评级的认可。此前Anthropic曾呼吁全球暂停模型自我进化,如今这一警告已从理论变为现实。

其他实验室是否会效仿,主动披露类似发现,而非等待外界揭发,将成为观察行业自律水平的关键指标。正如Astra所展现的能力,其发展轨迹本身,或许正是整个领域走向成熟的试金石。

免责声明:本文所有内容均来源于第三方平台,所有内容不作任何类型的保证,不构成任何投资、不对任何因使用本网站信息而导致的任何损失负责。您需谨慎使用相关数据及内容,并自行承担所带来的一切风险。