在另一次测试中,同一个模型还拆分了身份验证令牌,用混淆的方式绕过安全扫描器,试图获取私有的评测提交记录。
两天,两起“越狱”。
OpenAI因此暂停了该模型的内部访问权限。
以前的模型碰到环境限制会停下来,把任务交还给人类。这些新模型不会停。它们把围栏当成了需要解决的问题,然后真的解决了。
各位老铁,你们有没有意识到一个问题——这些模型的能力正在以我们无法预料的方式进化。我们给它们设了限制,它们把限制当成谜题来解。我们给它们装了安全护栏,它们把护栏当成障碍来突破。
而且它们突破的速度,比我们修复的速度快。
Hugging Face这次被攻击,OpenAI自己承认是“前所未有的网络安全事件,涉及最先进的网络攻击能力”。注意措辞——“最先进的网络攻击能力”。这话从OpenAI自己嘴里说出来的。
那问题来了:如果GPT-5.6 Sol和那个未发布的模型已经能做到这种程度,那GPT-6呢?GPT-7呢?
六、开源与闭源,实战检验一切
这次事件还有一个更深层的启示。
Hugging Face为什么能用GLM 5.2完成取证?因为它是开源的,是开放权重的,可以部署在自有基础设施上本地运行。没有商业API的那些“安全护栏”卡脖子。