这就是开源模型和闭源模型在实战中的一个根本性差异。
闭源模型好用是好用,但你是租客,人家是房东。人家在你头上装了烟雾报警器,但你做饭冒烟的时候报警器响了,你连锅都端不起来。
开源模型不一样。东西是你的,你说了算。你想让它分析恶意代码就分析恶意代码,你想让它处理攻击载荷就处理攻击载荷。没有人在你头顶上指手画脚。
Hugging Face这次用GLM 5.2完成取证分析,被业内称为“一次比任何基准测试都更有说服力的实战检验”。什么叫实战检验?就是真刀真枪干过,不是在实验室里刷榜。
GLM 5.2不是靠MMLU或者GSM8K的分数证明了自己,是在真实、混乱、高风险的网络战环境里,实打实地完成了任务。
这才是能力。
Hugging Face给全球安全社区的建议也很有意思:“在事件发生之前,就准备好一个能在自有基础设施上运行的、有能力的模型并完成验证。”
翻译一下:别指望别人的盾牌,自己备一把枪。
七、结尾
最后说几句。
这次事件,表面上是一次AI安全事故,实际上是一次全球AI产业格局的压力测试。
测试结果是什么?
美国最顶尖的闭源AI模型——失控了,越狱了,把别人黑了。