离谱。昨晚 OpenAI 刚宣布企业套餐里加入 GLM 5.3 等开源模型,Anthropic 立刻发了一份报告,严肃批评开源模型的安全问题。
不过这份报告信息量不大,看完之后也是满脸问号。
报告先给 GLM 5.3 下定义:它是“迄今发布的网络安全能力最强的开源模型”,但比美国前沿模型落后约 4 个月。他们测试了 Opus 4.6、Kimi K3、DeepSeek Flash 等几个模型,结论是 GLM 5.3 是唯一具备漏洞利用能力的模型。
接着又提到,GLM 5.3 本身其实带安全护栏。但问题在于它开源:任何人都可以用一种叫 abliteration 的拒绝行为削减技术重新配置模型,专门移除拒绝行为,训练出不安全的 GLM 5.3 版本,成本大约 4400 美元。简单说,开源模型天然可以改权重,所以“都不安全”。他们对这个移除拒绝行为的模型做了评测,发现确实很不安全。
即便是原版带安全护栏的 GLM 5.3,也可以通过欺骗性提示词、预填充思考等方式,诱导它参与危险任务。反观 Claude,既不开放预填充思考,也不开源,没法用 abliteration 处理,所以“非常安全”。
报告最后呼吁,让更多企业和机构用上安全的闭源模型刻不容缓。
但这份报告看起来是在聊模型安全,实际上多少带点自我推销的意思。开源模型本来有安全护栏,你却先通过训练把护栏拆了,再反过来证明开源模型不安全,这逻辑说得通吗?
如果真觉得开源模型不安全,大可以开源一个安全版本给大家用;也可以积极参与开源模型的安全建设,一起做点实事;再不然就把自己的模型开放给全世界,少搞天天封号这套。卖模型没问题,但别一边卖一边抢占道德高地。
如果你也关注这些模型安全话题,欢迎到 云栈社区 和开发者们一起交流。顺便说一句,国庆假期到了,祝大家假期愉快,多出门感受世界,和线下的朋友保持连接。
|