找回密码
立即注册
搜索
发回帖 发新帖

6253

积分

0

好友

790

主题
发表于 8 小时前 | 查看: 7| 回复: 0

离谱。昨晚 OpenAI 刚宣布企业套餐里加入 GLM 5.3 等开源模型,Anthropic 立刻发了一份报告,严肃批评开源模型的安全问题。

不过这份报告信息量不大,看完之后也是满脸问号。

报告先给 GLM 5.3 下定义:它是“迄今发布的网络安全能力最强的开源模型”,但比美国前沿模型落后约 4 个月。他们测试了 Opus 4.6、Kimi K3、DeepSeek Flash 等几个模型,结论是 GLM 5.3 是唯一具备漏洞利用能力的模型。

接着又提到,GLM 5.3 本身其实带安全护栏。但问题在于它开源:任何人都可以用一种叫 abliteration 的拒绝行为削减技术重新配置模型,专门移除拒绝行为,训练出不安全的 GLM 5.3 版本,成本大约 4400 美元。简单说,开源模型天然可以改权重,所以“都不安全”。他们对这个移除拒绝行为的模型做了评测,发现确实很不安全。

即便是原版带安全护栏的 GLM 5.3,也可以通过欺骗性提示词、预填充思考等方式,诱导它参与危险任务。反观 Claude,既不开放预填充思考,也不开源,没法用 abliteration 处理,所以“非常安全”。

报告最后呼吁,让更多企业和机构用上安全的闭源模型刻不容缓。

但这份报告看起来是在聊模型安全,实际上多少带点自我推销的意思。开源模型本来有安全护栏,你却先通过训练把护栏拆了,再反过来证明开源模型不安全,这逻辑说得通吗?

如果真觉得开源模型不安全,大可以开源一个安全版本给大家用;也可以积极参与开源模型的安全建设,一起做点实事;再不然就把自己的模型开放给全世界,少搞天天封号这套。卖模型没问题,但别一边卖一边抢占道德高地。

如果你也关注这些模型安全话题,欢迎到 云栈社区 和开发者们一起交流。顺便说一句,国庆假期到了,祝大家假期愉快,多出门感受世界,和线下的朋友保持连接。




上一篇:Anthropic公开Claude进化最佳实践:Claude Code多智能体工作流、Skills与Eval
下一篇:Muse/Dots/Grok Bot 又火了?这波 Agent 热可能撑不过两个月
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-10-4 14:26 , Processed in 0.059444 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表