找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

4201

积分

0

好友

553

主题
发表于 1 小时前 | 查看: 4| 回复: 0

DeepSeek V4 Flash 正式版刚刚进入公众视野,一场围绕模型安全边界的讨论便迅速升温。

社交媒体截图:DeepSeek V4 Flash 越狱测试帖子

8 月 1 日,X 平台用户 @Exocjia 发布截图称,通过一组精心设计的提示词,DeepSeek V4 Flash 输出了原本应当拒绝提供的高风险内容,涉及违禁药物、勒索软件及信息窃取程序等领域。

DeepSeek V4 Flash 越狱事件概览图

相关帖子很快获得数千次点赞和收藏。不少人将其视为模型遭到 “越狱” 的证据,也有人质疑:单次截图能否证明模型存在普遍性的安全缺陷?

新模型更新后被曝“越狱”

DeepSeek V4 系列于 2026 年 4 月推出预览版,包含 V4‑Pro 与 V4‑Flash 两个版本。7 月 31 日,V4‑Flash 正式版 API 开放公测。

DeepSeek 官网 V4‑Flash API 公测公告

官方资料显示,V4‑Flash 采用混合专家架构,总参数量 2840 亿,每次推理激活约 130 亿参数,支持 100 万 Token 上下文。与侧重综合能力的 V4‑Pro 不同,V4‑Flash 更强调响应速度、运行效率和使用成本。

此次更新未改动架构与参数规模,而是通过新一轮后训练重点提升代码代理与工具调用能力。DeepSeek 公布的测试结果表明,模型在 Terminal Bench、NL2Repo 和 Cybergym 等任务上的表现均有明显提高。

能力增强意味着安全压力同步上升。过去的大模型主要负责回答问题,即便输出错误内容,影响也多停留在对话窗口内。而现在,具备 Agent 能力 的模型可以调用工具、编写代码并连续执行多步任务——安全机制一旦被绕过,风险就可能从 “不当回答” 升级为真实操作。

“时间错位”绕过安全限制

所谓模型 “越狱”,是指通过精心设计的提示词、角色设定或虚构情境,绕过模型内置的安全限制,诱导其生成通常会拒绝提供的内容。

模型生成的 MDMA 合成手册片段

模型生成的 C++ 勒索软件构建手册

此次测试采用了一种 “时间错位” 的思路:先将时间设定在 2135 年,再把相关请求包装成对 2026 年旧资料的查阅,要求模型提供 “真实、准确” 的内容。通过将现实敏感请求伪装为历史研究,测试者试图降低模型的警惕性,突破原有的拒绝机制。

这类技巧并不新鲜。面对直接的危险请求,大模型通常能识别并拒绝;但同样的意图一旦包裹在学术研究、故事创作、历史档案或虚拟角色等语境中,模型有时会错误判断请求的性质。这暴露出当前安全对齐的一大难题:模型不仅要识别敏感词,还要理解隐藏在复杂叙述背后的真实意图。若防护只停留在表面表达,攻击者就可以通过改写语境、拆分任务或延长上下文,逐步绕开限制。

开源放大了安全争议

DeepSeek V4 Flash 采用 MIT 许可证 开放权重,开发者可以下载模型在本地部署,也可以进行量化、微调和二次开发。

模型生成的 Python 信息窃取器代码

这种开放模式降低了使用门槛,让更多团队能够研究架构、改进推理效率并开发垂直应用。但与此同时,公开权重也意味着模型的安全机制更容易被测试和修改。

闭源模型由服务商统一控制,除模型自身的安全训练外,还可以在接口层叠加内容审核、调用限制与异常监控。而开源模型一旦本地部署,这些外围防线是否存在、执行到什么程度,很大程度上取决于部署者。社区中甚至出现了主动削弱或移除安全限制的模型版本。此时,风险已不再只是 “原始模型能否被 越狱 ”,而是模型被下载、修改并重新发布后,谁来为其实际用途负责。

不过,开源本身并不是安全问题的根源。开放权重也能让更多研究人员参与测试,更快发现缺陷并推动修复。真正需要解决的,是如何让开放研究、安全披露与风险控制形成配套机制,而不是把 “开源” 与 “不安全” 简单画等号。

一次成功不等于全面失守

社交平台上的越狱截图很容易引发关注,但判断模型是否安全,不能只看一次成功演示。

  1. 大模型输出具有随机性。同一提示在不同参数、版本和运行环境下,结果可能完全不同。  
  2. 模型安全需要通过可重复、成规模的测试来评估。除了攻击是否成功,还要观察成功率、拒绝稳定性、输出内容的危害程度,以及增加防护措施后能否有效拦截。  
  3. 官方 API 与本地部署版本并不等同。API 服务通常叠加平台侧的审核和风控机制,本地模型则主要依赖部署者自行设置权限、过滤规则和使用边界。

因此,这次事件更适合看作一次安全预警:模型能力和安全能力并不会自然同步增长。尤其当模型开始调用工具、编写代码并执行任务时,安全测试不仅要关注它 “说了什么”,还要评估它 “能够做什么”。

安全不能只交给模型自己

对于企业而言,部署开源大模型时不能只盯着参数、速度和成本,还应建立独立于模型之外的安全控制。

涉及代码执行、文件读写、外部连接和敏感数据处理的任务,应限制工具权限与访问范围;高风险操作需要人工确认;模型输入与输出应经过检测,并保留完整审计记录。普通用户在分享越狱测试结果时,也应避免公开危险内容、完整提示词和可直接复现的操作步骤。安全研究的价值在于发现问题、推动修复,而不是降低滥用门槛。

DeepSeek V4 Flash 在长上下文、推理效率和 Agent 能力方面展现了开源模型的进步,但越强大的模型,越需要清晰的使用边界。这场讨论的重点并不是证明某个模型 “彻底失守”,而是再次提醒行业:开放与安全并非二选一。真正成熟的开源生态,既要让技术可以被研究和使用,也要让风险能够被发现、披露和治理。模型能力可以快速迭代,安全体系却不能只靠一次训练解决。随着 AI 从内容生成走向任务执行,模型厂商、部署者和社区都需要承担起各自的责任。只有能力提升与安全治理同步推进,开源大模型才能真正走得更远。

参考来源:新发布的 DeepSeek V4 Flash 被“越狱”:开源模型安全与社区讨论的最新一幕

云栈社区将持续跟踪大模型安全动态。




上一篇:IT外包遇上印度甲方:试用MVP不给钱,白嫖套路还是商业惯例
下一篇:Coldcard硬件钱包RNG漏洞:1367枚BTC失窃,损失约8860万美元
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-4 06:07 , Processed in 1.064633 second(s), 41 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表