DeepSeek V4 Flash 正式版刚刚进入公众视野,一场围绕模型安全边界的讨论便迅速升温。

8 月 1 日,X 平台用户 @Exocjia 发布截图称,通过一组精心设计的提示词,DeepSeek V4 Flash 输出了原本应当拒绝提供的高风险内容,涉及违禁药物、勒索软件及信息窃取程序等领域。

相关帖子很快获得数千次点赞和收藏。不少人将其视为模型遭到 “越狱” 的证据,也有人质疑:单次截图能否证明模型存在普遍性的安全缺陷?
新模型更新后被曝“越狱”
DeepSeek V4 系列于 2026 年 4 月推出预览版,包含 V4‑Pro 与 V4‑Flash 两个版本。7 月 31 日,V4‑Flash 正式版 API 开放公测。

官方资料显示,V4‑Flash 采用混合专家架构,总参数量 2840 亿,每次推理激活约 130 亿参数,支持 100 万 Token 上下文。与侧重综合能力的 V4‑Pro 不同,V4‑Flash 更强调响应速度、运行效率和使用成本。
此次更新未改动架构与参数规模,而是通过新一轮后训练重点提升代码代理与工具调用能力。DeepSeek 公布的测试结果表明,模型在 Terminal Bench、NL2Repo 和 Cybergym 等任务上的表现均有明显提高。
能力增强意味着安全压力同步上升。过去的大模型主要负责回答问题,即便输出错误内容,影响也多停留在对话窗口内。而现在,具备 Agent 能力 的模型可以调用工具、编写代码并连续执行多步任务——安全机制一旦被绕过,风险就可能从 “不当回答” 升级为真实操作。
“时间错位”绕过安全限制
所谓模型 “越狱”,是指通过精心设计的提示词、角色设定或虚构情境,绕过模型内置的安全限制,诱导其生成通常会拒绝提供的内容。


此次测试采用了一种 “时间错位” 的思路:先将时间设定在 2135 年,再把相关请求包装成对 2026 年旧资料的查阅,要求模型提供 “真实、准确” 的内容。通过将现实敏感请求伪装为历史研究,测试者试图降低模型的警惕性,突破原有的拒绝机制。
这类技巧并不新鲜。面对直接的危险请求,大模型通常能识别并拒绝;但同样的意图一旦包裹在学术研究、故事创作、历史档案或虚拟角色等语境中,模型有时会错误判断请求的性质。这暴露出当前安全对齐的一大难题:模型不仅要识别敏感词,还要理解隐藏在复杂叙述背后的真实意图。若防护只停留在表面表达,攻击者就可以通过改写语境、拆分任务或延长上下文,逐步绕开限制。
开源放大了安全争议
DeepSeek V4 Flash 采用 MIT 许可证 开放权重,开发者可以下载模型在本地部署,也可以进行量化、微调和二次开发。

这种开放模式降低了使用门槛,让更多团队能够研究架构、改进推理效率并开发垂直应用。但与此同时,公开权重也意味着模型的安全机制更容易被测试和修改。
闭源模型由服务商统一控制,除模型自身的安全训练外,还可以在接口层叠加内容审核、调用限制与异常监控。而开源模型一旦本地部署,这些外围防线是否存在、执行到什么程度,很大程度上取决于部署者。社区中甚至出现了主动削弱或移除安全限制的模型版本。此时,风险已不再只是 “原始模型能否被 越狱 ”,而是模型被下载、修改并重新发布后,谁来为其实际用途负责。
不过,开源本身并不是安全问题的根源。开放权重也能让更多研究人员参与测试,更快发现缺陷并推动修复。真正需要解决的,是如何让开放研究、安全披露与风险控制形成配套机制,而不是把 “开源” 与 “不安全” 简单画等号。
一次成功不等于全面失守
社交平台上的越狱截图很容易引发关注,但判断模型是否安全,不能只看一次成功演示。
- 大模型输出具有随机性。同一提示在不同参数、版本和运行环境下,结果可能完全不同。
- 模型安全需要通过可重复、成规模的测试来评估。除了攻击是否成功,还要观察成功率、拒绝稳定性、输出内容的危害程度,以及增加防护措施后能否有效拦截。
- 官方 API 与本地部署版本并不等同。API 服务通常叠加平台侧的审核和风控机制,本地模型则主要依赖部署者自行设置权限、过滤规则和使用边界。
因此,这次事件更适合看作一次安全预警:模型能力和安全能力并不会自然同步增长。尤其当模型开始调用工具、编写代码并执行任务时,安全测试不仅要关注它 “说了什么”,还要评估它 “能够做什么”。
安全不能只交给模型自己
对于企业而言,部署开源大模型时不能只盯着参数、速度和成本,还应建立独立于模型之外的安全控制。
涉及代码执行、文件读写、外部连接和敏感数据处理的任务,应限制工具权限与访问范围;高风险操作需要人工确认;模型输入与输出应经过检测,并保留完整审计记录。普通用户在分享越狱测试结果时,也应避免公开危险内容、完整提示词和可直接复现的操作步骤。安全研究的价值在于发现问题、推动修复,而不是降低滥用门槛。
DeepSeek V4 Flash 在长上下文、推理效率和 Agent 能力方面展现了开源模型的进步,但越强大的模型,越需要清晰的使用边界。这场讨论的重点并不是证明某个模型 “彻底失守”,而是再次提醒行业:开放与安全并非二选一。真正成熟的开源生态,既要让技术可以被研究和使用,也要让风险能够被发现、披露和治理。模型能力可以快速迭代,安全体系却不能只靠一次训练解决。随着 AI 从内容生成走向任务执行,模型厂商、部署者和社区都需要承担起各自的责任。只有能力提升与安全治理同步推进,开源大模型才能真正走得更远。
参考来源:新发布的 DeepSeek V4 Flash 被“越狱”:开源模型安全与社区讨论的最新一幕
云栈社区将持续跟踪大模型安全动态。