找回密码
立即注册
搜索
热搜: Java Python Linux Go
发回帖 发新帖

5421

积分

0

好友

762

主题
发表于 半小时前 | 查看: 3| 回复: 0

8 月 14 日,智谱 AI 正式发布 GLM‑5.3。这一版没有更换底层基座,而是把重点放在后训练 Scaling 上:扩大长程任务训练规模、丰富环境样本、延长后训练周期,最终在编程、智能体执行和网络安全等方向都获得明显提升。官方称其为现阶段编程能力最强的开源大模型。

核心能力亮点

编程能力大幅增强

GLM‑5.3 相比 GLM‑5.2 的编程体感提升约 50%,并在多个公开基准测试中登顶开源模型:

  • Terminal Bench 3.0(终端复杂任务):得分从 4.6 暴涨至 28.3,真实终端环境下的任务处理能力实现跨越式增长。
  • DeepSWE v1.1(长周期软件工程迭代):分数从 46.2 提升至 66.9,更擅长持续修改与迭代大型代码项目。
  • Agents' Last Exam:得分 28.5,多工具协同和长链路专业任务表现进一步增强。
  • GDPval‑AA v2 职业能力评测:拿到 1769 高分,编程能力直接带动高价值职业任务的执行效果。

智谱自研的 Z.ai Code Bench 更贴近开发者真实使用 Agent 编码的场景,直接在复杂本地开发环境中做端到端实测。

GLM‑5.3 同时兼顾效果和 Token 消耗效率。其 High 思考档位准确率为 31.4%,超过 Claude Opus 4.8 最高档位的 29.5%;平均输出约 5 万 Token,而对方需要约 12 万 Token,用更少输出来完成编码任务。

整体编程与 Agent 综合实力已逼近 Claude Fable 5,实际编码表现也优于多数国产同类模型。

🛡️ 网络安全防御能力显现

在白盒代码审计、漏洞挖掘等安全场景中,GLM‑5.3 的性能可以对标 Mythos 5,具备不错的网络安全防御落地潜力,能辅助安全工程师完成代码审查、漏洞研判等工作。

GLM-5.3与GLM-5.2、Kimi K3、Mythos 5、GPT-5.6 Sol在CyberGym、ExploitBench、ExploitGym安全评测中的得分对比

全部增益来自后训练调优

基座没换,提升从哪里来?答案很直接:全部来自后训练。

值得留意的是,GLM‑5.3 与 GLM‑5.2 使用的是完全相同的基座模型。所有增益都来自 IndexShare、SAO 以及新一代 Slime 强化学习框架支撑的后训练缩放。官方认为,这套基座仍有进一步挖掘性能的空间。

GLM-5.3性能提升动态对比示意图

产品上线与开源计划

  • 工具端:官方编程工具 ZCode、自动化效率工具 AutoClaw 已上线,GLM Coding Plan 订阅面向全部用户开放;TraeCode、扣子、CodeBuddy 等第三方编码平台开启抢先体验。8 月 14 日 13 点,GLM Coding Plan 全部用户的使用额度已完成重置。
  • API 接口:即将对外开放。
  • 权重开源:完成安全评估与模型加固后,两周后开放模型权重。官方会约束模型潜在的进攻能力,同时保留安全防御相关能力。

资讯来源:智谱AI官方




上一篇:PageIndex 无向量 RAG 架构详解:基于推理的检索替代方案
下一篇:GaussDB 506子查询UPDATE触发Coredump根因分析
您需要登录后才可以回帖 登录 | 立即注册

手机版|小黑屋|网站地图|云栈社区 ( 苏ICP备2022046150号-2 )

GMT+8, 2026-8-17 03:56 , Processed in 0.876851 second(s), 39 queries , Gzip On.

Powered by Discuz! X3.5

© 2025-2026 云栈社区.

快速回复 返回顶部 返回列表