如意小报
版块首页原文 ↗
科技 · 新闻详情

智谱正式发布GLM-5.3:编程能力最强开源模型

软件 · 搜狐 · 搜狐科技 · 2026-08-14 · 重磅值 86.06
真正值得关注的不是搜狐这一条动作本身,而是它可能把「软件」的竞争焦点推向更大范围的连锁反应。
发生了什么:在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3; 在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上…
为什么重要:它提示了一个值得继续跟踪的变化方向。
观察窗口:接下来观察它是否会引发更多同类动作,以及影响范围能否扩大。
正文来源:原文正文机器翻译
原文链接:https://www.sohu.com/a/1062768036_114760

IT之家 8 月 14 日消息,智谱今日正式发布 GLM-5.3 ,与 GLM-5.2 相比,基座模型没变,但通过后训练 Scaling 大大提高了模型的智能上界:数十倍的长程任务环境、更丰富多样的环境类型、超长的后训练时间。

更强的编程能力 。GLM-5.3 是编程能力最强的开源模型,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中取得开源第一。

网络安全能力 。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。

后训练 Scaling 。上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同基座上高效推进强化学习,可能智谱还远未开发出这个基座的智能上界。

在多项主流基准测试中 GLM-5.3 是当前排名最高的开源模型, 编程与智能体能力接近 Claude Fable 5 ,编程体感超过其他国产模型。

在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1,769,展现基于编程能力涌现的专业任务执行能力。

即日起上线智谱官方编程工具 ZCode、效率工具 AutoClaw,上线 GLM Coding Plan 全量用户及开放订阅。

TraeWork / TraeCode / 扣子、WorkBuddy / CodeBuddy、Qoder / QwenWork、CatPaw、JoyCode、OpenCode 等编码平台开放抢先体验。

API 很快上线, 完整模型权重将在两周内开源 ,此前需完成必要的安全加固,尽可能限制其潜在攻击能力,保留其防御价值。

机器翻译/自动整理可能存在误差,请以原文为准。

继续阅读

正在加载推荐…