
更强的编程能力。GLM-5.3 是编程能力最强的开源模型,在内部自建体感评测中较 GLM-5.2 提升 50%,在包括 Terminal Bench 3.0、Agents' Last Exam (CLI) 在内的公开基准测试中取得开源第一。
网络安全能力。在白盒代码审查与漏洞发现等安全任务中,GLM-5.3 的表现持平 Mythos 5,展现出面向网络安全防御场景的强大潜力。
后训练 Scaling。上述全部提升都来自后训练。基于 IndexShare、SAO、以及持续演进的新一代 Slime 框架,智谱在与 GLM-5.2 完全相同基座上高效推进强化学习,可能智谱还远未开发出这个基座的智能上界。
开源。智谱将在发布两周后开放模型权重,此前完成安全评估与模型加固。
在衡量模型于真实终端环境中完成复杂任务的 Terminal-Bench 3.0 上,GLM-5.3 得分从 4.6 提升至 28.3;
在聚焦长程软件工程与持续代码修改能力的 DeepSWE v1.1 上,得分从 46.2 提升至 66.9;
在覆盖多类真实专业场景、强调跨工具协作与长程任务的 Agents' Last Exam 上,得分从 23.8 提升至 28.5;
在覆盖 44 种职业、考察真实高价值知识工作的 GDPval-AA v2 中得分 1,769,展现基于编程能力涌现的专业任务执行能力。


