Anthropic 评测称智谱 GLM-5.3 的漏洞利用开发能力接近 Claude Mythos Preview
Anthropic 的评测显示,智谱开放权重模型 GLM-5.3 的漏洞利用开发能力接近 Claude Mythos Preview,但安全防护容易被绕过。ExploitBench 的 410 次尝试中,两者分别构建了 50 和 56 个有效漏洞利用;内部二进制漏洞利用测试中,完全控制目标程序的任务占比分别为 4% 和 6%。
推荐理由:同一漏洞利用基准下的直接对照,让开放权重模型与受限模型的能力差距更具体,也将攻击能力与拒绝机制的有效性区分开来。