跳到正文

#评测/基准

今日 2 条
今天9月30日周三
  1. The Decoder76

    Anthropic 评测称智谱 GLM-5.3 的漏洞利用开发能力接近 Claude Mythos Preview

    Anthropic 的评测显示,智谱开放权重模型 GLM-5.3 的漏洞利用开发能力接近 Claude Mythos Preview,但安全防护容易被绕过。ExploitBench 的 410 次尝试中,两者分别构建了 50 和 56 个有效漏洞利用;内部二进制漏洞利用测试中,完全控制目标程序的任务占比分别为 4% 和 6%。

    推荐理由:同一漏洞利用基准下的直接对照,让开放权重模型与受限模型的能力差距更具体,也将攻击能力与拒绝机制的有效性区分开来。

9月28日周一
9月23日周三
9月22日周二
7月16日周四