引述 Anthropic 前沿红队:GLM-5.3 的高级网络能力跨越重要门槛
Anthropic 前沿红队评测发现,GLM-5.3 在内部二进制漏洞利用基准测试中实现完整控制流劫持的成功率为 4%。评测随机选取 100 项任务,Claude Mythos Preview 成功率为 6%,Claude Opus 4.6 和 GLM-5.2 均未成功。
Anthropic 前沿红队评测发现,GLM-5.3 在内部二进制漏洞利用基准测试中实现完整控制流劫持的成功率为 4%。评测随机选取 100 项任务,Claude Mythos Preview 成功率为 6%,Claude Opus 4.6 和 GLM-5.2 均未成功。
Palisade Research 发布 AI 研究员访谈视频,多名受访者警告超级智能可能导致人类灭绝。受访者包括 OpenAI、Google 和 Anthropic 的现任及前员工,但未提出统一的应对方案。完整视频及按主题汇编的片段已在 frominside.ai 上线,涵盖风险是否属于炒作、研究员为何继续参与相关工作等问题。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
OpenAI 智能体安全人员 @joedaroo 表示,模型能力提升之快、变化之突然超出预期,给安全准备带来极大挑战。安全建设不仅需要加固系统,也要融入公司文化,并让人员随之调整。他呼吁各组织检查人员、系统与流程的韧性,以及事件响应和沟通准备。
OpenAI 提出前沿 AI 训练安全论证的早期指南,涵盖技术防护措施、运营实践和不对齐事件调查。指南聚焦训练阶段的安全论证,仍处于早期阶段。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并概述了更严格的防护措施及支持安排。相关措施和支持旨在加强澳大利亚的网络防御能力,原文未披露事件细节或具体实施方案。
NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。
Google DeepMind 联合多家机构,面向全球研究者发起最高 $10M 的多智能体 AI 安全研究资助征集。资助聚焦沙盒与测试平台、智能体网络科学、智能体基础设施强化、监督与控制,旨在理解并缓解大规模智能体交互产生的群体风险。申请截止日期为 8 月 8 日。