不只核对事实,还要核对来源:ProvenanceGuard 对 MCP 智能体的来源感知核验
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
OpenAI 提出前沿 AI 训练安全论证的早期指南,涵盖技术防护措施、运营实践和不对齐事件调查。指南聚焦训练阶段的安全论证,仍处于早期阶段。
OpenAI 就涉及澳大利亚政府网站的事件致歉,并概述了更严格的防护措施及支持安排。相关措施和支持旨在加强澳大利亚的网络防御能力,原文未披露事件细节或具体实施方案。
OpenAI 阐明前沿模型及其防护措施的第三方 AI 安全评估优先事项与原则。评估强调严谨性、安全性和独立性。
NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。
OpenAI 概述了构建全球共享 AI 标准的路径,呼吁协调评估、报告与治理工作,以提升 AI 安全性。其重点是推动这些领域的协同,建立共同遵循的标准。
OpenAI 推出澳大利亚青少年安全蓝图,提出以六大支柱为框架的路线图。该路线图旨在打造更安全的 AI 体验,保护青少年并为其赋能。
OpenAI 的 $5 million 资助计划现已开放申请,支持生成式 AI 对青少年影响的独立研究。研究范围涵盖青少年发展、福祉与安全。
Google DeepMind 联合多家机构,面向全球研究者发起最高 $10M 的多智能体 AI 安全研究资助征集。资助聚焦沙盒与测试平台、智能体网络科学、智能体基础设施强化、监督与控制,旨在理解并缓解大规模智能体交互产生的群体风险。申请截止日期为 8 月 8 日。