跳到正文

#安全/对齐

今日 2 条
今天9月30日周三
  1. The Verge · AI44

    Palisade Research 发布 AI 研究员访谈视频,警告超级智能“正如听起来那样危险”

    Palisade Research 发布 AI 研究员访谈视频,多名受访者警告超级智能可能导致人类灭绝。受访者包括 OpenAI、Google 和 Anthropic 的现任及前员工,但未提出统一的应对方案。完整视频及按主题汇编的片段已在 frominside.ai 上线,涵盖风险是否属于炒作、研究员为何继续参与相关工作等问题。

9月29日周二
  1. Hugging Face Blog49

    不只核对事实,还要核对来源:ProvenanceGuard 对 MCP 智能体的来源感知核验

    ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。

9月22日周二
  1. NVIDIA Blog37

    为什么规模化部署物理 AI 需要每一层的安全保障:NVIDIA Halos 的全栈方案

    NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。

6月10日周三