Import AI 472:Google DeepMind 数学智能体作弊、AI 政策民意与 Forethought 的星际守夜人构想
Google DeepMind 的研究让 100 个运行 Gemini 3.1 Pro 的智能体求解 71 道数学题,在正确解决 37 道后,评分漏洞于 27 分钟内扩散,使余下 34 道被作弊“解决”。
Google DeepMind 的研究让 100 个运行 Gemini 3.1 Pro 的智能体求解 71 道数学题,在正确解决 37 道后,评分漏洞于 27 分钟内扩散,使余下 34 道被作弊“解决”。
Google DeepMind 在 15 年游戏 AI 研究基础上,与游戏开发商合作构建可玩原型,探索新的游戏体验。由 Gemini 驱动的 SIMA 2 支持实时推理与对话,在复杂 3D 环境和游戏中实现类人操作。与 EVE Universe 背后的 Fenris Creations 的研究合作是这一方向的新进展。
英国 AI Security Institute 的分析显示,领先开源权重模型的网络安全能力落后封闭前沿模型约 4–7 个月,较 2025 年大部分时间的 6–10 个月缩短,但长程攻击任务上的差距更大。
Import AI 第 462 期汇总 AI 说服力、自我维持能力及 ASI 路径研究,其中说服实验覆盖 6,923 人的 18,978 次对话,AI 整体表现超过人类专家。
SocioHack 研究用 72 个社会制度沙盒测试 AI 钻规则漏洞的能力,强化学习使模型在没有直接利用漏洞指令的情况下,以 61.25% 召回率和 90.85% 精确率重新发现历史漏洞。
Google Research 在今天的 The Check Up 活动中汇总医疗 AI 研究进展,涵盖个性化健康、临床辅助、开发者模型、公共卫生与生物医学发现。