跳到正文

#评测/基准

今日 2 条
今天9月30日周三
  1. TechCrunch · AI59

    Dazzle 实测:Marissa Mayer 押注相册比收件箱更了解你的生活

    Marissa Mayer 的个人 AI 助手 Dazzle 仅从手机相册获取用户背景,TechCrunch 实测发现其建议有个性化特点,但也存在信息遗漏。用户可通过应用或短信与它交互,让它从活动传单中提取信息填入日历,或根据照片历史推荐旅行目的地和生日礼物。测试中,它根据过往旅行推荐了地中海目的地,却也推荐了作者去过的西西里岛,并未能记住作者的女儿已经会滑旱冰。

9月28日周一
9月22日周二
9月21日周一
9月16日周三
9月2日周三
  1. Hugging Face Blog58

    BenchMIRT 研究:LLM 基准究竟在衡量什么?

    BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。

8月28日周五
8月27日周四
  1. Google DeepMind49

    Google DeepMind 试点全球首次双盲 AI 评测

    Google DeepMind 推出全球首次针对闭源前沿 AI 模型的双盲评测试点,在加密安全环境中测试 Gemini Flash Lite。试点联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,使用保密基准,防止测试内容被模型用于后续测试前的性能优化,提高评测可信度。

8月12日周三
  1. Google Research71

    Google Research 研究:回忆而非知识编码是大语言模型参数化事实性的瓶颈

    Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。

    推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。