Dazzle 实测:Marissa Mayer 押注相册比收件箱更了解你的生活
Marissa Mayer 的个人 AI 助手 Dazzle 仅从手机相册获取用户背景,TechCrunch 实测发现其建议有个性化特点,但也存在信息遗漏。用户可通过应用或短信与它交互,让它从活动传单中提取信息填入日历,或根据照片历史推荐旅行目的地和生日礼物。测试中,它根据过往旅行推荐了地中海目的地,却也推荐了作者去过的西西里岛,并未能记住作者的女儿已经会滑旱冰。
Marissa Mayer 的个人 AI 助手 Dazzle 仅从手机相册获取用户背景,TechCrunch 实测发现其建议有个性化特点,但也存在信息遗漏。用户可通过应用或短信与它交互,让它从活动传单中提取信息填入日历,或根据照片历史推荐旅行目的地和生日礼物。测试中,它根据过往旅行推荐了地中海目的地,却也推荐了作者去过的西西里岛,并未能记住作者的女儿已经会滑旱冰。
Anthropic 前沿红队评测发现,GLM-5.3 在内部二进制漏洞利用基准测试中实现完整控制流劫持的成功率为 4%。评测随机选取 100 项任务,Claude Mythos Preview 成功率为 6%,Claude Opus 4.6 和 GLM-5.2 均未成功。
Basis 使用 GPT-6 Astra 完成含 50 个标签页的税务工作簿,速度是 GPT-5.6 Sol 的 2 倍。GPT-6 Astra 对用户意图的理解能力更强,让 Basis 对其实际应用更有信心。
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
Hugging Face 实测 tokenizers v1 候选版,在 Apple M4 Max 上覆盖的 10 个模型家族中,单线程编码比 v0.23 快 3 至 30 倍,保持相同 token ID 输出。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中取得领先性能。其 Qwen3-VL 和 DeepSeek-R1 测试吞吐量分别最高达到 GB300 NVL72 的 3.7x 和 2.5x。
ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成能力,在 AppWorld 测试中将 GPT-4.1 智能体的一致性差距从 24.4pp 缩小至 12.0pp。
推荐理由:通过区分平均成功率与多次运行全部成功的任务比例,这篇材料提供了衡量智能体重复执行可靠性的具体方法。
BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Google DeepMind 推出全球首次针对闭源前沿 AI 模型的双盲评测试点,在加密安全环境中测试 Gemini Flash Lite。试点联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,使用保密基准,防止测试内容被模型用于后续测试前的性能优化,提高评测可信度。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。