跳到正文

#Google

今日 4 条
4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。

    推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。

4月9日周四
  1. Google Research50

    ConvApparel:衡量并缩小用户模拟器的真实性差距

    Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。

4月3日周五
  1. Google Research62

    Google Research 评估 25 个 LLM 的行为倾向与人类偏好对齐程度

    Google Research 提出行为倾向评估框架,对 25 个 LLM 的分析发现,模型既会偏离人类共识,也未充分体现意见分歧。研究将心理问卷转化为现实情境判断测试,每个情境收集 10 名标注者的行动偏好,并与模型回答分布比较;在人类意见分歧较大的情境中,所有受测模型均表现出系统性过度自信。模型自报倾向与情境中的建议行为也存在差异,例如自称低冲动性,却给出偏向冲动的建议。

    推荐理由:将心理问卷转化为情境判断测试,为区分模型自述倾向与实际建议行为提供了可迁移的评估路径,而不只依赖自报答案。

4月1日周三
3月29日周日
  1. Google DeepMind73

    Google DeepMind 探索 AI 时代的鼠标指针,将 Gemini 交互融入 Chrome 与 Googlebook

    Google DeepMind 展示由 Gemini 驱动的实验性 AI 指针,并将相关交互原则用于 Chrome 和 Googlebook。其设计结合指向位置、视觉与语义上下文及语音,让用户用“这个”“那个”等简短表达提出请求,实验演示可在 Google AI Studio 体验。

    推荐理由:将指向位置、视觉上下文与语音结合的交互设计,为减少用户在不同应用间搬运内容和编写详细提示词提供了具体思路。

3月25日周三
3月18日周三
  1. Google Research71

    Google Research 研究如何用机器学习改善乳腺癌筛查流程

    Google Research 与 NHS 合作的两项 AIMS 研究显示,AI 独立阅片可提高乳腺癌检出能力,参与双阅片流程后的表现不劣于传统流程。发表于 Nature Cancer 的研究中,独立 AI 的癌症检出率从每 1,000 名女性 7.54 例提高至 9.33 例;以 AI 担任第二阅片者的研究估计可减少 46% 的人工阅片次数及 36–44% 的阅片时间。

    推荐理由:两项研究区分了模型独立检出能力与人机协作后的实际表现,为评估医疗人工智能提供了兼顾工作量和仲裁误判的视角。

3月17日周二
  1. Google Research46

    Google Research 评测 LLM 回答超导研究问题的能力

    Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。

3月12日周四
  1. Google Research72

    Google 利用 AI 驱动的城市突发洪水预测保护城市

    Google 在 Flood Hub 推出城市突发洪水预测,利用 AI 方法提前最多 24 小时预测城市地区的突发洪水风险。系统使用 Gemini 从公开新闻报道中提取洪灾时间与地点,形成 Groundsource 数据集,并结合全球气象数据训练采用 LSTM 单元的 RNN 模型。

    推荐理由:利用新闻报道补足历史洪灾记录的做法,为缺乏传感器数据地区构建预警系统提供了参考,也呈现了数据覆盖对评估的限制。

  2. Google Research71

    Google Research 推出 Groundsource,利用 Gemini 将新闻转为洪灾历史数据

    Google Research 推出 Groundsource 方法,利用 Gemini 从新闻提取洪灾信息,并开放包含 2.6 million 条历史事件记录、覆盖超过 150 个国家的数据集。

    推荐理由:新闻记录可补充传统监测容易遗漏的局地短时洪灾,为历史数据稀缺地区的预测模型训练与验证提供另一类数据来源。

  3. Google Research68

    Google Research 探索 AMIE 对话式诊断 AI 在真实临床研究中的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 开展 AMIE 单中心前瞻性可行性研究,100 名成人患者在医生实时监督下完成诊前文字问诊,未触发安全停止。

    推荐理由:研究将诊前问诊置于医生实时监督的真实流程中,并区分可行性与临床疗效,为理解医疗对话系统的评估边界提供具体参照。