跳到正文

#Google

今日 4 条
6月10日周三
6月9日周二
  1. Google DeepMind83

    Gemini 3.5 Live Translate 实现流畅自然的语音翻译

    Google 发布音频模型 Gemini 3.5 Live Translate,支持自动识别 70+ 种语言并进行近实时语音到语音翻译。模型持续生成译音,保留说话者的语调、节奏和音高,官方称整个会话中仅落后说话者几秒,所有生成音频均带有 SynthID 水印。

    推荐理由:相较于等待说话结束再翻译的系统,连续生成译音的方式把上下文质量与跟随延迟的取舍带入实时跨语言沟通。

  2. Google DeepMind79

    Google DeepMind 发布 Gemma 4 12B:统一、无编码器的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。

    推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。

6月8日周一
6月5日周五
  1. Google Research70

    Google Research 探索用手机摄像头被动监测心脏健康

    Google Research 在 Nature 发表 PHRM 研究,利用面部解锁后的 8 秒前置摄像头视频,通过深度学习估算心率并汇总每日静息心率。在真实生活验证中,经置信度筛选后的心率平均绝对百分比误差为 6.09%,每日静息心率相对 Fitbit Charge 6 的平均绝对误差为 4.39 bpm,但较深肤色组的心率测量成功率较低。

    推荐理由:研究将真实生活场景中的误差与不同肤色的测量成功率分开呈现,为评估手机健康监测的准确性与覆盖差异提供了参考。

6月4日周四
5月29日周五
  1. Google Research61

    Google Research 回顾 I/O 2026:AI 科研工具、健康研究与智能体开发进展

    Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。

    推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。

5月28日周四
  1. Google Research47

    Google 通过零信任聚合实现隐私分析

    Google 将新密码学聚合协议与可信执行环境结合,用于隐私分析,确保仅获取匿名化的群体聚合结果。设备只需发送一次消息,无须为多轮交互持续在线,个人原始数据不会在任何服务器内存中暴露或重建。该方案已集成至 Google 的机密联邦分析系统,并通过硬件证明验证协议按预期执行。

5月22日周五
5月20日周三
  1. Google Research63

    Google ERA 研究发表于 Nature,支撑 Computational Discovery 科学计算工具

    Google 的科研工具 ERA 研究今天发表于 Nature,该工具利用 Gemini 编写和优化科学代码,在多个学科基准上达到专家水平。ERA 根据科学问题与成功指标检索文献、编写代码并评估结果,通过树搜索探索数千种方案;团队现有 8 篇稿件将其用于具体科学问题,包括提前最多 4 周预测美国各州呼吸道疾病住院人数。

    推荐理由:以科学问题和成功指标驱动文献检索、代码生成与实验评估的闭环,为将科研代码优化方法迁移到不同学科提供了具体参考。

5月19日周二
5月18日周一
  1. Google DeepMind66

    Project Genie 结合 Street View 模拟真实地点,并扩大全球订阅用户访问范围

    Google DeepMind 为 Project Genie 新增 Street View 功能,让用户以真实地点影像为起点创建可交互世界。该功能由 Maps Imagery Grounding 支持,目前可选择美国境内地点,并搭配场景风格与角色描述生成环境,未来计划扩展地点覆盖范围。

    推荐理由:以街景影像约束生成世界的起始位置,为理解世界模型如何连接真实地点与可交互虚拟环境提供了具体案例。

5月17日周日
5月16日周六
  1. Google DeepMind68

    Co-Scientist 辅助寻找可用于治疗肝纤维化的既有药物

    斯坦福大学医学院 Gary Peltz 团队利用 Co-Scientist 筛选肝纤维化候选药物,其推荐的 3 种药物中有 2 种在活人类肝细胞实验中阻断纤维化并促进细胞再生。

    推荐理由:同一人类肝细胞实验平台对比了研究者与模型推荐的候选药物,为理解文献检索所得假设如何转化为实验结果提供了具体案例。

  2. Google DeepMind77

    WeatherNext 如何帮助美国国家飓风中心更准确预测 Melissa 在牙买加的历史性登陆

    WeatherNext 提前5天以80%的置信度预测飓风 Melissa 将以5级强度登陆牙买加,帮助美国国家飓风中心提前发出预警。模型同时预测路径与强度,登陆前3天的预测置信度升至接近100%;其预测与 HAFS 等物理模型、卫星及飓风侦察数据共同支持预报员决策,为当地准备和疏散争取时间。

    推荐理由:案例展示了 AI 天气预测如何与物理模型、实时观测及预报员经验配合,将更早的强度预判转化为疏散准备时间。

  3. Google DeepMind90

    Google DeepMind 发布 Gemini 3.5 系列,率先开放面向智能体与编码的 3.5 Flash

    Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。

    推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。

5月12日周二
  1. Google DeepMind68

    Co-Scientist:基于 Gemini 的多智能体科研伙伴,协作生成与完善科学假设

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。

    推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。

5月6日周三
  1. Google DeepMind74

    AlphaEvolve 如何将 Gemini 驱动的编码智能体应用扩展至科研、基础设施与商业领域

    Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。

    推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。

5月2日周六
4月30日周四
  1. Google DeepMind65

    Google DeepMind 探索以 AI co-clinician 支持医生监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。

    推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。

  2. Google Research65

    Google Research 科学家如何将 ERA 用于四类科学研究

    Google Research 展示了 Empirical Research Assistance(ERA)在公共卫生预测、宇宙学、二氧化碳监测和神经回路研究中的应用成果。

    推荐理由:四个案例展示了将结构信息、物理约束和既有观测数据引入科研建模的不同路径,为理解预测能力如何延伸到机制解释提供参照。

4月27日周一
  1. Google DeepMind43

    Google DeepMind 宣布与韩国建立合作伙伴关系

    Google DeepMind 宣布与韩国科学技术信息通信部建立合作伙伴关系,支持科研突破、AI 人才培养及安全研究。Google 将在首尔办公室设立 AI Campus,为韩国学术及研究机构提供前沿科研 AI 模型访问与合作机会。双方将探索生命科学、能源、天气及气候领域的合作,并与韩国 AI 安全研究所开展研究。

4月23日周四
  1. Google Research74

    Google Photos Auto frame 支持自动调整照片视角与人像透视

    Google Photos 的 Auto frame 已支持三维感知照片编辑,可自动调整符合条件的人物照片的相机视角,并修正广角人像透视畸变。该方法先估计三维点图与相机参数并重新渲染,再用专门训练的潜在扩散模型补全新视角下的缺失区域,同时尽量保留原始可见内容。

    推荐理由:相较于只能裁剪或缩放的传统编辑,这种方法通过重建三维场景再补全遮挡区域,将拍摄后的构图调整扩展到相机视角。

4月22日周三
4月21日周二
  1. Google DeepMind43

    Google DeepMind 携手行业领军企业,加速 AI 转型

    Google DeepMind 与埃森哲、贝恩、BCG、德勤和麦肯锡合作,帮助企业规模化采用前沿 AI。合作伙伴将提前获得 Gemini 系列等前沿模型的访问权限,并直接与技术团队协作,开发行业专用 AI 解决方案。合作还将连接其领导层与客户 CEO 及董事会,帮助企业规划前沿 AI 的应用。

4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

  2. Google DeepMind73

    Google 发布 Gemini 3.1 Flash TTS,以音频标签增强语音表达控制

    Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。

    推荐理由:音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。

4月14日周二
  1. Google Research61

    Google Research 探索用 Vantage 生成式 AI 模拟环境评估面向未来的技能

    Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。

    推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。