Google DeepMind 发布 Gemini Omni Flash,支持多模态输入与对话式视频编辑
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,支持结合图像、音频、视频和文本生成视频,并通过多轮对话编辑。
推荐理由:多模态参考输入与多轮对话编辑把视频生成延伸到持续修改的工作流,音频输入和输出模态的开放边界也有明确说明。
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,支持结合图像、音频、视频和文本生成视频,并通过多轮对话编辑。
推荐理由:多模态参考输入与多轮对话编辑把视频生成延伸到持续修改的工作流,音频输入和输出模态的开放边界也有明确说明。
Google 推出 Gemini for Science,包含 Google Labs 上的 3 款科研实验工具,以及可在 Google Antigravity 中使用的 Science Skills。
Google 将内容透明度与验证工具扩展至 Search、Gemini、Chrome、Pixel 和 Cloud,帮助辨识媒体来源与编辑历史。
推荐理由:将生成内容水印与相机原始内容凭证结合,提供了理解媒体来源的双向思路,而不只是判断一份文件是否由 AI 生成。
Google 与新加坡政府建立国家级 AI 合作伙伴关系,Google DeepMind 推出多项计划,聚焦医疗、科研、教育及负责任的 AI 部署。Gemini for Education 已提供给小学至初级学院的所有教师,后续将开展培训。Google DeepMind 还将与 IMDA、MLCommons 合作研究多模态和多语言安全评测基准。
剑桥大学教授 Clare Bryant 利用 Co-Scientist 寻找病原体跨物种传播后引发人类重症的分子开关,将研究假设细化至特定氨基酸。团队正构建含相关氨基酸突变的细胞系以验证假设;若靶点正确,原需两到三年的实验工作有望在六个月内完成。
Calico Life Sciences 利用 Co-Scientist 整合衰老生物学研究,提出值得实验检验的新假设。在整合应激反应(ISR)研究中,团队借助它提出代谢调控 ISR 的假设并完善实验设计,实验已取得涉及 ISR 在健康与疾病中作用的新发现,结果计划发表。
爱丁堡大学 Filippo Menolascina 团队利用 Co-Scientist 研究代谢功能障碍相关脂肪性肝炎(MASH),提出了后来获实验验证的机制假说。
推荐理由:案例展示了从跨领域文献综合到实验检验的研究路径,为利用 AI 缩小组合疗法搜索范围提供了具体参考。
Co-Scientist 帮助 MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 联结组织建模和细胞表面 RNA 研究,探索 ALS 新路径。它协助梳理文献、提出可检验假设,并按可行性及潜在风险收益排序研究方向。两人正寻找可靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。
斯坦福大学医学院 Gary Peltz 团队利用 Co-Scientist 筛选肝纤维化候选药物,其推荐的 3 种药物中有 2 种在活人类肝细胞实验中阻断纤维化并促进细胞再生。
推荐理由:同一人类肝细胞实验平台对比了研究者与模型推荐的候选药物,为理解文献检索所得假设如何转化为实验结果提供了具体案例。
WeatherNext 提前5天以80%的置信度预测飓风 Melissa 将以5级强度登陆牙买加,帮助美国国家飓风中心提前发出预警。模型同时预测路径与强度,登陆前3天的预测置信度升至接近100%;其预测与 HAFS 等物理模型、卫星及飓风侦察数据共同支持预报员决策,为当地准备和疏散争取时间。
推荐理由:案例展示了 AI 天气预测如何与物理模型、实时观测及预报员经验配合,将更早的强度预判转化为疏散准备时间。
Google DeepMind 发布 Gemini 3.5 模型系列,率先开放 3.5 Flash,面向复杂、长流程的智能体与编码任务。官方称其在 Terminal-Bench 2.1(76.2%)、GDPval-AA(1656 Elo)和 MCP Atlas(83.6%)等基准上超过 Gemini 3.1 Pro,输出 token 速度为其他前沿模型的 4 倍。
推荐理由:官方将智能体与编码基准表现同输出速度、成本放在一起比较,为评估长流程任务中的性能与延迟取舍提供了具体参照。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。
推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。
Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。
推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。
Google Research 通过全球科研合作、开源工具与开放数据集,已支持全球超过 250,000 名研究人员和开发者。其与 UCSC 基因组研究所合作改进泛基因组参考,将遗传变异识别错误减少 50%。包含 MedGemma 的开放权重医疗模型套件 HAI-DEF 下载量已超过 4.8M。
Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。
推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。
Google Research 展示了 Empirical Research Assistance(ERA)在公共卫生预测、宇宙学、二氧化碳监测和神经回路研究中的应用成果。
推荐理由:四个案例展示了将结构信息、物理约束和既有观测数据引入科研建模的不同路径,为理解预测能力如何延伸到机制解释提供参照。
Google DeepMind 宣布与韩国科学技术信息通信部建立合作伙伴关系,支持科研突破、AI 人才培养及安全研究。Google 将在首尔办公室设立 AI Campus,为韩国学术及研究机构提供前沿科研 AI 模型访问与合作机会。双方将探索生命科学、能源、天气及气候领域的合作,并与韩国 AI 安全研究所开展研究。
Google Photos 的 Auto frame 已支持三维感知照片编辑,可自动调整符合条件的人物照片的相机视角,并修正广角人像透视畸变。该方法先估计三维点图与相机参数并重新渲染,再用专门训练的潜在扩散模型补全新视角下的缺失区域,同时尽量保留原始可见内容。
推荐理由:相较于只能裁剪或缩放的传统编辑,这种方法通过重建三维场景再补全遮挡区域,将拍摄后的构图调整扩展到相机视角。
Google DeepMind 在新论文中提出 Decoupled DiLoCo,通过计算集群间的异步数据流隔离局部故障,实现低带宽跨数据中心训练。团队使用 2-5 Gbps 广域网络,在美国 4 个区域完成了一个 12 billion 参数模型的训练,速度比传统同步方法快 20 倍以上。
Google Research 在 ICLR 论文中介绍 ReasoningBank,将智能体的成功与失败经验提炼为结构化推理记忆,以支持测试时自我演进。
Google DeepMind 与埃森哲、贝恩、BCG、德勤和麦肯锡合作,帮助企业规模化采用前沿 AI。合作伙伴将提前获得 Gemini 系列等前沿模型的访问权限,并直接与技术团队协作,开发行业专用 AI 解决方案。合作还将连接其领导层与客户 CEO 及董事会,帮助企业规划前沿 AI 的应用。
Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。
Google Research 利用 MoGen 生成合成神经元形态,将 PATHFINDER 的神经元重建错误率降低了 4.4%。训练数据中加入 10% 的模拟数据后,改善主要来自错误合并减少;按完整小鼠脑规模估算,可节省相当于一名专家 157 年的人工校对工作。MoGen 已作为开源模型发布。
Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。
推荐理由:音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。
Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。
推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。
推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。
Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。
Google Research 推出 PaperVizAgent 和 ScholarPeer,分别用于生成学术图表和自动评审论文。PaperVizAgent 在经人类图表校准的 LLM 评测中总分为 60.2,超过设定的人工基线 50.0。ScholarPeer 结合网络文献检索与技术主张核验,在并排评测中优于先进自动评审方案。
Google Research 提出行为倾向评估框架,对 25 个 LLM 的分析发现,模型既会偏离人类共识,也未充分体现意见分歧。研究将心理问卷转化为现实情境判断测试,每个情境收集 10 名标注者的行动偏好,并与模型回答分布比较;在人类意见分歧较大的情境中,所有受测模型均表现出系统性过度自信。模型自报倾向与情境中的建议行为也存在差异,例如自称低冲动性,却给出偏向冲动的建议。
推荐理由:将心理问卷转化为情境判断测试,为区分模型自述倾向与实际建议行为提供了可迁移的评估路径,而不只依赖自报答案。
Google DeepMind 发布 Gemma 4 开放模型系列,采用 Apache 2.0 许可,提供 E2B、E4B、26B MoE 和 31B Dense 四种尺寸,面向高级推理与智能体工作流。
推荐理由:不同尺寸对应的硬件要求、上下文窗口与模态差异,为开发者在端侧离线运行和工作站部署之间选型提供了具体依据。
Google Research 的研究发现,AI 基准每项仅用 1、3 或 5 名评分者往往不足,可靠评估通常需要每项超过 10 名评分者。
Google DeepMind 展示由 Gemini 驱动的实验性 AI 指针,并将相关交互原则用于 Chrome 和 Googlebook。其设计结合指向位置、视觉与语义上下文及语音,让用户用“这个”“那个”等简短表达提出请求,实验演示可在 Google AI Studio 体验。
推荐理由:将指向位置、视觉上下文与语音结合的交互设计,为减少用户在不同应用间搬运内容和编写详细提示词提供了具体思路。
Google 宣布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks 框架,称可在不到 60 秒内将自然语言转为具备物理交互能力的 Android XR 应用。
Google Research 介绍向量压缩算法 TurboQuant,在 Gemma 和 Mistral 的测试中将 KV cache 量化至 3 bits,无需训练或微调且不损失模型准确率。
Google Research 的 S2Vec 通过自监督学习生成建成环境的通用嵌入向量,用于预测人口密度等地理指标。它将地理特征栅格化,再以掩码自编码学习空间关系,无需人工标签。评测中,其在零样本地理适应任务上通常是表现最佳的单一模型,但树木覆盖、海拔等环境任务仍需改进。
Google Research 在今天的 The Check Up 活动中汇总医疗 AI 研究进展,涵盖个性化健康、临床辅助、开发者模型、公共卫生与生物医学发现。
Google Research 与 NHS 合作的两项 AIMS 研究显示,AI 独立阅片可提高乳腺癌检出能力,参与双阅片流程后的表现不劣于传统流程。发表于 Nature Cancer 的研究中,独立 AI 的癌症检出率从每 1,000 名女性 7.54 例提高至 9.33 例;以 AI 担任第二阅片者的研究估计可减少 46% 的人工阅片次数及 36–44% 的阅片时间。
推荐理由:两项研究区分了模型独立检出能力与人机协作后的实际表现,为评估医疗人工智能提供了兼顾工作量和仲裁误判的视角。
Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。
Google 在 Flood Hub 推出城市突发洪水预测,利用 AI 方法提前最多 24 小时预测城市地区的突发洪水风险。系统使用 Gemini 从公开新闻报道中提取洪灾时间与地点,形成 Groundsource 数据集,并结合全球气象数据训练采用 LSTM 单元的 RNN 模型。
推荐理由:利用新闻报道补足历史洪灾记录的做法,为缺乏传感器数据地区构建预警系统提供了参考,也呈现了数据覆盖对评估的限制。
Google Research 推出 Groundsource 方法,利用 Gemini 从新闻提取洪灾信息,并开放包含 2.6 million 条历史事件记录、覆盖超过 150 个国家的数据集。
推荐理由:新闻记录可补充传统监测容易遗漏的局地短时洪灾,为历史数据稀缺地区的预测模型训练与验证提供另一类数据来源。