跳到正文

全部动态

今日 63 条
4月22日周三
4月21日周二
  1. Google DeepMind43

    Google DeepMind 携手行业领军企业,加速 AI 转型

    Google DeepMind 与埃森哲、贝恩、BCG、德勤和麦肯锡合作,帮助企业规模化采用前沿 AI。合作伙伴将提前获得 Gemini 系列等前沿模型的访问权限,并直接与技术团队协作,开发行业专用 AI 解决方案。合作还将连接其领导层与客户 CEO 及董事会,帮助企业规划前沿 AI 的应用。

4月20日周一
4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

  2. Google DeepMind73

    Google 发布 Gemini 3.1 Flash TTS,以音频标签增强语音表达控制

    Google 发布文本转语音模型 Gemini 3.1 Flash TTS,新增音频标签,可通过文本中的自然语言指令精细控制声音风格、语速和表达方式。模型原生支持多说话人对话及超过 70 种语言,在 Artificial Analysis TTS 排行榜获得 1,211 Elo,所有生成音频均嵌入 SynthID 水印。

    推荐理由:音频标签把语气、语速和句中表达变化纳入文本输入控制,为多角色对话与本地化语音应用提供了更细粒度的创作方式。

4月14日周二
  1. Google Research61

    Google Research 探索用 Vantage 生成式 AI 模拟环境评估面向未来的技能

    Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。

    推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。

    推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。

4月9日周四
  1. Google Research50

    ConvApparel:衡量并缩小用户模拟器的真实性差距

    Google Research 的 ConvApparel 数据集与评估框架用于衡量大语言模型用户模拟器与真实用户行为的差距。数据集包含超过 4,000 段服装购物对话、近 15,000 轮交互,参与者被随机分配给有帮助或刻意不配合的 AI 智能体。框架结合群体统计、类人评分与反事实验证,检验模拟器面对陌生情境时的反应是否可信。

4月3日周五
  1. Google Research62

    Google Research 评估 25 个 LLM 的行为倾向与人类偏好对齐程度

    Google Research 提出行为倾向评估框架,对 25 个 LLM 的分析发现,模型既会偏离人类共识,也未充分体现意见分歧。研究将心理问卷转化为现实情境判断测试,每个情境收集 10 名标注者的行动偏好,并与模型回答分布比较;在人类意见分歧较大的情境中,所有受测模型均表现出系统性过度自信。模型自报倾向与情境中的建议行为也存在差异,例如自称低冲动性,却给出偏向冲动的建议。

    推荐理由:将心理问卷转化为情境判断测试,为区分模型自述倾向与实际建议行为提供了可迁移的评估路径,而不只依赖自报答案。

4月1日周三
3月31日周二
3月29日周日
  1. Google DeepMind73

    Google DeepMind 探索 AI 时代的鼠标指针,将 Gemini 交互融入 Chrome 与 Googlebook

    Google DeepMind 展示由 Gemini 驱动的实验性 AI 指针,并将相关交互原则用于 Chrome 和 Googlebook。其设计结合指向位置、视觉与语义上下文及语音,让用户用“这个”“那个”等简短表达提出请求,实验演示可在 Google AI Studio 体验。

    推荐理由:将指向位置、视觉上下文与语音结合的交互设计,为减少用户在不同应用间搬运内容和编写详细提示词提供了具体思路。

3月25日周三
3月24日周二
  1. Mistral AI73

    Mistral 发布 Voxtral TTS:4B 参数语音生成模型,支持 9 种语言

    Mistral 发布文本转语音模型 Voxtral TTS,以 4B 参数支持 9 种语言的情感表达语音生成及零样本跨语言声音适配。官方称,在输入 10 秒声音样本和 500 个字符的典型条件下,模型延迟为 70ms;其人类评估显示,自然度优于 ElevenLabs Flash v2.5,音频质量与 ElevenLabs v3 相当。

    推荐理由:原文将语音自然度的人类评估与具体输入条件下的延迟并列呈现,为企业权衡语音智能体的表达质量与响应速度提供了参考。

3月18日周三
  1. Google Research71

    Google Research 研究如何用机器学习改善乳腺癌筛查流程

    Google Research 与 NHS 合作的两项 AIMS 研究显示,AI 独立阅片可提高乳腺癌检出能力,参与双阅片流程后的表现不劣于传统流程。发表于 Nature Cancer 的研究中,独立 AI 的癌症检出率从每 1,000 名女性 7.54 例提高至 9.33 例;以 AI 担任第二阅片者的研究估计可减少 46% 的人工阅片次数及 36–44% 的阅片时间。

    推荐理由:两项研究区分了模型独立检出能力与人机协作后的实际表现,为评估医疗人工智能提供了兼顾工作量和仲裁误判的视角。

  2. Mistral AI51

    Mistral AI 推出 Forge,支持企业用自有知识训练定制模型

    Mistral AI 推出 Forge,让企业基于专有数据构建并持续改进模型,支持预训练、后训练和强化学习。系统支持稠密与 MoE 架构及多模态输入,企业可在自身基础设施环境中运行模型,并使用内部基准、合规规则和领域任务进行评估。Mistral Vibe 等自主智能体可借助 Forge 微调模型、寻找最优超参数、调度任务和生成合成数据,Forge 则负责基础设施并监控相关基准是否出现性能退化。

3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,整合推理、多模态与智能体编码能力

    Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。

    推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。

  2. Google Research46

    Google Research 评测 LLM 回答超导研究问题的能力

    Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。

3月13日周五
3月12日周四
  1. Google Research72

    Google 利用 AI 驱动的城市突发洪水预测保护城市

    Google 在 Flood Hub 推出城市突发洪水预测,利用 AI 方法提前最多 24 小时预测城市地区的突发洪水风险。系统使用 Gemini 从公开新闻报道中提取洪灾时间与地点,形成 Groundsource 数据集,并结合全球气象数据训练采用 LSTM 单元的 RNN 模型。

    推荐理由:利用新闻报道补足历史洪灾记录的做法,为缺乏传感器数据地区构建预警系统提供了参考,也呈现了数据覆盖对评估的限制。

  2. Google Research71

    Google Research 推出 Groundsource,利用 Gemini 将新闻转为洪灾历史数据

    Google Research 推出 Groundsource 方法,利用 Gemini 从新闻提取洪灾信息,并开放包含 2.6 million 条历史事件记录、覆盖超过 150 个国家的数据集。

    推荐理由:新闻记录可补充传统监测容易遗漏的局地短时洪灾,为历史数据稀缺地区的预测模型训练与验证提供另一类数据来源。

  3. Google Research68

    Google Research 探索 AMIE 对话式诊断 AI 在真实临床研究中的可行性

    Google Research 与 Beth Israel Deaconess Medical Center 开展 AMIE 单中心前瞻性可行性研究,100 名成人患者在医生实时监督下完成诊前文字问诊,未触发安全停止。

    推荐理由:研究将诊前问诊置于医生实时监督的真实流程中,并区分可行性与临床疗效,为理解医疗对话系统的评估边界提供具体参照。

3月11日周三
2月5日周四
1月28日周三
  1. Mistral AI69

    Mistral Vibe 2.0 发布,新增自定义子智能体与斜杠命令技能

    Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。

    推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。

1月22日周四
1月10日周六
  1. Berkeley AI Research48

    Berkeley AI Research:信息驱动的成像系统设计

    Berkeley AI Research 研究团队提出基于信息量评估与优化成像系统的框架,设计效果可媲美先进端到端方法。该方法仅用含噪测量和噪声模型估计互信息,在彩色摄影、射电天文学、无透镜成像和显微成像中均能预测下游性能。优化设计所需内存和计算更少,无需设计任务专用解码器。

12月17日周三
  1. Mistral AI66

    Mistral AI 发布 Mistral OCR 3,提升手写、扫描件与复杂表格识别能力

    Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上的整体胜率较 Mistral OCR 2 达到 74%。模型支持提取文本与嵌入图像,输出带 HTML 表格结构的 Markdown,价格为 $2 per 1,000 pages,Batch-API 提供 50% 折扣后为 $1 per 1,000 pages。

    推荐理由:对文档处理流程而言,表格结构保留、批量价格与向后兼容信息提供了具体依据,可用于评估升级成本和接入方式。

12月9日周二
12月3日周三
  1. Mistral AI80

    Mistral 发布 Mistral 3,涵盖 Large 3 与 3B、8B、14B 小模型

    Mistral 发布 Mistral 3 系列,包括 3B、8B、14B 的 Ministral 3,以及激活参数为 41B、总参数为 675B 的混合专家模型 Mistral Large 3,均采用 Apache 2.0 许可证。

    推荐理由:从端侧稠密模型到大型混合专家模型均采用宽松许可证,并给出压缩格式与硬件部署条件,为不同资源预算下的模型选型提供参考。

11月19日周三
  1. Mistral AI44

    Mistral AI:面向德国的 AI

    Mistral AI 扩大对德国的长期投入,与 SAP 和 Helsing 推进战略合作,并计划在未来几个月开设德国办公室、扩充当地团队。与 SAP 的多年合作将打造面向德国和欧洲的主权 AI 技术栈,将模型整合至 SAP AI Foundation;与 Helsing 的合作将加速开发用于国防与安全的视觉-语言-动作模型。

11月1日周六