Google Research 在 The Check Up 展示医疗 AI 从研究走向真实诊疗场景的进展
Google Research 在今天的 The Check Up 活动中汇总医疗 AI 研究进展,涵盖个性化健康、临床辅助、开发者模型、公共卫生与生物医学发现。
Google Research 在今天的 The Check Up 活动中汇总医疗 AI 研究进展,涵盖个性化健康、临床辅助、开发者模型、公共卫生与生物医学发现。
Google Research 与 NHS 合作的两项 AIMS 研究显示,AI 独立阅片可提高乳腺癌检出能力,参与双阅片流程后的表现不劣于传统流程。发表于 Nature Cancer 的研究中,独立 AI 的癌症检出率从每 1,000 名女性 7.54 例提高至 9.33 例;以 AI 担任第二阅片者的研究估计可减少 46% 的人工阅片次数及 36–44% 的阅片时间。
推荐理由:两项研究区分了模型独立检出能力与人机协作后的实际表现,为评估医疗人工智能提供了兼顾工作量和仲裁误判的视角。
Mistral AI 推出 Forge,让企业基于专有数据构建并持续改进模型,支持预训练、后训练和强化学习。系统支持稠密与 MoE 架构及多模态输入,企业可在自身基础设施环境中运行模型,并使用内部基准、合规规则和领域任务进行评估。Mistral Vibe 等自主智能体可借助 Forge 微调模型、寻找最优超参数、调度任务和生成合成数据,Forge 则负责基础设施并监控相关基准是否出现性能退化。
Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。
推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。
Mistral AI 宣布作为创始成员加入 NVIDIA Nemotron Coalition,并计划与 NVIDIA 共同开发前沿开源 AI 模型。Mistral AI 将贡献模型架构、训练技术、多模态能力及微调工具,NVIDIA 提供算力、模型开发工具和合成数据生成流水线。
Google Research 与康奈尔大学评测了 6 个 LLM 系统回答高温超导研究问题的能力,NotebookLM 与定制 RAG 系统总体表现领先。专家围绕 67 道问题进行盲评,两个领先系统均依赖经过质量控制的资料库。所有受测系统仍有改进空间,NotebookLM 的证据支持得分最高,但回答最不简洁。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库任务,以 Apache 2.0 许可开放权重,并接入 Mistral Vibe。
推荐理由:基于真实形式化仓库任务的评测同时列出得分与运行成本,为比较专用模型和通用编码智能体的证明工程取舍提供了依据。
SPEX 与 ProxySPEX 利用稀疏恢复识别大语言模型中的关键交互作用,将可分析规模较以往方法提升数个数量级。ProxySPEX 进一步利用交互的层级结构,以约十分之一的消融次数达到 SPEX 的表现。情感分析测试中,SPEX 在输入扩展至数千个特征时仍保持较高归因忠实度。
Google 在 Flood Hub 推出城市突发洪水预测,利用 AI 方法提前最多 24 小时预测城市地区的突发洪水风险。系统使用 Gemini 从公开新闻报道中提取洪灾时间与地点,形成 Groundsource 数据集,并结合全球气象数据训练采用 LSTM 单元的 RNN 模型。
推荐理由:利用新闻报道补足历史洪灾记录的做法,为缺乏传感器数据地区构建预警系统提供了参考,也呈现了数据覆盖对评估的限制。
Google Research 推出 Groundsource 方法,利用 Gemini 从新闻提取洪灾信息,并开放包含 2.6 million 条历史事件记录、覆盖超过 150 个国家的数据集。
推荐理由:新闻记录可补充传统监测容易遗漏的局地短时洪灾,为历史数据稀缺地区的预测模型训练与验证提供另一类数据来源。
Google Research 与 Beth Israel Deaconess Medical Center 开展 AMIE 单中心前瞻性可行性研究,100 名成人患者在医生实时监督下完成诊前文字问诊,未触发安全停止。
推荐理由:研究将诊前问诊置于医生实时监督的真实流程中,并区分可行性与临床疗效,为理解医疗对话系统的评估边界提供具体参照。
Mistral 基于 Vibe 构建了自动生成和改进 Rails RSpec 测试的智能体,在包含 275 个源文件的代码库实验中实现测试通过率和平均行覆盖率均为 100%。
Mistral AI 发布 Voxtral Transcribe 2,包括批量转写模型 Voxtral Mini Transcribe V2 和实时模型 Voxtral Realtime,均支持 13 种语言。
推荐理由:批量版的错误率与定价、实时版的延迟与开放权重条件,为语音工作流在成本、响应速度和部署方式之间的取舍提供了具体参照。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。
推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。
Mistral AI 排查 vLLM 内存泄漏,发现堆内存保持稳定,泄漏发生在堆之外。问题出现在启用图编译、使用 NIXL 的预填充与解码分离部署中,涉及 Mistral Medium 3.1,且仅在解码侧观察到。Heaptrack 未捕获泄漏,但测试前后的峰值 RSS 差异揭示了堆分析工具的观测盲区。
Berkeley AI Research 研究团队提出基于信息量评估与优化成像系统的框架,设计效果可媲美先进端到端方法。该方法仅用含噪测量和噪声模型估计互信息,在彩色摄影、射电天文学、无透镜成像和显微成像中均能预测下游性能。优化设计所需内存和计算更少,无需设计任务专用解码器。
Mistral AI 发布 Mistral OCR 3,官方称其在表单、扫描文档、复杂表格和手写内容上的整体胜率较 Mistral OCR 2 达到 74%。模型支持提取文本与嵌入图像,输出带 HTML 表格结构的 Markdown,价格为 $2 per 1,000 pages,Batch-API 提供 50% 折扣后为 $1 per 1,000 pages。
推荐理由:对文档处理流程而言,表格结构保留、批量价格与向后兼容信息提供了具体依据,可用于评估升级成本和接入方式。
Mistral AI 发布 Devstral 2(123B)与 Devstral Small 2(24B)编码模型,并推出支持端到端代码自动化的开源助手 Mistral Vibe CLI。
推荐理由:两种规模模型的基准成绩、许可差异与硬件要求提供了具体选型依据,可用于权衡编码智能体的性能需求和本地部署条件。
Mistral 发布 Mistral 3 系列,包括 3B、8B、14B 的 Ministral 3,以及激活参数为 41B、总参数为 675B 的混合专家模型 Mistral Large 3,均采用 Apache 2.0 许可证。
推荐理由:从端侧稠密模型到大型混合专家模型均采用宽松许可证,并给出压缩格式与硬件部署条件,为不同资源预算下的模型选型提供参考。
Mistral AI 扩大对德国的长期投入,与 SAP 和 Helsing 推进战略合作,并计划在未来几个月开设德国办公室、扩充当地团队。与 SAP 的多年合作将打造面向德国和欧洲的主权 AI 技术栈,将模型整合至 SAP AI Foundation;与 Helsing 的合作将加速开发用于国防与安全的视觉-语言-动作模型。
研究团队将分治价值学习扩展到复杂的目标条件强化学习任务,探索不依赖 TD 学习的离策略 RL 算法。该方法将轨迹拆分为两段并组合其价值,理论上可将 Bellman 递归次数降至对数级,缓解长时序任务中的误差累积,但如何选择最优子目标仍是实现难点。
Mistral AI 推出 Mistral AI Studio,为企业团队提供构建、评估和运行生产级 AI 的统一平台。平台整合可观测性、智能体运行时和 AI 资产注册管理,支持反馈评估、容错执行、版本追踪及访问控制。支持混合、专用及自托管部署。
Mistral AI 宣布完成 1.7B€ C 轮融资,投后估值为 11.7B€,由半导体设备制造商 ASML 领投。资金将支持科学研究,并继续推动定制化、去中心化的前沿 AI 解决方案开发,以应对复杂工程与工业问题。
推荐理由:半导体设备商领投并开展战略合作,使这轮融资不仅涉及研究资金,也为理解前沿 AI 与工业工程需求的连接提供了具体案例。
Mistral AI 介绍 Le Chat 的 Memories(beta),可自动保存有用信息,并在调用记忆时展示来源链接。用户可关闭记忆、开启不使用记忆的隐身聊天、编辑或删除单条记忆,以及导入导出记忆;Memory Insights 则通过轻量提示词,基于用户数据呈现趋势、建议摘要和提示可回顾的内容。该记忆系统采用图架构,后续计划增加分类整理、即时遗忘及更清晰的记忆使用记录。
推荐理由:自动保存与可追溯调用的组合,提供了理解助手记忆控制的一种具体参照,编辑、删除和导入导出则把控制延伸到数据管理。
Mistral AI 为 Le Chat 推出含 20+ 安全连接器的目录与 Memories,两项功能均为 beta,向包括 Free 计划在内的所有用户开放。
推荐理由:自定义连接器将企业工具接入聊天流程,配合组织级访问控制与可选部署方式,为评估助手接入业务系统提供具体参考。
新研究给出 word2vec 学习过程的定量预测理论,证明在特定近似条件下,其学习等价于对目标矩阵进行 PCA。从足够小的初始嵌入权重出发,模型逐步学习正交线性子空间,每一步增加嵌入矩阵的秩。这些特征可由语料统计与算法超参数预先计算,学习动力学的闭式解与数值实验高度吻合。
Mistral AI 展示了 Pixtral-12B 的卫星影像微调方法,微调后分类表现较基础模型显著改善。案例采用 AID 数据集,划分 8,000 个训练样本和 2,000 个测试样本,针对易混淆场景类别进行适配。开发者可通过微调 API 或 LaPlateforme UI 启动微调任务。
Mistral AI 发布 Codestral 25.08 及完整企业编程技术栈,覆盖代码补全、语义检索与多步骤智能体开发。Codestral 25.08 的补全采纳量增加 30%,建议后保留的代码增加 10%,失控生成减少 50%。模型支持云端、VPC 或本地部署,无需更改架构。
Mistral AI 与 Carbone 4、ADEME 合作开展模型生命周期分析,披露温室气体排放、用水和资源消耗,推动 AI 环境影响的标准化核算。
推荐理由:将训练总足迹与单次推理边际影响分开披露,并纳入硬件制造等上游影响,为比较模型环境成本提供了更清晰的核算思路。
Mistral AI 为 Le Chat 新增 Deep Research 预览模式、语音模式、原生多语言推理、Projects 和高级图像编辑。Deep Research 可规划任务、澄清需求、搜索并生成带引用的结构化报告;语音模式由 Voxtral 支持,多语言推理由 Magistral 驱动。
推荐理由:项目空间能保留文件、工具与设置,为需要持续研究和多轮交流的工作提供上下文组织方式,减少跨会话整理材料的负担。
Mistral AI 发布 Voxtral 语音理解模型,提供面向生产应用的 24B 和面向本地、端侧部署的 3B 版本,均采用 Apache 2.0 许可证。
推荐理由:将音频问答、摘要和函数调用纳入可开放部署的语音模型,为需要兼顾数据控制与语义理解的应用提供了选型参考。
Mistral AI 与 All Hands AI 合作推出 Devstral Medium 和 Devstral Small 1.1,在 SWE-Bench Verified 上分别取得 61.6% 和 53.6% 的成绩。
推荐理由:两款模型给出了同一编码基准下的成绩与调用价格,并区分开放许可和私有部署路径,便于按预算与部署需求比较选型。
Mistral AI 推出 AI for Citizens 合作倡议,帮助各国政府和公共机构按本地需求应用 AI、改造公共服务。该倡议提供自托管、数据主权保障及定制研发,支持针对本地语言、文化和用途共同训练模型。Mistral AI 已与法国、卢森堡、新加坡等国的政府及公共机构开展合作。
Mistral AI 宣布推出 Mistral Compute,将提供涵盖 GPU、编排、API、产品与服务的私有集成式 AI 基础设施。服务形态从裸金属服务器到全托管 PaaS,并将包含 Mistral AI 的训练套件,支持客户训练和部署 AI 工作负载。该服务将采用 NVIDIA 最新参考架构,提供数万块 GPU,强调数据主权、满足欧洲监管要求及使用脱碳能源,并计划在未来几年快速扩展。
Mistral AI 发布首款推理模型 Magistral,包括 24B 参数的 Small 开放权重版和 Medium 企业版,主打多语言、多步骤及可追溯推理。
推荐理由:开放权重与企业版本并行提供,并披露相同基准下的成绩和部署入口,为比较自部署与托管推理模型提供了具体依据。
Mistral AI 推出企业编码助手 Mistral Code,今天面向 JetBrains IDEs 和 VSCode 开放私测,计划很快正式可用。产品基于 Continue,整合 Codestral、Codestral Embed、Devstral 和 Mistral Medium,覆盖代码补全、搜索检索、智能体编码及聊天辅助,支持在私有代码仓库上微调或后训练底层模型。
Mistral AI 发布首款专用于代码的嵌入模型 Codestral Embed,面向代码检索、语义搜索及编码智能体的 RAG。官方评测称,其在维度为 256、精度为 int8 时仍优于所比较的竞品,并支持保留前 n 个维度以权衡检索质量与存储成本。
Mistral 宣布推出 Agents API,整合内置连接器、MCP 工具、持久记忆与多智能体编排,补充现有 Chat Completion API。
推荐理由:将内置工具、有状态对话与多智能体任务交接纳入同一接口,为企业搭建需要保留上下文并协调多步操作的工作流提供了具体参考。
Mistral AI 与 All Hands AI 合作推出软件工程智能体模型 Devstral,以 Apache 2.0 许可开放,定位为研究预览。模型针对真实 GitHub 问题训练,在 SWE-Bench Verified 上取得 46.8%,比此前开源 SOTA 模型高出超过 6 个百分点,可通过 OpenHands 或 SWE-Agent 等框架处理代码库任务。
推荐理由:同一智能体框架下的基准比较结合单卡运行条件,为评估开源编码模型在本地代码库中的部署取舍提供了具体参照。
Mistral AI 推出由 Mistral Medium 3 驱动的 Le Chat Enterprise,整合企业搜索、智能体构建、自定义数据与工具连接器、文档库、自定义模型及混合部署,所有功能将在未来两周内陆续推出。