跳到正文

#多模态

今日 3 条
今天9月30日周三
  1. AWS Machine Learning Blog49

    如何使用 Amazon Nova Act 实现合成监控

    Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。

9月29日周二
  1. Microsoft Research66

    Microsoft Research 推出 Quine,将生物学世界模型与实验研究流程连接

    Microsoft Research 推出实验性 AI 研究系统 Quine,将多模态生物学世界模型与科学工具、文献及研究人员连接。团队与 Broad Institute 合作,用一个周末从数千种化合物中筛出待实验验证的候选物,随后在多项湿实验中验证了部分高排名化合物对胰腺癌细胞状态的预测性转变效果。

    推荐理由:胰腺癌细胞状态实验展示了模型预测如何进入湿实验筛选流程,也呈现了较弱的反向转变与意外表型如何成为后续研究线索。

  2. Microsoft Research31

    成立一周年:微软亚洲研究院新加坡实验室如何通过研究、合作与人才培养推动实际应用

    微软亚洲研究院新加坡实验室成立一年来,扩大团队并深化本地合作,推动前沿 AI 研究与实际应用相互促进。实验室与医疗伙伴合作,探索多模态 AI 和智能体方法在临床决策、疾病诊断及个性化护理中的应用。新加坡经济发展局继续支持联合博士培养,双方合作已扩展至战略层面。

9月26日周六
9月25日周五
  1. Google Research60

    Google Research 如何用多智能体框架自动生成连贯长视频

    Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。

    推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。

9月24日周四
9月16日周三
9月3日周四
9月2日周三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智能体式视频理解,token 消耗最多降低 88%

    Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。

    推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。

8月28日周五
  1. Google Research60

    Google 介绍 planetary prediction engine 研究:借助 Earth AI 自动完成地理空间建模

    Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。

    推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。

  2. Google DeepMind76

    Gemini Omni 1.1 Flash 增强视频创作控制能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。

    推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。

8月26日周三
8月25日周二
  1. Hugging Face Blog72

    如何用 Gradio 连接、运行和部署 AI 工作流

    Gradio 内置的 gr.Workflow 可将 AI 流水线表示为带类型节点的图,并提供可拖拽、逐节点运行和查看中间结果的画布。节点可连接 Python 函数、Hugging Face Inference Providers 上的模型、Gradio Spaces 或数据集,文中通过图像编辑、并行生成和数据集分析等示例演示用法。

    推荐理由:将中间结果可见的节点画布与同一工作流的接口调用结合,为多步骤 AI 应用提供了从排查问题到复用服务的具体方法。

8月18日周二
8月13日周四
  1. Microsoft Research46

    MindTopo 揭示视觉语言模型的空间推理能力

    MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。

8月12日周三
  1. Google Research69

    Google Research 推进 AMIE 实时视听问诊研究,模拟评估达到专家级表现

    Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。

    推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。

8月10日周一
  1. Hugging Face Blog79

    Meta 发布 Muse Glimmer:面向本地智能体的 30B 开源多模态模型

    Meta 今天发布 Muse Glimmer,这是从 Muse 蒸馏而来的 30B 多模态模型,采用 Apache 2.0 许可证,面向本地智能体应用。模型支持图像、无音频视频理解及多模态工具调用,可选用基于 DFlash 的推测解码模块,以额外内存开销换取生成加速。

    推荐理由:从量化部署到推测解码的具体示例,为评估本地多模态智能体的部署路径及速度与显存之间的取舍提供了工程参考。

8月4日周二
7月30日周四
  1. Google DeepMind75

    Gemini Robotics ER 2 以视频理解、任务编排和多机器人协作增强机器人能力

    Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。

    推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。

7月28日周二
  1. Google DeepMind74

    Gemini Robotics 2 为机器人带来全身智能控制与多机器人协作

    Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。

    推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。

7月21日周二
7月16日周四
7月15日周三
  1. Hugging Face Blog79

    Thinking Machines Inkling 登陆 Hugging Face,新增 Inkling-Small 版本

    Thinking Machines Lab 开放多模态模型 Inkling,并新增同架构的 Inkling-Small,原生接收图像、文本和音频输入。Inkling 总参数为 975B、激活参数为 41B,支持 1M 上下文窗口;Inkling-Small 总参数为 276B、激活参数为 12B,提供 MXFP8 和 NVFP4 权重。

    推荐理由:不同精度版本的显存需求与部署配置并列呈现,为比较完整模型和小型版本的硬件门槛提供了具体依据。

7月9日周四
7月8日周三
7月6日周一
  1. Hugging Face Blog43

    PRX 第 4 部分:训练数据策略

    PRX 团队将公共与内部数据集混合,用 VLM 重新生成图像描述,构建用于训练的流式语料。其 7B 模型预训练重视覆盖面与多样性,采用准确的长描述和轻量过滤。数据管线用 Lance 整理、MDS 流式读取;改用 Qwen3-VL 后,训练时实时计算文本潜在表示,吞吐量代价约为 3–4%。

7月1日周三
  1. Berkeley AI Research33

    BAIR 2026 届博士毕业生风采展示

    伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4:支持 170 种语言,新增边界框、块分类与置信度

    Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。

    推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。

6月13日周六
  1. Google Research63

    Google Research 研究 AI 如何帮助用户理解皮肤问题及其决策局限

    Google Research 分享的研究发现,AI 辅助能提高用户识别皮肤问题的准确率,但未显著改善标准 AI 组选择后续医疗步骤的准确率。本周发表于 JAMA Dermatology 的研究纳入 2,345 名参与者,AI 组病症名称猜测准确率为 23%,对照组为 8%;AI 组建议的处理紧迫程度低于皮肤科医生判断的比例为 30%,对照组为 27%。

    推荐理由:研究区分了识别皮肤问题与选择就医步骤两种能力,为理解医疗信息工具的准确率提升为何不等于决策改善提供了具体对照。

6月9日周二
  1. Google DeepMind79

    Google DeepMind 发布 Gemma 4 12B:统一、无编码器的多模态模型

    Google DeepMind 发布 Gemma 4 12B,采用统一的无编码器架构,将视觉与音频输入直接接入 LLM 主干,面向笔记本本地多模态智能体应用。官方称其标准基准表现接近 26B MoE 模型,总内存占用不到后者一半,可在配备 16GB 显存或统一内存的设备上运行,并配备 Multi-Token Prediction(MTP)草稿模型以降低延迟。

    推荐理由:无独立编码器的音视频处理路径与本地内存要求,为评估多模态智能体从大模型迁移到笔记本的资源取舍提供了具体参照。

5月29日周五
  1. Google Research61

    Google Research 回顾 I/O 2026:AI 科研工具、健康研究与智能体开发进展

    Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。

    推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。

5月28日周四
  1. Mistral AI56

    Mistral 在 AI Now Summit 2026 展示工业工程 AI 栈、Vibe 更新与数据中心计划

    Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。

5月18日周一