跳到正文

多模态

文本之外的能力:视觉理解、图文混合、音视频输入输出的模型与产品进展。

最新精选

第 1–13 条 · 共 14 条
今天9月30日周三
  1. The Decoder79

    AMD 以约 $8.2 billion 收购世界模型初创公司 World Labs

    AMD 宣布以约 $8.2 billion 的全股票交易收购专注空间智能的 World Labs,交易预计于 2026 年底前完成,尚待监管批准。创始人李飞飞将担任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报并领导前沿研究。AMD 希望借助团队对 AI 工作负载的理解指导未来硬件路线,李飞飞则表示,扩大研究规模需要与硬件更紧密地整合。

    推荐理由:收购动机指向以模型研发经验指导硬件路线,为理解芯片厂商为何把竞争延伸至模型与研究团队提供了具体案例。

9月29日周二
  1. Microsoft Research66

    Microsoft Research 推出 Quine,将生物学世界模型与实验研究流程连接

    Microsoft Research 推出实验性 AI 研究系统 Quine,将多模态生物学世界模型与科学工具、文献及研究人员连接。团队与 Broad Institute 合作,用一个周末从数千种化合物中筛出待实验验证的候选物,随后在多项湿实验中验证了部分高排名化合物对胰腺癌细胞状态的预测性转变效果。

    推荐理由:胰腺癌细胞状态实验展示了模型预测如何进入湿实验筛选流程,也呈现了较弱的反向转变与意外表型如何成为后续研究线索。

9月25日周五
  1. Google Research60

    Google Research 如何用多智能体框架自动生成连贯长视频

    Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。

    推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。

9月16日周三
9月2日周三
  1. Google DeepMind78

    Google DeepMind 推出 Gemini 智能体式视频理解,token 消耗最多降低 88%

    Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。

    推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。

8月28日周五
  1. Google Research60

    Google 介绍 planetary prediction engine 研究:借助 Earth AI 自动完成地理空间建模

    Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。

    推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。

  2. Google DeepMind76

    Gemini Omni 1.1 Flash 增强视频创作控制能力

    Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。

    推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。

8月12日周三
  1. Google Research69

    Google Research 推进 AMIE 实时视听问诊研究,模拟评估达到专家级表现

    Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。

    推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。

7月30日周四
  1. Google DeepMind75

    Gemini Robotics ER 2 以视频理解、任务编排和多机器人协作增强机器人能力

    Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。

    推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。

7月28日周二
  1. Google DeepMind74

    Gemini Robotics 2 为机器人带来全身智能控制与多机器人协作

    Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。

    推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。

7月21日周二