跳到正文

#推理

今日 1 条
今天9月30日周三
  1. AWS Machine Learning Blog69

    GPT-6.1 Sol 在 Amazon Bedrock 正式可用,将接近 Astra 的智能带入日常工作

    GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。

    推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。

9月29日周二
9月22日周二
9月16日周三
9月9日周三
9月8日周二
9月3日周四
9月1日周二
  1. Google Research57

    Google Research 推出 TimesFM-3,支持零样本多变量时间序列预测

    Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。

8月25日周二
8月21日周五
8月19日周三
8月14日周五
8月13日周四
  1. Microsoft Research46

    MindTopo 揭示视觉语言模型的空间推理能力

    MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。

8月12日周三
  1. Google Research71

    Google Research 研究:回忆而非知识编码是大语言模型参数化事实性的瓶颈

    Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。

    推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。

8月11日周二
7月15日周三
  1. Hugging Face Blog79

    Thinking Machines Inkling 登陆 Hugging Face,新增 Inkling-Small 版本

    Thinking Machines Lab 开放多模态模型 Inkling,并新增同架构的 Inkling-Small,原生接收图像、文本和音频输入。Inkling 总参数为 975B、激活参数为 41B,支持 1M 上下文窗口;Inkling-Small 总参数为 276B、激活参数为 12B,提供 MXFP8 和 NVFP4 权重。

    推荐理由:不同精度版本的显存需求与部署配置并列呈现,为比较完整模型和小型版本的硬件门槛提供了具体依据。

7月2日周四
7月1日周三
  1. Berkeley AI Research33

    BAIR 2026 届博士毕业生风采展示

    伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。

6月30日周二
  1. Google Research69

    Google Research 发布 TabFM,用于表格数据零样本分类与回归

    Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。

    推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。

6月27日周六
6月25日周四
6月11日周四
5月22日周五
5月16日周六
5月12日周二
  1. Google DeepMind68

    Co-Scientist:基于 Gemini 的多智能体科研伙伴,协作生成与完善科学假设

    Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。

    推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。

5月8日周五
  1. Berkeley AI Research38

    自适应并行推理:高效推理扩展的下一范式

    自适应并行推理将何时拆分任务、启用多少并发线程及如何协调的决策交给模型,而非依赖外部预设结构。现有并行方法可让多条推理路径同时展开,但常受固定并行规模或搜索策略限制。自适应控制旨在按问题选择并行方式,避免简单任务浪费计算、复杂任务拆分不当。

4月30日周四
  1. Google DeepMind65

    Google DeepMind 探索以 AI co-clinician 支持医生监督下的医疗协作

    Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。

    推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。

4月22日周三
4月16日周四
  1. Google Research49

    Google Research 的 Simula 如何从第一性原理出发,以机制设计构建真实场景合成数据集

    Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。

4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。

    推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。

3月25日周三
3月17日周二
  1. Mistral AI78

    Mistral 发布 Mistral Small 4,整合推理、多模态与智能体编码能力

    Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。

    推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。