GPT-6.1 Sol 在 Amazon Bedrock 正式可用,将接近 Astra 的智能带入日常工作
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
Amazon Bedrock 已上线 xAI 的 Grok 4.7,提供 500K token 上下文窗口,以及 low、medium、high、xhigh 四档推理强度。
Hugging Face 为 Transformers 新增高效运行 GGUF 量化模型的支持,通过复用 ggml 内核并优化 generate,初期面向 Apple Silicon 本地推理。
英国 AI 安全研究所(AISI)正使用 EvalEval 基础设施公开评测结果,以支持更可复现、可验证的评测。公开数据通过 Evaluation Cards 提供,包含已核验结果、背景及配置信息,覆盖主实验的 5 项基准和 6 款前沿模型,便于研究者比较不同评测设置下的表现。
NVIDIA Vera Rubin NVL72 在 MLPerf Inference v6.1 首次预览提交中取得领先性能。其 Qwen3-VL 和 DeepSeek-R1 测试吞吐量分别最高达到 GB300 NVL72 的 3.7x 和 2.5x。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
NVIDIA 介绍了 DSX 如何通过动态功率分配与整厂优化提高 AI 工厂产出,Lambda 的部署验证显示同一功率预算下 token 吞吐量提升 24%。在 HGX B200 集群上,DSX MaxLPS 让 19 个节点使用相当于 16 个全功率节点的预算,每瓦性能提升 23%。
NVIDIA 在 AI Infra Summit 展示 Vera Rubin 与 DSX 平台进展,通过系统性能与功耗优化提升 AI 工厂能效。DSX MaxLPS 可使每兆瓦 token 产出最高达 1.4x,Lambda 借其将每瓦性能提升 23%。
OpenAI 介绍 GPT-6 Astra,称其为旗下能力最强的商用模型。该模型具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年难题解答。材料包括解答文稿及使用 Lean 编写的形式化证明。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
IBM Granite 团队详解 Granite 4.2 的构建流程,3B、8B、30B 模型均由 Granite-4.1 基础模型经 SFT 和多阶段强化学习训练而来。
推荐理由:分阶段训练配方将可验证奖励、真实环境任务和偏好对齐串联起来,为拆解推理与智能体能力的训练路径提供具体参考。
Quantization-Aware Healing(QAH)使压缩至 60B 的 GPT-OSS 120B 模型在量化为 MXFP4 后,在 9 项基准中的 7 项超越同架构的 bfloat16 恢复版本。QAH 直接从压缩前的原始模型蒸馏,而非从恢复后的检查点蒸馏,避免受后者精度上限约束。
Google DeepMind 在 15 年游戏 AI 研究基础上,与游戏开发商合作构建可玩原型,探索新的游戏体验。由 Gemini 驱动的 SIMA 2 支持实时推理与对话,在复杂 3D 环境和游戏中实现类人操作。与 EVE Universe 背后的 Fenris Creations 的研究合作是这一方向的新进展。
Liquid AI 发布适配 LFM2.5-1.2B-Instruct、LFM2.5-2.6B 和 LFM2.5-8B-A1B 的 DSpark 草稿模型,实测 H100 上最高加速 3.18x,M4 Max 上最高加速 2.87x。
ALTK-Evolve 在 AppWorld 上对 8 个模型的评估发现,智能体记忆的合适用量因模型而异,并非注入越多越好。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。
Google Research 研究发现,在 WikiProfile 测试中,前沿大语言模型的事实性瓶颈更多来自已编码知识无法被可靠回忆,而非知识缺失。该基准包含 2,150 条维基百科事实,每条配有 10 项任务;Gemini-3-Pro 和 GPT-5 已编码 95–98% 的事实,却无法直接回忆其中 26–34% 的事实,启用思考后仍有 11–12% 的事实回答失败。
推荐理由:将事实未被编码与已编码却无法回忆分开诊断,为判断事实性改进应侧重扩充知识还是提升已有知识利用率提供了依据。
ALTK-Evolve 在内部 AppWorld 对比测试中,以更少的推理 token 达到或超过 ACE 的任务表现。使用 DeepSeek-V3.2 时,TGC 从 80.4 升至 89.3,每任务 token 从 634K 降至 263K。两者均从智能体历史轨迹积累经验,但前者按模型能力调整经验注入量,ACE 每步注入完整经验手册。
Thinking Machines Lab 开放多模态模型 Inkling,并新增同架构的 Inkling-Small,原生接收图像、文本和音频输入。Inkling 总参数为 975B、激活参数为 41B,支持 1M 上下文窗口;Inkling-Small 总参数为 276B、激活参数为 12B,提供 MXFP8 和 NVFP4 权重。
推荐理由:不同精度版本的显存需求与部署配置并列呈现,为比较完整模型和小型版本的硬件门槛提供了具体依据。
Mistral 发布 Leanstral 1.5,这款面向 Lean 4 证明工程的模型总参数为 119B、激活参数为 6B,以 Apache-2.0 许可开放权重并提供免费 API。
推荐理由:从数学竞赛题到真实代码缺陷,材料给出了形式化验证的成本对比与工程案例,便于判断证明模型进入开发流程的实用价值。
伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。
Google Research 发布表格基础模型 TabFM,通过上下文学习对未见过的表格进行分类与回归,无需针对新任务训练模型或调参。模型完全使用数亿个合成数据集训练,结合行列交替注意力、行压缩与 Transformer 架构,标准配置通过单次前向传播生成预测,另提供加入交叉特征、SVD 特征的 32 路集成配置 TabFM-Ensemble。
推荐理由:把表格预测改为上下文学习,为减少逐数据集训练和调参提供了不同路径,文中还区分了直接预测与加入特征工程的集成配置。
Google Research 为冻结权重的 Gemini Nano v3 加装多 token 预测(MTP)头,相关加速方案已部署至 Pixel 9 和 10 系列。
Google Research 的研究发现,链式推理可帮助大语言模型召回关闭推理时难以获取的简单事实,作用机制包括计算缓冲与事实启动。
推荐理由:研究将事实召回收益拆解为额外计算与相关事实启动两种机制,为理解简单问答为何也能受益于链式推理提供了实验依据。
Google DeepMind 发布实验性开放模型 DiffusionGemma,以 Apache 2.0 许可提供权重,在专用 GPU 上实现最高 4x 的文本生成速度。
推荐理由:本地低并发与高并发云端的收益差异交代清楚,能帮助开发者结合输出质量取舍判断文本扩散是否适合自己的工作负载。
Mistral 发布公开预览版 Mistral Medium 3.5,并将其设为 Vibe 和 Le Chat 的默认模型,支持云端编码智能体与多步骤 Work mode。
推荐理由:本地会话连同任务状态和审批记录迁至云端的设计,为长任务异步执行与保留人工审查之间的衔接提供了具体参考。
剑桥大学教授 Clare Bryant 利用 Co-Scientist 寻找病原体跨物种传播后引发人类重症的分子开关,将研究假设细化至特定氨基酸。团队正构建含相关氨基酸突变的细胞系以验证假设;若靶点正确,原需两到三年的实验工作有望在六个月内完成。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。
推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。
自适应并行推理将何时拆分任务、启用多少并发线程及如何协调的决策交给模型,而非依赖外部预设结构。现有并行方法可让多条推理路径同时展开,但常受固定并行规模或搜索策略限制。自适应控制旨在按问题选择并行方式,避免简单任务浪费计算、复杂任务拆分不当。
Google DeepMind 宣布 AI co-clinician 研究计划,探索让 AI 在医生监督下辅助临床决策,并通过实时音视频与患者互动。系统在 98 个真实情境式初级诊疗问题中有 97 个未出现关键错误;在模拟远程问诊评估的 140 项能力中,68 项达到或超过初级保健医生水平,但医生总体表现更好,尤其在识别危险信号和指导关键体格检查方面。
推荐理由:研究将证据检索与远程问诊分开评估,呈现了医疗智能体在信息支持上的进展与临床判断上的差距,为理解医生监督的必要性提供具体依据。
Google Research 在 ICLR 论文中介绍 ReasoningBank,将智能体的成功与失败经验提炼为结构化推理记忆,以支持测试时自我演进。
Google Research 的 Simula 以推理优先、无需种子数据的方法构建完整合成数据集,可分别控制覆盖、多样性、复杂度与质量。研究以 Gemini 2.5 Flash 为教师、Gemma-3 4B 为学生,在五个领域评估,完整系统均优于简化基线。提高数据复杂度有益于数学推理,却损害法律推理表现,数据设计需适配模型能力。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。
推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。
Google Research 介绍向量压缩算法 TurboQuant,在 Gemma 和 Mistral 的测试中将 KV cache 量化至 3 bits,无需训练或微调且不损失模型准确率。
Mistral 发布 Mistral Small 4,以 Apache 2.0 许可开放,将推理、多模态和智能体编码能力整合进单一模型。该模型采用 MoE 架构,总参数为 119B,每个 token 激活 6B 参数(计入嵌入与输出层为 8B),支持 256k 上下文窗口、文本与图像输入,并可通过 reasoning_effort 调节推理强度。
推荐理由:将可调推理、图像输入与编码能力放进同一开放模型,为需要兼顾多类任务与部署效率的团队提供了减少模型切换的选型思路。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库任务,以 Apache 2.0 许可开放权重,并接入 Mistral Vibe。
推荐理由:基于真实形式化仓库任务的评测同时列出得分与运行成本,为比较专用模型和通用编码智能体的证明工程取舍提供了依据。