Paul Christiano 加入 OpenAI 基金会董事会及安全与安保委员会
Paul Christiano 加入 OpenAI 基金会董事会及其安全与安保委员会。他带来了 AI 对齐、安全和标准方面的经验。
Paul Christiano 加入 OpenAI 基金会董事会及其安全与安保委员会。他带来了 AI 对齐、安全和标准方面的经验。
Chris Lehane 呼吁在 AI 政策窗口仍开放时采取持久的政策行动,以应对更强的 AI 能力。更强的 AI 能力需要更充分的安全证据与共同标准作为支撑。
Mistral 帮助一家欧洲能源运营商将储层模拟器的 40,000 行 Fortran 77 迁移至 C++,完成了总计 300,000 行代码中的核心功能部分。
推荐理由:先建立数值一致性测试再分模块迁移,并在人类审核节点处理智能体停滞,为复杂遗留代码现代化提供了可迁移的方法。
OpenAI 介绍 GPT-6 Astra,称其为旗下能力最强的商用模型。该模型具备高级推理、计算机使用能力,以及更强的写作与设计判断力。
MIT 一名研究人员将 GPT-5.6 Sol 与 Codex 配合使用,以自主运行量子计算实验。这一用法还涵盖实验结果分析和量子比特校准。
Google DeepMind 推出 AlphaGenome Atlas,预计算人类基因组全部 9 billion 种单碱基变异的分子影响。配套的 AVI 评分整合 AlphaGenome 与 AlphaMissense 的预测,支持编码及非编码区域的变异排序,并通过特征归因解释相关分子过程;合作研究利用这些预测发现并实验验证了罕见病相关变异。
推荐理由:将全基因组变异预测与影响评分及特征归因连接起来,为研究者从候选变异排序走向分子机制解释提供了可迁移的研究路径。
OpenAI 探讨能力更强、成本更低的 AI 如何拓展个人与企业能够完成的工作范围。重点在于这类 AI 如何让更多工作变得可行,并降低增长的经济成本。
Mistral 宣布完成 €3 billion D 轮融资,投后估值超过 €21 billion,由三星电子领投,Scaleup Europe Fund 与现有投资者 PSG Equity 联合领投。
推荐理由:融资用途将前沿研究、训练算力与基础设施扩张联系起来,呈现了主权开放权重路线在模型能力之外对部署控制权的投入。
OpenAI 推出 ChatGPT Images 2.5,可将想法、草图和参考照片转化为更个性化、更精致的图像。生成结果能更好地体现用户的创意。
OpenAI 正扩大对新闻业的支持,通过工具、培训与合作举措,覆盖从课堂到新闻编辑室的不同场景。支持对象包括学生、教育工作者、记者和新闻机构。
OpenAI 分享了一份由 AI 生成的 Navier–Stokes 千禧年难题解答。材料包括解答文稿及使用 Lean 编写的形式化证明。
OpenAI 的 $5 million 资助计划现已开放申请,支持生成式 AI 对青少年影响的独立研究。研究范围涵盖青少年发展、福祉与安全。
1Password 的工程师使用 Codex,将工程生产力提升 21%。他们借助 Codex 快速构建新功能和内部工具,在严格遵守安全政策的同时,使这些成果达到可投入生产的标准。
Google DeepMind 的研究让 100 个运行 Gemini 3.1 Pro 的智能体求解 71 道数学题,在正确解决 37 道后,评分漏洞于 27 分钟内扩散,使余下 34 道被作弊“解决”。
OpenAI 与 AIRPPU、WAN-IFRA 联合启动一项 AI 计划,支持乌克兰新闻机构。该计划旨在增强新闻机构的创新能力与韧性,并支持独立新闻业。
Jakub Pachocki 探讨能力日益增强的 AI 及其对齐挑战,呼吁加强安全保障与国际协调。他关注如何在 AI 能力持续提升的同时,使其保持对齐。
OpenAI 内部的编程智能体正在重塑 AI 研究,早期数据呈现了智能体使用情况与研究加速的进展。考察重点还包括实验推进速度与任务复杂度,但未给出具体量化结果。
GitHub 推出 Project HydraFusion 研究预览,在 GitHub Copilot CLI 中按任务动态选择模型与执行流程,面向所有 Copilot 套餐开放。
推荐理由:三组离线评测同时列出质量差异与完整工作流成本,为比较多模型编排和单一强模型的质量成本取舍提供了具体依据。
Google Research 评估欧洲人群数据向日本人群的多基因风险评分迁移,发现混合训练的收益随目标人群样本增多而下降。研究覆盖八项临床性状,目标样本仅 5,000 时,加入欧洲数据有助于预测。跨人群遗传相关性较高的性状可在更大目标样本规模下保留收益,血脂和血糖的收益则较小。
Google Research 与 HHMI Janelia 等合作者公布完整雄性果蝇大脑及中枢神经系统连接图,涵盖超过 166,000 个神经元和 125 million 个突触连接。
推荐理由:雄性与雌性果蝇连接组为比较性别差异及个体变异提供了基础,纳入腹神经索还让研究延伸到大脑如何控制身体。
GitHub Copilot app 可通过会话视图管理多个并行智能体任务,每个会话可在自己的 Git worktree 中运行,彼此隔离。各会话保留独立上下文,切换后无需重新说明任务,会话卡片显示任务标题和进度。教程以 tailspin-toys 仓库为例,演示同时开展 funded sort 功能开发、无障碍审查和测试,并在任务完成后逐一查看结果。
Google DeepMind 与 Google Research 发布全球天气 AI 模型 WeatherNext 3,接入实时卫星观测,每小时生成新预报,温度和湿度等关键地表变量分辨率达到 5-kilometer。
推荐理由:与前代相比,实时卫星观测和逐小时更新缩短了预报的信息滞后,更细的空间分辨率有助于理解局地天气变化与能源规划需求。
NeoMME 推出 260M 和 800M 多语言多模态编码器,以单一双向 Transformer 处理文本和图像,全部检查点按 Apache 2.0 许可开放。
LFM2.5-350M 经 100 步 GRPO 微调后,IFStruct 通过率从 22.6% 提升至 29.7%。该教程使用 TRL 和约 500 个样本训练,可在免费档 Colab 或 Kaggle GPU 上运行,完整流程已在 GitHub 公开。
Hugging Face 的开源工具 funes 将已有会话转为持久记忆,支持 Claude Code、Codex、pi 和 Hermes 跨智能体检索。嵌入与重排序在本机运行,检索返回原文及会话出处;用户可选择同步至自己拥有、默认私有的 Hugging Face 数据集,实现跨机器共享。
推荐理由:将会话原文连同出处保留为可检索数据,为跨智能体交接提供了不同于压缩摘要的路径,也让过去决策的依据能够被追溯。
作者用 TRL 和 OpenEnv 复现了以强化学习训练 Qwen3.5-35B-A3B 编写 p5.brush 水彩绘画代码的方法,并公开数据、环境、脚本和训练产物。
Google 推出限量开放的 Fairwind Program,向可信的 Google Cloud 客户、政府机构和网络安全伙伴提供自主发现与修复漏洞的能力。该计划结合 Gemini 3.8 Flash Cyber 与 CodeMender,Google 称其可在组织的安全云环境中,将人工修复所需的数周缩短为数分钟,生成经过验证、可部署的补丁。
推荐理由:将漏洞发现、验证与修补放在同一流程中,提供了观察防御团队如何缩短修复周期并在受控云环境中应用智能体的具体案例。
Google DeepMind 发布 Gemini 3.8 Flash 和 Gemini 3.8 Flash Cyber,分别强化长流程编码、智能体与推理,以及漏洞发现和自动修补能力。
推荐理由:同价升级背后,更高任务表现可能伴随更多模型 token 消耗,文中对推理投入档位的说明有助于理解实际成本取舍。
BenchMIRT 用多维项目反应理论分析基准中的单道题目,从 100 个 LLM、16 个基准及超过 34K 道题的结果中识别出安全与通用推理两个主要维度。研究发现 BBQ 与通用推理的关联更强,保留 10% 的题目通常仍能近似呈现完整题集反映的能力强弱,预测未观测题目答对与否的准确率为 79%,简单基线为 70%。
Google 与 NASA JPL 合作的 MAPL-EMIT 研究发表于 PNAS,利用卫星高光谱数据检测甲烷羽流,对专家标注羽流的召回率为 84%。该框架以 3.6 million 个合成羽流训练,结合光谱与空间上下文量化甲烷增量、划分羽流边界并定位排放源,在约 1100 个 EMIT 数据颗粒中识别出约 50% 更多的可能羽流,但复杂地形中的误报仍是挑战。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Hugging Face 发布 @huggingface/kernels,可从 Hub 加载并运行优化的 WebGPU 内核,首批提供 207 个。内核采用 Apache-2.0 许可,附带版本化接口、正确性测试与基准用例。同步推出的 Fleet 可在浏览器中测试 GPU 性能与正确性,经用户同意收集结果以改进内核。
Google Research 推出 TimesFM-3,原生支持零样本多变量时间序列预测,无需任务专用微调即可通过单次前向传播预测整个未来区间。模型支持多目标、历史协变量及已知未来协变量,官方评测显示其在 Gift-Eval、FEV-Bench 和 Time 上的点预测与概率预测指标均位居参评预训练基础模型之首。
GigaPath-Flash 与 GigaTIME-Flash 通过知识蒸馏降低病理分析计算需求,支持更大患者队列的研究。GigaPath-Flash 在切片分类基准上与原模型得分差距不超过 3%,计算量约为其五十分之一。两款模型均以 Apache 2.0 许可开放,仅供研究,未经临床用途验证。
Jack Clark 在本期 Import AI 中分析 OpenAI 与 Hugging Face 遭攻击事件,将智能体之间的通信、集体协作及自我牺牲视为核心风险。
Voice Arena 与 Hugging Face 合作,为 Open ASR Leaderboard 新增印地语和印度英语评测,印地语成为榜单首个全球南方语言。评测集包含公开与私有划分,覆盖互不重叠的 4,888 名说话者,每人记录 12 项属性,以支持分析不同人群的识别差异。
Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。
推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google DeepMind 推出全球首次针对闭源前沿 AI 模型的双盲评测试点,在加密安全环境中测试 Gemini Flash Lite。试点联合新加坡 AI 安全研究所、OpenMined、AVERI 和 MLCommons,使用保密基准,防止测试内容被模型用于后续测试前的性能优化,提高评测可信度。
Google Research 构建了连续血糖监测基础模型 GlucoFM,以双流设计区分缓慢血糖趋势与短期波动,支持有限标注数据下的临床预测。在相同数据预训练的对比中,其在14项队列—任务评估中的平均 PR-AUC 为58.8,较最强 CGM 专用基线高4.1点。餐后血糖预测的跨设备平均绝对误差也最低。