Import AI 474:柏拉图式心智空间、太空 TPU 与智谱的递归自我改进外层循环
Import AI 第 474 期汇总了 Michael Levin 的柏拉图式心智空间假说、Google 将 TPU 送入太空的准备,以及智谱用 GLM-5.3 优化自身推理基础设施的实践。
Import AI 第 474 期汇总了 Michael Levin 的柏拉图式心智空间假说、Google 将 TPU 送入太空的准备,以及智谱用 GLM-5.3 优化自身推理基础设施的实践。
Radical Numerics 联合创始人兼 CEO Eric Nguyen 在访谈中将生物安全视为 AI 军备竞赛,认为防御目前落后,而增强基因组语言模型能力也能帮助防御跟上。
John Platt 在访谈中介绍 Google 的 Empirical Research Assistance(ERA),并强调自动优化科学任务评分不能替代科学判断。
TypeSafe AI CEO Diogo Almeida 在访谈中将 Jev 定位为供代码直接使用的 System One 模型,强调软件集成、可靠性与单位成本的智能水平。
非生成式决策模型 Jev 发布后两天内出现 6 个仿制项目,路线涵盖 ModernBERT、扩散模型及 Qwen 微调。
Good Start Labs 的实验显示,部分游戏训练可改善 AI 在真实工作任务基准上的表现,但迁移范围与可靠性仍是开放问题。在铁路策略游戏 1830 中训练的 30B 模型,采用单轮问答和多轮终端智能体两种设计均改善了游戏内表现,但只有后者提升了 Finance-Agent 基准成绩。
多所大学的研究人员开发了 SPADE,通过自博弈交替生成可执行训练环境并学习求解,提升模型在游戏和工具使用任务中的表现。在游戏评测中,30B-A3B 规模模型的套件平均分达 58.3,较基础模型提高 8.1,较最强固定环境基线提高 5.3。该方法仍受限于生成环境所用基础模型的想象能力。
Import AI 本期聚焦 AI 的发现与科研能力,介绍 DiG-bench、递归自我改进模拟游戏及 Inherent 的 Faraday。DiG-bench 包含 70 个游戏,搭配 Claude Code 的 Opus 5 和 Fable 5 总体表现最佳。Faraday 通过监督框架和较小的 LLM 控制大型闭源前沿模型,以提高科研效能。
Import AI 第 468 期汇总 AI 研发自动化与风险治理进展,包括 IFP 针对递归自我改进(RSI)的 23 项政策建议、Intology 的 PostTrainBench+ 结果及企业协调减速研究。
Dharma AI 从优化理论、生物演化与市场竞争出发,论证专业化为何是高效 AI 系统的重要方向。无免费午餐定理指出,没有通用优化算法能在所有可能问题上胜过其他算法。在算力、数据与开发时间有限的条件下,聚焦目标任务比无限扩展任务范围更有利于取得高性能。
NVIDIA 研究团队开发 ENPIRE,将编码智能体的实验与改进闭环用于实体机器人,研究报告称其可在部分灵巧操作任务上达到 99% 成功率。腾讯披露训练追踪与性能诊断系统 ARGUS,已在超过 10,000 张 GPU 的生产集群运行超过 6 个月,但机器人集群的资源利用与并行扩展仍是 ENPIRE 面临的工程挑战。
Import AI 第 462 期汇总 AI 说服力、自我维持能力及 ASI 路径研究,其中说服实验覆盖 6,923 人的 18,978 次对话,AI 整体表现超过人类专家。
非营利研究组织 Sequent 成立,认为对齐研究未必能赶上超级智能的发展,计划以多条并行研究路线提高安全信心,初期筹资目标为 $100–150M。Cognition 的 FrontierCode 包含 150 项编码任务,强调代码可合并性,Claude Opus 4.8 在最难的 Diamond 部分得分为 13.4%,文中另补充 Claude Fable 已达约 30%。
SocioHack 研究用 72 个社会制度沙盒测试 AI 钻规则漏洞的能力,强化学习使模型在没有直接利用漏洞指令的情况下,以 61.25% 召回率和 90.85% 精确率重新发现历史漏洞。
Import AI 第 459 期汇总 AI 监督、蛋白质折叠模型扩展规律与灭绝风险定价,英国 AI Security Institute 的研究指出自动化对齐研究的错误可能比人类研究更难识别。
Import AI 本期汇总了 fast16.sys 篡改精密计算软件的调查、Muon 优化器导致神经元失活的研究,以及推动人类福祉的正向对齐主张。Tilde Research 报告称,Muon 在训练第 500 步时已有超过四分之一的神经元实际失活,其提出的 Aurora 在小规模实验中降低了损失,MMLU 得分较 Muon 提高 10 分。
Institute for Law & AI 研究者提出“激进选择权”治理思路,主张避免短期过度监管,同时提前建设应对 AI 巨变的能力。建议涵盖信息披露、举报人保护、灵活规则和安全评估。Meta 与 KAIST 的 Neural Computers 论文探索让神经网络充当传统计算机,在学习得到的运行时状态中统一计算、内存与 I/O。
Jack Clark 预计,到 2028 年底,前沿模型自主训练其后继版本、实现无人参与 AI 研发的概率约为 60%,2027 年实现的概率为 30%。他综合编码、长时任务、论文复现、模型后训练和多智能体管理等进展,判断 AI 已能自动化大量研发工程工作,但研究所需的创造力与突破性洞见仍是关键不确定因素。
Google Research 通过全球科研合作、开源工具与开放数据集,已支持全球超过 250,000 名研究人员和开发者。其与 UCSC 基因组研究所合作改进泛基因组参考,将遗传变异识别错误减少 50%。包含 MedGemma 的开放权重医疗模型套件 HAI-DEF 下载量已超过 4.8M。