绕过推理瓶颈:Retrieve-for-Train 如何加速复杂 AI 搜索
Google Research 的 Retrieve-for-Train 框架将离线强化学习探索结果转化为监督数据,实现无需思考 token 的单次查询展开。其 53.9M 参数扩散模型以非自回归方式将查询嵌入向量映射为目标向量集合,训练无需人工标签,并以集合级奖励优化结果多样性与互补性。
Google Research 的 Retrieve-for-Train 框架将离线强化学习探索结果转化为监督数据,实现无需思考 token 的单次查询展开。其 53.9M 参数扩散模型以非自回归方式将查询嵌入向量映射为目标向量集合,训练无需人工标签,并以集合级奖励优化结果多样性与互补性。
Google Research 推出 PaperVizAgent 和 ScholarPeer,分别用于生成学术图表和自动评审论文。PaperVizAgent 在经人类图表校准的 LLM 评测中总分为 60.2,超过设定的人工基线 50.0。ScholarPeer 结合网络文献检索与技术主张核验,在并排评测中优于先进自动评审方案。
Google Research 介绍向量压缩算法 TurboQuant,在 Gemma 和 Mistral 的测试中将 KV cache 量化至 3 bits,无需训练或微调且不损失模型准确率。