Microsoft Research 研究机器人推理卸载,比较机载与边缘、云端计算
Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。
Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。
Quantization-Aware Healing(QAH)使压缩至 60B 的 GPT-OSS 120B 模型在量化为 MXFP4 后,在 9 项基准中的 7 项超越同架构的 bfloat16 恢复版本。QAH 直接从压缩前的原始模型蒸馏,而非从恢复后的检查点蒸馏,避免受后者精度上限约束。
Hugging Face 展示离线缓存教师模型输出与融合分块 KL 损失如何降低知识蒸馏成本,让单 GPU 长上下文能力恢复训练成为可能。该方法缓存每个位置的 top-100 logits,训练时无需加载教师模型;融合分块计算避免构建完整词表与序列矩阵,示例中显存峰值从约 250GB 降至约 128GB。
IBM Research 基于 Berkeley Sky Lab 的 K-Search 扩展 MLX 后端,以结构化 CUDA-to-MLX 翻译层将内核优化知识迁移到 Apple Silicon。
ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。
Google Research 的线性弹性缓存在 Spanner 生产环境中将内存使用量降低15.5%,总拥有成本降低约5%。该方法将缓存页面淘汰建模为滑雪租赁问题,用轻量级决策树预测页面存活时间,动态调整缓存大小。缓存未命中增加5.5%,但集中于读取成本较低的数据,实际 I/O 成本仅增加0.5%。
Google DeepMind 在新论文中提出 Decoupled DiLoCo,通过计算集群间的异步数据流隔离局部故障,实现低带宽跨数据中心训练。团队使用 2-5 Gbps 广域网络,在美国 4 个区域完成了一个 12 billion 参数模型的训练,速度比传统同步方法快 20 倍以上。
Google Research 介绍向量压缩算法 TurboQuant,在 Gemma 和 Mistral 的测试中将 KV cache 量化至 3 bits,无需训练或微调且不损失模型准确率。