跳到正文

#部署/工程

今日 12 条
8月10日周一
  1. Hugging Face Blog49

    Hugging Face 解析如何降低知识蒸馏成本以支持规模化实验

    Hugging Face 展示离线缓存教师模型输出与融合分块 KL 损失如何降低知识蒸馏成本,让单 GPU 长上下文能力恢复训练成为可能。该方法缓存每个位置的 top-100 logits,训练时无需加载教师模型;融合分块计算避免构建完整词表与序列矩阵,示例中显存峰值从约 250GB 降至约 128GB。

8月6日周四
8月4日周二
  1. Microsoft Research69

    微软研究院 Orchard:以可复用环境支持规模化 AI 智能体训练的开源框架

    微软研究院推出开源框架 Orchard,通过可复用的 Orchard Env 环境服务,支持软件工程、网页导航和个人助理智能体的训练与评估。该服务基于 Kubernetes,可直接在 Codex、OpenClaw、ZeroClaw 等实际部署框架内训练智能体,并配套开放训练流程、数据和评估方法。

    推荐理由:将运行环境独立为可复用服务,并在实际部署框架内训练智能体,为减少跨任务基础设施重复建设和训练部署差异提供了具体路径。

7月30日周四
  1. Hugging Face Blog29

    GPU 管理:为什么闲置 GPU 如同停飞的飞机

    企业 AI 的下一道关键瓶颈正转向 GPU 利用率:硬件持续产生成本,只有有效计算才能带来产出。API 成本随 token 用量线性增长,自购 GPU 则以固定资本投入替代可变支出。集群按峰值需求配置,但实际需求并不持续,购入硬件后能否让其有效运转,决定了投入是否值得。

7月29日周三
7月27日周一
  1. Hugging Face Blog60

    NVIDIA 发布 Cosmos-H-Dreams,将实时生成式仿真引入手术机器人

    NVIDIA 发布手术机器人生成式仿真模型 Cosmos-H-Dreams,通过知识蒸馏和 FlashDreams,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 帧/秒的闭环交互。

    推荐理由:从离线轨迹生成转向实时闭环交互的技术路径,为理解手术机器人仿真如何同时降低生成成本与应对长序列误差提供了具体参考。

7月23日周四
7月16日周四
  1. Hugging Face Blog83

    Hugging Face 披露 2026 年 7 月安全事件:自主 AI 智能体入侵生产基础设施

    Hugging Face 披露,本周早些时候发现自主 AI 智能体系统入侵部分生产基础设施,有限的内部数据集及若干服务凭据遭未授权访问。攻击通过恶意数据集利用数据处理中的两条代码执行路径进入系统并横向移动;相关路径已关闭、受影响凭据已撤销并轮换,合作伙伴或客户数据是否受影响仍在评估,未发现公开模型、数据集或 Spaces 被篡改的证据,软件供应链经核验未受污染。

    推荐理由:托管模型的安全护栏阻断了真实攻击日志分析,这次响应经历为防守方提前准备本地取证模型提供了具体参考。

7月15日周三
  1. Hugging Face Blog79

    Thinking Machines Inkling 登陆 Hugging Face,新增 Inkling-Small 版本

    Thinking Machines Lab 开放多模态模型 Inkling,并新增同架构的 Inkling-Small,原生接收图像、文本和音频输入。Inkling 总参数为 975B、激活参数为 41B,支持 1M 上下文窗口;Inkling-Small 总参数为 276B、激活参数为 12B,提供 MXFP8 和 NVFP4 权重。

    推荐理由:不同精度版本的显存需求与部署配置并列呈现,为比较完整模型和小型版本的硬件门槛提供了具体依据。

7月10日周五
7月9日周四
  1. Mistral AI47

    提示词和技能需要统一记录系统:Mistral Studio 的治理方案

    Mistral Studio 现为客户提供提示词和技能的统一记录系统,集中管理版本、归属与追溯信息。系统支持不可变版本、版本比较与回滚、分类标签及审计日志,允许非开发人员即时编辑和测试,生产变更仍须经过既有测试与审批。Observability 可将生产输出追溯至资产版本,技能可直接作为 MCP 服务器访问。

7月8日周三
7月7日周二
  1. Berkeley AI Research53

    智能趋近免费之后,数据系统如何服务、承载并由 AI 智能体构建?

    Berkeley AI Research 的观点文章提出,推理成本趋近零将推动数据系统沿服务智能体、承载智能体群和由智能体构建三个方向演进。在文中引用的多智能体 text-to-SQL 实验中,80-90% 的子查询执行重复工作,为结果复用与近似查询提供了优化空间。作者结合自身研究,讨论了结构化纠错记忆、共享状态并发与故障处理,以及通过辅助验证智能体和正确性证明应对定制数据系统的规范缺漏问题。

  2. Hugging Face Blog62

    LeRobot v0.6.0 发布:整合世界模型策略、奖励评估与部署纠正流程

    LeRobot v0.6.0 将世界模型策略、统一奖励模型 API、仿真评测与部署纠正流程整合进机器人学习闭环。版本接入 VLA-JEPA、FastWAM、LingBot-VA,并新增 6 个仿真基准,统一通过 lerobot-eval 运行;lerobot-rollout 支持 DAgger 式人工接管,将纠正数据用于后续微调。

    推荐理由:部署时记录人工纠正并直接用于下一轮微调,把失败采集接回训练流程,为机器人策略持续改进提供了可复用路径。

7月6日周一
  1. Hugging Face Blog43

    PRX 第 4 部分:训练数据策略

    PRX 团队将公共与内部数据集混合,用 VLM 重新生成图像描述,构建用于训练的流式语料。其 7B 模型预训练重视覆盖面与多样性,采用准确的长描述和轻量过滤。数据管线用 Lance 整理、MDS 流式读取;改用 Qwen3-VL 后,训练时实时计算文本潜在表示,吞吐量代价约为 3–4%。

  2. Hugging Face Blog47

    Hugging Face Kernels 重大更新

    Hugging Face Kernels 完成重大更新,新增 Hub 内核仓库类型,强化安全机制并扩展框架支持。默认仅加载可信发布者的内核,已支持代码签名及手动验证,但加载时尚不验签。此次还重整 CLI,新增 Torch Stable ABI 与 Apache TVM FFI 支持,为跨框架内核和 AI 智能体开发奠定基础。

7月1日周三
  1. Hugging Face Blog58

    ScarfBench:评测 AI 智能体的企业 Java 框架迁移能力

    ScarfBench 是面向企业 Java 跨框架迁移的开放基准,评测中表现最强的智能体在行为验证环节的成功率仍低于 10%。它覆盖 Spring、Jakarta EE 和 Quarkus,包含 34 个应用、102 个框架实现、204 项迁移任务及 1,331 项专家编写的测试,要求迁移后的应用通过构建、部署和行为验证,而非仅与参考代码比较。

6月29日周一
  1. Import AI51

    Import AI 第463期:机器人自主改进、腾讯万卡 GPU 集群与人类时代的挽歌

    NVIDIA 研究团队开发 ENPIRE,将编码智能体的实验与改进闭环用于实体机器人,研究报告称其可在部分灵巧操作任务上达到 99% 成功率。腾讯披露训练追踪与性能诊断系统 ARGUS,已在超过 10,000 张 GPU 的生产集群运行超过 6 个月,但机器人集群的资源利用与并行扩展仍是 ENPIRE 面临的工程挑战。

6月27日周六
6月25日周四
6月24日周三
  1. Mistral AI48

    Mistral AI 增强 Connectors 管控能力

    Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。

6月23日周二
  1. Mistral AI68

    Mistral 发布 OCR 4:支持 170 种语言,新增边界框、块分类与置信度

    Mistral 发布文档理解模型 Mistral OCR 4,在提取文本的同时返回边界框、块类型及逐页、逐词置信度,支持 10 个语言组的 170 种语言。官方报告其在人类盲评中的平均胜率为 72%,OlmOCRBench 得分为 85.20,同时说明自动基准存在标注与格式匹配局限,竞品分数来自内部复现。

    推荐理由:边界框、块类型和置信度让文档提取结果能同时用于定位引用与安排人工核验,为检索和智能体流程提供更明确的输入结构。

6月17日周三
  1. Google DeepMind52

    Google DeepMind 与英国政府共建 AI 规划审批原型,目标将房主申请处理时间减半

    Google DeepMind 正与英国政府等合作,开发基于 Gemini 的规划审批原型,目标将房主规划申请的决策时间缩短 50%。工具可整合资料、核对政策并提供引用、汇总咨询反馈及起草评估报告,由规划官员逐行审核并保留最终决定权,同时记录各步骤供审计。原型在 Barnet、Camden 和 Dorset 开展早期试验后,政府计划从 2027 年起向全国地方议会提供。

5月28日周四
  1. Mistral AI56

    Mistral 在 AI Now Summit 2026 展示工业工程 AI 栈、Vibe 更新与数据中心计划

    Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。

  2. Mistral AI80

    Mistral 将 Le Chat 升级为 Vibe,统一办公与编码智能体

    Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。

    推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。

  3. Mistral AI59

    Mistral AI 发布开源 Search Toolkit 公共预览版,整合搜索管线

    Mistral AI 今天发布 Search Toolkit 公共预览版,以统一接口整合 AI 应用搜索管线的数据摄取、检索与评估,开源并支持云端、本地和边缘部署。框架支持文档解析、分块、嵌入向量生成,以及 BM25、稠密向量和混合检索,内置召回率、精确率、MRR 和 NDCG 指标,可独立衡量检索器表现。入门应用模板提供预配置的 Vespa 索引、混合检索和示例数据摄取管线。

  4. Google Research47

    Google 通过零信任聚合实现隐私分析

    Google 将新密码学聚合协议与可信执行环境结合,用于隐私分析,确保仅获取匿名化的群体聚合结果。设备只需发送一次消息,无须为多轮交互持续在线,个人原始数据不会在任何服务器内存中暴露或重建。该方案已集成至 Google 的机密联邦分析系统,并通过硬件证明验证协议按预期执行。

5月27日周三
  1. Mistral AI48

    Mistral 推出物理 AI:为工程加速奠定基础

    Mistral 将 Emmi AI 纳入旗下,正为企业解决方案构建物理 AI 能力,以加速工业工程设计与运行分析。此类模型从物理求解器输出中学习,可在单个 GPU 上以秒级速度预测物理场,传统求解器仍用于验证和边缘情况。其应用方向包括产品设计、工装与工艺优化,以及实时数字孪生。

5月22日周五
5月6日周三
  1. Google DeepMind74

    AlphaEvolve 如何将 Gemini 驱动的编码智能体应用扩展至科研、基础设施与商业领域

    Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。

    推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。

4月27日周一
  1. Mistral AI64

    Mistral AI 发布企业 AI 编排层 Workflows 公开预览版

    Mistral AI 发布 Workflows 公开预览版,作为 Studio 内的企业 AI 编排层,提供持久执行、可观测性、容错和人工审批能力。开发者用 Python 编写流程,可发布到 Le Chat 供业务团队触发,并在 Studio 中追踪审计;货物放行、文档合规检查和客服分流已有生产应用。

    推荐理由:通过暂停审批、故障续跑和执行追踪的业务案例,具体呈现企业把 AI 流程从原型搬到生产时需要补齐的编排能力。

4月22日周三