Pollen Robotics 发布 Grabette:开源机器人操作数据采集系统
Pollen Robotics 发布开源低成本系统 Grabette,可用手持夹爪记录操作示范,无需机器人即可采集并自动转换为 LeRobot 数据集。Grabette 的物料成本约为 ~490€,配备双摄像头,支持通过浏览器处理数据、恢复 6-DoF 轨迹并上传至 Hugging Face Hub。
Pollen Robotics 发布开源低成本系统 Grabette,可用手持夹爪记录操作示范,无需机器人即可采集并自动转换为 LeRobot 数据集。Grabette 的物料成本约为 ~490€,配备双摄像头,支持通过浏览器处理数据、恢复 6-DoF 轨迹并上传至 Hugging Face Hub。
Google DeepMind 启动 ATL Saathi 网页应用试点,为印度首批 100 所试点学校的 ATL 教师提供由 Gemini 驱动的 24/7 规划与培训助手。应用提供 12 个核心模块的学习材料,支持 8 种语言,并利用 Gemini 3.5 Flash 生成符合年级与课程要求的项目创意、组装步骤及安全注意事项。
Mistral Studio 现为客户提供提示词和技能的统一记录系统,集中管理版本、归属与追溯信息。系统支持不可变版本、版本比较与回滚、分类标签及审计日志,允许非开发人员即时编辑和测试,生产变更仍须经过既有测试与审批。Observability 可将生产输出追溯至资产版本,技能可直接作为 MCP 服务器访问。
HuggingFace 更新了 vLLM 的 transformers 建模后端,在测试的 3 款 Qwen3 模型上,吞吐量均达到或超过 vLLM 手写原生实现。
Hugging Face 与 Amazon SageMaker AI 推出深度链接集成,支持从模型页面一键进入 Studio 微调或部署流程。所选模型会预加载,新环境自动配置权限,实例选择列表直接显示 GPU 配额。该体验现已可用,仅适用于受支持模型。
Microsoft Foundry 的 Hugging Face Collection 现已开放预览,提供数千个跨模态模型,每周更新,可一键部署至 Foundry Managed Compute。
LeRobot v0.6.0 将世界模型策略、统一奖励模型 API、仿真评测与部署纠正流程整合进机器人学习闭环。版本接入 VLA-JEPA、FastWAM、LingBot-VA,并新增 6 个仿真基准,统一通过 lerobot-eval 运行;lerobot-rollout 支持 DAgger 式人工接管,将纠正数据用于后续微调。
推荐理由:部署时记录人工纠正并直接用于下一轮微调,把失败采集接回训练流程,为机器人策略持续改进提供了可复用路径。
Hugging Face 与 SkyPilot 联合将 Hugging Face Storage 接入 SkyPilot,让 AI 任务跨云读取 Hub 数据而无需支付存储端流出费。
Hugging Face Kernels 完成重大更新,新增 Hub 内核仓库类型,强化安全机制并扩展框架支持。默认仅加载可信发布者的内核,已支持代码签名及手动验证,但加载时尚不验签。此次还重整 CLI,新增 Torch Stable ABI 与 Apache TVM FFI 支持,为跨框架内核和 AI 智能体开发奠定基础。
Hugging Face 与 Cerebras 展示了接入 Gemma 4 的实时语音到语音演示,以开放、模块化架构和快速推理改善对话响应。流程由 NVIDIA 的 Parakeet 识别语音,在 Cerebras 上运行 Google DeepMind 的 Gemma 4 31B,再由阿里的 Qwen3TTS 生成语音,各组件均可替换。
Every Eval Ever(EEE)与 Hugging Face Community Evals 现已互通,评测结果可展示在模型页面并汇入基准排行榜。转换工具可将 EEE 记录转为所需的 YAML 文件,来源徽章链接至完整评测记录,便于查阅生成配置、评测框架版本和复现说明。
Google DeepMind 将计算机操作作为内置工具集成至 Gemini 3.5 Flash,支持开发者构建跨浏览器、移动端和桌面环境的智能体。
推荐理由:从独立模型转为主模型内置工具,计算机操作可与既有工具调用能力结合,为跨环境自动化提供更集中的开发入口。
Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。
Google DeepMind 正与英国政府等合作,开发基于 Gemini 的规划审批原型,目标将房主规划申请的决策时间缩短 50%。工具可整合资料、核对政策并提供引用、汇总咨询反馈及起草评估报告,由规划官员逐行审核并保留最终决定权,同时记录各步骤供审计。原型在 Barnet、Camden 和 Dorset 开展早期试验后,政府计划从 2027 年起向全国地方议会提供。
Google 在 Gemini Enterprise Agent Platform 提供由 Agentic RAG 驱动的跨语料库检索功能,现已开放公开预览。该框架通过 Sufficient Context Agent 检查检索片段与回答草稿,识别信息缺口并反馈给查询改写环节,推动后续检索。
Google Research 在 GitHub 以 Apache 2.0 许可开源水文建模框架,让研究人员和预报机构使用驱动 Flood Hub 的模型架构训练洪水预报模型。
推荐理由:框架允许气象水文机构保留数据控制权并融入本地资料,已有业务平台的适配案例为接入现有洪水预警流程提供了参考。
Google Research 汇总 I/O 2026 展示的研究与应用进展,涵盖科学发现、健康、端侧 AI、灾害预测及智能体开发等领域。Gemini for Science 将 ERA、Co-Scientist 等研究用于计算实验、假设生成和文献整理,正逐步开放访问,可通过 labs.google/science 登记兴趣。
推荐理由:从科研假设生成到长时程软件工程,材料展示了多智能体研究进入具体工具的路径,有助于理解研究成果与产品工作流的连接。
Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。
Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。
推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。
Mistral AI 今天发布 Search Toolkit 公共预览版,以统一接口整合 AI 应用搜索管线的数据摄取、检索与评估,开源并支持云端、本地和边缘部署。框架支持文档解析、分块、嵌入向量生成,以及 BM25、稠密向量和混合检索,内置召回率、精确率、MRR 和 NDCG 指标,可独立衡量检索器表现。入门应用模板提供预配置的 Vespa 索引、混合检索和示例数据摄取管线。
Google 将新密码学聚合协议与可信执行环境结合,用于隐私分析,确保仅获取匿名化的群体聚合结果。设备只需发送一次消息,无须为多轮交互持续在线,个人原始数据不会在任何服务器内存中暴露或重建。该方案已集成至 Google 的机密联邦分析系统,并通过硬件证明验证协议按预期执行。
Mistral 将 Emmi AI 纳入旗下,正为企业解决方案构建物理 AI 能力,以加速工业工程设计与运行分析。此类模型从物理求解器输出中学习,可在单个 GPU 上以秒级速度预测物理场,传统求解器仍用于验证和边缘情况。其应用方向包括产品设计、工装与工艺优化,以及实时数字孪生。
Mistral 发布公开预览版 Mistral Medium 3.5,并将其设为 Vibe 和 Le Chat 的默认模型,支持云端编码智能体与多步骤 Work mode。
推荐理由:本地会话连同任务状态和审批记录迁至云端的设计,为长任务异步执行与保留人工审查之间的衔接提供了具体参考。
Mistral AI 在 Studio 推出公开预览版 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于模型和智能体调用。连接器支持程序化管理和集中注册,可跨 LeChat 与 AI Studio 复用,Vibe 支持即将到来。
Google 的科研工具 ERA 研究今天发表于 Nature,该工具利用 Gemini 编写和优化科学代码,在多个学科基准上达到专家水平。ERA 根据科学问题与成功指标检索文献、编写代码并评估结果,通过树搜索探索数千种方案;团队现有 8 篇稿件将其用于具体科学问题,包括提前最多 4 周预测美国各州呼吸道疾病住院人数。
推荐理由:以科学问题和成功指标驱动文献检索、代码生成与实验评估的闭环,为将科研代码优化方法迁移到不同学科提供了具体参考。
Google DeepMind 为 Project Genie 新增 Street View 功能,让用户以真实地点影像为起点创建可交互世界。该功能由 Maps Imagery Grounding 支持,目前可选择美国境内地点,并搭配场景风格与角色描述生成环境,未来计划扩展地点覆盖范围。
推荐理由:以街景影像约束生成世界的起始位置,为理解世界模型如何连接真实地点与可交互虚拟环境提供了具体案例。
Google 推出 Gemini for Science,包含 Google Labs 上的 3 款科研实验工具,以及可在 Google Antigravity 中使用的 Science Skills。
Google 将内容透明度与验证工具扩展至 Search、Gemini、Chrome、Pixel 和 Cloud,帮助辨识媒体来源与编辑历史。
推荐理由:将生成内容水印与相机原始内容凭证结合,提供了理解媒体来源的双向思路,而不只是判断一份文件是否由 AI 生成。
剑桥大学教授 Clare Bryant 利用 Co-Scientist 寻找病原体跨物种传播后引发人类重症的分子开关,将研究假设细化至特定氨基酸。团队正构建含相关氨基酸突变的细胞系以验证假设;若靶点正确,原需两到三年的实验工作有望在六个月内完成。
Calico Life Sciences 利用 Co-Scientist 整合衰老生物学研究,提出值得实验检验的新假设。在整合应激反应(ISR)研究中,团队借助它提出代谢调控 ISR 的假设并完善实验设计,实验已取得涉及 ISR 在健康与疾病中作用的新发现,结果计划发表。
Co-Scientist 帮助 MIT 的 Ritu Raman 与波士顿儿童医院的 Ryan Flynn 联结组织建模和细胞表面 RNA 研究,探索 ALS 新路径。它协助梳理文献、提出可检验假设,并按可行性及潜在风险收益排序研究方向。两人正寻找可靶向 ALS 的新型 RNA 机制及潜在 RNA 药物。
Google DeepMind 在 Nature 发表 Co-Scientist 研究,该系统基于 Gemini,通过多智能体协作生成、辩论和迭代科学假设。系统结合科学文献与数据核查,以基于 Elo 的竞赛排序假设;在肝纤维化研究中,其提示的一种药物再利用候选在实验室测试中阻断了 91% 的瘢痕相关反应。
推荐理由:将假设生成、同行式批评与排序迭代拆给不同智能体,并把多数计算用于核查,为科研智能体的工作流设计提供了具体参考。
Google DeepMind 回顾 AlphaEvolve 过去一年的应用进展,这款由 Gemini 驱动的编码智能体已从试点走向核心基础设施,并拓展至多个商业领域。
推荐理由:跨领域案例把算法优化落到了错误率、可行解比例和存储写入量等具体指标上,为识别编码智能体在科研与工程中的应用空间提供参照。
Mistral AI 发布 Workflows 公开预览版,作为 Studio 内的企业 AI 编排层,提供持久执行、可观测性、容错和人工审批能力。开发者用 Python 编写流程,可发布到 Le Chat 供业务团队触发,并在 Studio 中追踪审计;货物放行、文档合规检查和客服分流已有生产应用。
推荐理由:通过暂停审批、故障续跑和执行追踪的业务案例,具体呈现企业把 AI 流程从原型搬到生产时需要补齐的编排能力。
Google Photos 的 Auto frame 已支持三维感知照片编辑,可自动调整符合条件的人物照片的相机视角,并修正广角人像透视畸变。该方法先估计三维点图与相机参数并重新渲染,再用专门训练的潜在扩散模型补全新视角下的缺失区域,同时尽量保留原始可见内容。
推荐理由:相较于只能裁剪或缩放的传统编辑,这种方法通过重建三维场景再补全遮挡区域,将拍摄后的构图调整扩展到相机视角。
Google Research 与纽约大学合作开发研究实验 Vantage,通过 AI 模拟团队对话评估学生面向未来的技能,英文版现已在 Google Labs 开放注册。
推荐理由:通过主动引入冲突等情境来收集技能表现,再用同一量规评价对话,为难以标准化测量的协作能力提供了可借鉴的评估路径。
Google DeepMind 展示由 Gemini 驱动的实验性 AI 指针,并将相关交互原则用于 Chrome 和 Googlebook。其设计结合指向位置、视觉与语义上下文及语音,让用户用“这个”“那个”等简短表达提出请求,实验演示可在 Google AI Studio 体验。
推荐理由:将指向位置、视觉上下文与语音结合的交互设计,为减少用户在不同应用间搬运内容和编写详细提示词提供了具体思路。
Google 宣布 Vibe Coding XR 工作流,结合 Gemini 与基于 Web 的 XR Blocks 框架,称可在不到 60 秒内将自然语言转为具备物理交互能力的 Android XR 应用。
Mistral AI 推出 Forge,让企业基于专有数据构建并持续改进模型,支持预训练、后训练和强化学习。系统支持稠密与 MoE 架构及多模态输入,企业可在自身基础设施环境中运行模型,并使用内部基准、合规规则和领域任务进行评估。Mistral Vibe 等自主智能体可借助 Forge 微调模型、寻找最优超参数、调度任务和生成合成数据,Forge 则负责基础设施并监控相关基准是否出现性能退化。
Google 在 Flood Hub 推出城市突发洪水预测,利用 AI 方法提前最多 24 小时预测城市地区的突发洪水风险。系统使用 Gemini 从公开新闻报道中提取洪灾时间与地点,形成 Groundsource 数据集,并结合全球气象数据训练采用 LSTM 单元的 RNN 模型。
推荐理由:利用新闻报道补足历史洪灾记录的做法,为缺乏传感器数据地区构建预警系统提供了参考,也呈现了数据覆盖对评估的限制。