跳到正文

#具身智能

今日 0 条
9月24日周四
  1. Microsoft Research52

    Microsoft Research 研究机器人推理卸载,比较机载与边缘、云端计算

    Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。

9月22日周二
  1. NVIDIA Blog37

    为什么规模化部署物理 AI 需要每一层的安全保障:NVIDIA Halos 的全栈方案

    NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。

8月14日周五
  1. Hugging Face Blog44

    如何用 Strands Agents、LeRobot 和 Hugging Face Storage Buckets 在一处完成录制、训练与部署

    Strands Robots 可结合 LeRobot 与 Hugging Face Storage Buckets,在单个智能体内串联机器人演示录制、策略训练和硬件部署。同步仅上传变化的字节,训练直接从 Hub 流式读取数据,无需完整下载,全程保持 LeRobot 数据格式。默认模拟路径使用 mock 策略,可跑通流程,但不产生实用策略。

7月30日周四
  1. Google DeepMind75

    Gemini Robotics ER 2 以视频理解、任务编排和多机器人协作增强机器人能力

    Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。

    推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。

7月28日周二
  1. Google DeepMind74

    Gemini Robotics 2 为机器人带来全身智能控制与多机器人协作

    Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。

    推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。

7月27日周一
  1. Hugging Face Blog60

    NVIDIA 发布 Cosmos-H-Dreams,将实时生成式仿真引入手术机器人

    NVIDIA 发布手术机器人生成式仿真模型 Cosmos-H-Dreams,通过知识蒸馏和 FlashDreams,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 帧/秒的闭环交互。

    推荐理由:从离线轨迹生成转向实时闭环交互的技术路径,为理解手术机器人仿真如何同时降低生成成本与应对长序列误差提供了具体参考。

7月21日周二
7月8日周三
7月7日周二
  1. Hugging Face Blog62

    LeRobot v0.6.0 发布:整合世界模型策略、奖励评估与部署纠正流程

    LeRobot v0.6.0 将世界模型策略、统一奖励模型 API、仿真评测与部署纠正流程整合进机器人学习闭环。版本接入 VLA-JEPA、FastWAM、LingBot-VA,并新增 6 个仿真基准,统一通过 lerobot-eval 运行;lerobot-rollout 支持 DAgger 式人工接管,将纠正数据用于后续微调。

    推荐理由:部署时记录人工纠正并直接用于下一轮微调,把失败采集接回训练流程,为机器人策略持续改进提供了可复用路径。

7月1日周三
  1. Berkeley AI Research33

    BAIR 2026 届博士毕业生风采展示

    伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。

6月9日周二
5月28日周四
  1. Mistral AI56

    Mistral 在 AI Now Summit 2026 展示工业工程 AI 栈、Vibe 更新与数据中心计划

    Mistral 在 AI Now Summit 2026 推出工业工程 AI 栈,并更新 Vibe 智能体、公布 Les Ulis 推理数据中心计划。工业方案融合物理模型、工程知识与机器人技术,与 Airbus、BMW Group 和 ASML 的合作覆盖设计、碰撞仿真及零部件优化;Vibe 支持长时间多步骤任务,包括深度研究、日常流程编排,以及从需求到合并变更的编码工作。

5月18日周一
  1. Google DeepMind66

    Project Genie 结合 Street View 模拟真实地点,并扩大全球订阅用户访问范围

    Google DeepMind 为 Project Genie 新增 Street View 功能,让用户以真实地点影像为起点创建可交互世界。该功能由 Maps Imagery Grounding 支持,目前可选择美国境内地点,并搭配场景风格与角色描述生成环境,未来计划扩展地点覆盖范围。

    推荐理由:以街景影像约束生成世界的起始位置,为理解世界模型如何连接真实地点与可交互虚拟环境提供了具体案例。

4月20日周一
4月13日周一
  1. Google DeepMind66

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强具身推理与仪表读数能力

    Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。

    推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。