如何使用 Amazon Nova Act 实现合成监控
Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。
Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
开发者可通过 AWS vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现无需等待完整响应生成的流式语音播放。教程使用持久双向连接发送文本并接收音频块,提供部署脚本和 Gradio 客户端示例。
Marissa Mayer 的个人 AI 助手 Dazzle 仅从手机相册获取用户背景,TechCrunch 实测发现其建议有个性化特点,但也存在信息遗漏。用户可通过应用或短信与它交互,让它从活动传单中提取信息填入日历,或根据照片历史推荐旅行目的地和生日礼物。测试中,它根据过往旅行推荐了地中海目的地,却也推荐了作者去过的西西里岛,并未能记住作者的女儿已经会滑旱冰。
AMD 宣布以约 $8.2 billion 的全股票交易收购专注空间智能的 World Labs,交易预计于 2026 年底前完成,尚待监管批准。创始人李飞飞将担任 AMD 执行副总裁兼首席科学家,直接向 CEO Lisa Su 汇报并领导前沿研究。AMD 希望借助团队对 AI 工作负载的理解指导未来硬件路线,李飞飞则表示,扩大研究规模需要与硬件更紧密地整合。
推荐理由:收购动机指向以模型研发经验指导硬件路线,为理解芯片厂商为何把竞争延伸至模型与研究团队提供了具体案例。
Condé Nast 与 AWS 基于 Amazon Bedrock 构建多模态视频检索系统,将超过 140,000 条视频库的单次内容查找时间从 250 分钟缩短至约 2 分钟。
Microsoft Research 推出实验性 AI 研究系统 Quine,将多模态生物学世界模型与科学工具、文献及研究人员连接。团队与 Broad Institute 合作,用一个周末从数千种化合物中筛出待实验验证的候选物,随后在多项湿实验中验证了部分高排名化合物对胰腺癌细胞状态的预测性转变效果。
推荐理由:胰腺癌细胞状态实验展示了模型预测如何进入湿实验筛选流程,也呈现了较弱的反向转变与意外表型如何成为后续研究线索。
AMD 以 $8.2B 收购 World Labs,后者的空间智能能力覆盖创意、设计与空间重建,并通过收购 SceniX 拓展机器人仿真。材料引用李飞飞的回顾称,从零训练的 Atlas 将生成模型与多视图几何结合,可根据输入的 2D 图像预测新相机视角,基本解决了稀疏重建这一长期问题。其提及的应用方向包括机器人 RL 环境、治疗与娱乐场景生成,以及房地产、设计和建筑中的现实世界重建。
微软亚洲研究院新加坡实验室成立一年来,扩大团队并深化本地合作,推动前沿 AI 研究与实际应用相互促进。实验室与医疗伙伴合作,探索多模态 AI 和智能体方法在临床决策、疾病诊断及个性化护理中的应用。新加坡经济发展局继续支持联合博士培养,双方合作已扩展至战略层面。
Amazon SageMaker HyperPod 可结合开源框架 SkyRL 运行多模态强化学习训练,并提供故障恢复与训练监控能力。教程以 Qwen3-VL-8B 为例,从 VisGym SFT 检查点进行 GRPO 后训练,在固定的 64 个迷宫评测集上将通关率从 43.75% 提升至超过 95%。
美国国防部申请未来五年投入 $30.3 million,开发结合 AI、机器学习与非接触式生理测量的测谎技术。该项目名为 Polygraph+ 或 Polygraph Next,将由国防反情报与安全局负责,用于拟聘人员审查及内部威胁检测,预算尚未获国会批准,具体技术也未明确。
Runway 的 GWM Worlds 2 研究预览通过 WorldPrompt 指定生成世界、首帧和带时间戳的事件,并支持实时输入动作提示词。团队在采访中解释,其音视频模型经过格式微调、自回归后训练和知识蒸馏,实现连续 720p、24 fps 视频与 48,000 Hz 音频生成。
Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。
推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
LFM2.5-VL-DSpark 通过推测解码加速 LFM2.5-VL-3B,端侧解码最高提速 3.13x,且不改变输出质量。草稿模型增加约 280M 参数,增幅为 8.9%,端侧端到端最高提速 2.62x。模型已开放权重,支持 llama.cpp、MLX-VLM 和 SGLang。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
NeoMME 推出 260M 和 800M 多语言多模态编码器,以单一双向 Transformer 处理文本和图像,全部检查点按 Apache 2.0 许可开放。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Google 在 Earth AI 中介绍实验性研究系统 planetary prediction engine(PPE),可从自然语言查询自动完成地理空间数据发现、整理、模型训练与评估。
推荐理由:研究将防止目标泄漏与过拟合的检查嵌入自动建模流程,为把智能体用于地理空间预测提供了可迁移的工程思路。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google Research 推出研究原型 AgentHands,让 AI 智能体在 XR 中生成与语音同步、贴合用户物理环境的手势。系统将 LLM 回答中的手势事件绑定到触发词,通过词级时间戳协调语音与动画。研究以 12 名参与者对比纯语音基线,结果显示空间指代效果显著改善。
Gradio 内置的 gr.Workflow 可将 AI 流水线表示为带类型节点的图,并提供可拖拽、逐节点运行和查看中间结果的画布。节点可连接 Python 函数、Hugging Face Inference Providers 上的模型、Gradio Spaces 或数据集,文中通过图像编辑、并行生成和数据集分析等示例演示用法。
推荐理由:将中间结果可见的节点画布与同一工作流的接口调用结合,为多步骤 AI 应用提供了从排查问题到复用服务的具体方法。
Sentence Transformers v6.0 的 MultiVectorEncoder 支持通过统一 API 使用多向量嵌入模型,教程覆盖模型加载、MaxSim 评分与检索系统接入。
MindTopo 基准测试显示,多模态大语言模型的静态拓扑推理表现优于交互式规划,但两者均明显落后于人类。该基准围绕连续性、分离、顺序、包围和绳结设置推理与规划任务。模型在规划中常无法持续追踪结构关系,或提出违反物理约束的动作,暴露出跨动作维持拓扑理解的短板。
Google DeepMind 发布手语转文本模型 SL2T,为 Pixel 11 的 Gboard 和 Live Transcribe 提供 ASL 转英文输入功能。
推荐理由:将手语输入接入手机日常输入场景,让无障碍交互不再只依赖英文打字,同时通过仅上传身体坐标减少原始视频传输。
Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。
推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Google DeepMind 推出 Gemini Robotics 2 系列模型,支持全身控制、精细操作及多机器人协作。Gemini Robotics ER 2 负责规划持续数分钟、涉及数百次决策的任务;Gemini Robotics On-Device 2 支持本地运行,通常用少于 200 个示例、数小时适配新的双臂机器人形态。
推荐理由:从上半身桌面操作扩展到全身协调与多机器人协作,这次更新提供了观察机器人如何承接更长任务链的具体样例。
Google DeepMind 发布 Gemini 3.6 Flash、3.5 Flash-Lite 和 3.5 Flash Cyber,分别面向复杂智能体任务、高吞吐工作流和漏洞发现与修复。
推荐理由:同一系列按复杂任务、高吞吐和漏洞修复划分用途,并给出成本与访问边界,为生产智能体的模型选型提供了具体比较依据。
Google Research 介绍传感器基础模型 SensorFM,通过无标签可穿戴数据预训练,学习可迁移至心血管、代谢、睡眠和心理健康任务的通用生理表征。训练数据来自 500 万名已同意参与研究的用户,超过 1 万亿分钟;模型采用自监督重建与 AIM 框架,直接从存在缺失的记录中学习。
伯克利人工智能研究实验室(BAIR)展示了2026届博士毕业生的研究成果与职业去向,涵盖机器人、大语言模型推理、生成模型及AI安全等领域。毕业生将进入高校、博士后岗位和产业研究实验室,或创办公司,部分人仍在寻找机会。
Google DeepMind 发布 Nano Banana 2 Lite,并向开发者开放 Gemini Omni Flash,分别用于快速图像生成和视频生成、对话式编辑。
推荐理由:文中明确区分图像模型的速度、成本与质量定位,并列出视频模型的输入处理限制,为多媒体工作流选型提供具体依据。