如何使用 Amazon Nova Act 实现合成监控
Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。
Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
Amazon Quick 提示词工程指南给出通用原则与结构化框架,帮助提高自然语言请求响应的准确性和可靠性。核心方法包括明确指标与范围、补充业务背景,以及用示例约束输出格式。CRISPE 框架进一步组织上下文、角色、目标与步骤,适用于跨组件的复杂请求。
AWS 给出 Amazon Quick 各组件的提示词工程方法,说明研究、工作流、数据分析、聊天智能体和动作集成需要不同的指令结构。Quick Research 应明确研究目标、受众和来源范围,Quick Flows 应写清触发条件、编号步骤与异常处理,Quick Sight 应指定指标、维度、时间范围和图表形式。
AWS 展示了用 Amazon Quick 与 Amazon Bedrock AgentCore 构建合同智能平台的架构,通过结构化提取支持跨合同汇总,并保留原文检索能力。
推荐理由:将跨文档汇总交给结构化数据库、单文档查找留给检索,为大量非结构化文档同时支持统计与问答提供了可迁移的架构方法。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
OpenAI 推出主动式助手 dots,可持续处理复杂项目和日常任务。dots 在推进工作的同时,帮助用户保持对工作的掌控。
Amazon Bedrock 已上线 xAI 的 Grok 4.7,提供 500K token 上下文窗口,以及 low、medium、high、xhigh 四档推理强度。
微软亚洲研究院新加坡实验室成立一年来,扩大团队并深化本地合作,推动前沿 AI 研究与实际应用相互促进。实验室与医疗伙伴合作,探索多模态 AI 和智能体方法在临床决策、疾病诊断及个性化护理中的应用。新加坡经济发展局继续支持联合博士培养,双方合作已扩展至战略层面。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
GitHub Copilot app 可通过 /create-canvas 技能生成用户与 AI 智能体共享的自定义界面,无需手动编码或设计。创建时需说明工作流、用户可执行的操作及智能体可执行的操作,随后可继续调整界面,并将其保存为项目共享或个人使用的扩展。双方操作会即时更新共享状态,无需单独发送或同步;也可从 Awesome Copilot 安装社区提供的 canvas 扩展后再定制。
推荐理由:将工作流、用户可操作项和智能体可操作项分别写清,是这篇教程提供的可迁移方法,有助于把界面需求转成明确的协作边界。
Amazon SageMaker HyperPod 可结合开源框架 SkyRL 运行多模态强化学习训练,并提供故障恢复与训练监控能力。教程以 Qwen3-VL-8B 为例,从 VisGym SFT 检查点进行 GRPO 后训练,在固定的 64 个迷宫评测集上将通关率从 43.75% 提升至超过 95%。
NarrateAI 在 Amazon Bedrock 上结合五项质量保障技术,在生产部署中实现约 13 秒开始输出已校验响应、99.3 percent 的数值准确率。
GitHub Copilot 应用中的 canvas 可构建任务专用界面,Burke Holland 用实例说明何时应以它替代聊天交互。canvas 是运行于应用内的全栈小程序,可与 Copilot 智能体双向通信、调用第三方 API 并在本机执行代码,文中展示了四子棋、Winget 包管理和 SQLite 操作等用途。
推荐理由:把重复操作从聊天转为智能体生成的专用界面,为减少反复调用模型及按需设置开发流程中的人工审查节点提供了具体思路。
Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。
推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。
GitHub Security Lab 展示了 Fuzzing Taskflow 的运行方法与架构,用智能体自动完成 C/C++ 项目的测试入口识别、测试驱动代码编写、覆盖率改进和崩溃分析。
Ringg 借助 OpenAI 的 AI 智能体解决高达 65% 的客户来电问题。其使用 GPT-5.6,为语音、聊天、WhatsApp 和网页渠道提供多语言智能体,成本较 GPT-4.1 降低 90%。
NVIDIA 与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展,涵盖公共部门规模化部署及区域语言模型开发。AI Singapore 正将 Nemotron 开放模型和 NeMo 工具纳入 SEA-LION 模型家族。Viettel AI 针对越南语和智能体应用微调 Nemotron 3 Super,在 VMLU 评测中排名最高。
NVIDIA 在 ROSCon 发布免费开源的 Isaac ROS 5.0,新增智能体开发工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。
Parallel 借助 GPT‑6 Astra,让其 AI 智能体研究并综合劳动力市场数据的耗时与成本均降至此前模型的一半。对比结果针对劳动力市场数据的研究与综合任务。
NVIDIA 将 AI 安全视为覆盖模型、智能体编排框架和运行环境的工程问题,要求每次部署具备可强制执行的边界、明确责任人及防护有效性的证据。运行环境应独立于智能体推理限制文件、网络和进程访问,为智能体配置可追溯身份与任务范围内的凭据,并对重大操作和权限变更保留人工审批。
NVIDIA 在纽约气候周展示 5 家企业利用其 AI 技术推进清洁能源项目,涵盖电网优化、核电运营、储能及聚变研究。南加州爱迪生公司使用 ThinkLabs 软件,将每份并网申请的评估时间从 30-45 天缩短至 2 分钟。Redwood Materials 利用回收电动汽车电池及 NVIDIA Blackwell 平台,为 AI 工厂提供离网供电方案。
V7 借助 GPT-5.6 Luna 将成本降低 78%,同时提升准确率。V7 使用 GPT-5.6 将分散的公司文件转化为 AI 智能体可用的上下文,支持其完成关联来源的复杂工作。
GitHub Podcast 剖析 AI 开发热议观点:生成代码仍需审查,RAG 并未过时,技能也未取代 MCP。代码审查应按风险分配精力,直到开发者能解释结果并承担责任。MCP 提供工具与数据访问,技能承载流程和最佳实践,RAG 检索相关上下文,三者可在同一智能体工作流中配合。
Google Research 分享生成式 UI 教育研究,让教师按课程和学习目标生成定制互动模拟,并提供超过 30 个英文 STEM 示例。生成流程结合教师审批的学习目标、递进关卡、分层提示与自动评估纠错,公开示例均经教师审核;美国初步研究中,12 名教师各请求了 3 个定制互动模拟,对质量的平均评分为 8/10。
GitHub 使用 Copilot app 和 CLI 将 Copilot 智能体运行时从 TypeScript 迁移至 Rust,主要由一名开发者监督智能体在几个月内完成。
推荐理由:按组件原位替换、持续测试与人工合并把关的迁移实践,为在持续迭代的代码库中组织智能体重写提供了可迁移的方法。
OpenAI 探索由 AI 驱动的新广告体验,涵盖 Sponsored Agents、面向营销人员的工具,以及与 HubSpot 和 Shopify 的集成。这些探索聚焦 AI 在广告场景中的应用。
Hex 借助 GPT-6 Astra,让数据 AI 智能体将复杂分析的答案转化为可视化报告。这些报告以交互式可视化呈现结果,让员工乐于分享。
NVIDIA CEO 黄仁勋在 Dreamforce 表示,AI 作为基础设施将让人们“知晓一切、做到任何事”,并强调创新速度与安全可以兼顾。同期公布的 Salesforce 首款 CRM 推理模型 Koa 基于 NVIDIA Nemotron 3 Super 构建,已在内部运行,计划于 10 月进入客户试点。
Google DeepMind 发布 Gemini 3.8 Live 和 Gemini 3.8 Live Extended Thinking,分别面向高性价比语音对话与复杂多步推理任务。
推荐理由:两款模型分别侧重规模成本与复杂任务,并将后台工具执行与持续对话结合,为语音智能体的模型选型提供了具体比较维度。
ALTK-Evolve 新增 Consistency Analyzer 和一致性指南生成能力,在 AppWorld 测试中将 GPT-4.1 智能体的一致性差距从 24.4pp 缩小至 12.0pp。
推荐理由:通过区分平均成功率与多次运行全部成功的任务比例,这篇材料提供了衡量智能体重复执行可靠性的具体方法。
Fyxer 利用 OpenAI 模型打造用户信赖的 AI 行政助理,帮助用户整理收件箱并按个人口吻起草邮件。其做法结合了微调、记忆和真实用户反馈。
Perplexity 使用 GPT-6 Astra 处理端到端系统工作,相比使用早期模型时,检查频率显著降低。其具体用途包括撰写通信内容、修改软件和监控生产系统。
GitHub 日韩营销负责人 Tomoko Tanaka 用 GitHub Copilot、Issue 和 Actions,将活动筹备、报名筛查与会后跟进串成自动化流程。
推荐理由:把业务手册转成结构化输入与可审查的技能文件,为跨工具重复工作提供了可迁移路径,同时保留人工确认和试运行机制。
Cognition 借助 GPT‑6 Astra 提升 Devin 测试软件并展示其正常运行的能力,让 Devin 更好地验证自身工作成果。此举旨在帮助工程师减少代码审查量,交付更多软件。
Google Research 的 ToolGrad 利用文本“梯度”,先生成工具调用链再标注用户查询,以更低成本生成更复杂的工具使用数据。经 ToolGrad-500 微调的 ToolGrad-12B 在 BFCL 获得 83.1 分,接近 gemini-2.5-pro 的 83.2 分。
GitHub Copilot app 可通过内置 diff、终端和浏览器面板,在应用内完成智能体代码的审查、运行与预览。diff 面板展示增删改动并支持接受改动、评论或要求修改;终端支持手动运行命令,也可配置通过 Run 按钮执行的脚本,例如运行 npm run dev。浏览器面板可测试界面,并通过 Pick & Polish 选择元素与智能体一起调整,确认功能后可直接接受改动并创建拉取请求。
OpenAI 在 ChatGPT Work 中推出 Data agent,支持用户用自然语言借助 AI 处理公司数据。用户可以连接公司数据、发现洞察并构建交互式仪表盘。
OpenAI 推出 Agents API,这是一项用于构建与上线云端智能体的托管服务。该服务由 Codex harness 驱动,支持编排、长时间运行的会话和工具使用。
推荐理由:托管服务将编排、长时间运行的会话和工具使用纳入同一入口,为构建与上线云端智能体提供了明确的工程路径。
Mistral 帮助一家欧洲能源运营商将储层模拟器的 40,000 行 Fortran 77 迁移至 C++,完成了总计 300,000 行代码中的核心功能部分。
推荐理由:先建立数值一致性测试再分模块迁移,并在人类审核节点处理智能体停滞,为复杂遗留代码现代化提供了可迁移的方法。