Amazon Quick 各组件的提示词工程指南:有效模式与常见误区
AWS 给出 Amazon Quick 各组件的提示词工程方法,说明研究、工作流、数据分析、聊天智能体和动作集成需要不同的指令结构。Quick Research 应明确研究目标、受众和来源范围,Quick Flows 应写清触发条件、编号步骤与异常处理,Quick Sight 应指定指标、维度、时间范围和图表形式。
AWS 给出 Amazon Quick 各组件的提示词工程方法,说明研究、工作流、数据分析、聊天智能体和动作集成需要不同的指令结构。Quick Research 应明确研究目标、受众和来源范围,Quick Flows 应写清触发条件、编号步骤与异常处理,Quick Sight 应指定指标、维度、时间范围和图表形式。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
GitHub Security Lab 展示了 Fuzzing Taskflow 的运行方法与架构,用智能体自动完成 C/C++ 项目的测试入口识别、测试驱动代码编写、覆盖率改进和崩溃分析。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
NVIDIA 将 AI 安全视为覆盖模型、智能体编排框架和运行环境的工程问题,要求每次部署具备可强制执行的边界、明确责任人及防护有效性的证据。运行环境应独立于智能体推理限制文件、网络和进程访问,为智能体配置可追溯身份与任务范围内的凭据,并对重大操作和权限变更保留人工审批。
GitHub Podcast 剖析 AI 开发热议观点:生成代码仍需审查,RAG 并未过时,技能也未取代 MCP。代码审查应按风险分配精力,直到开发者能解释结果并承担责任。MCP 提供工具与数据访问,技能承载流程和最佳实践,RAG 检索相关上下文,三者可在同一智能体工作流中配合。
Google Research 的 ToolGrad 利用文本“梯度”,先生成工具调用链再标注用户查询,以更低成本生成更复杂的工具使用数据。经 ToolGrad-500 微调的 ToolGrad-12B 在 BFCL 获得 83.1 分,接近 gemini-2.5-pro 的 83.2 分。
OpenAI 推出 Agents API,这是一项用于构建与上线云端智能体的托管服务。该服务由 Codex harness 驱动,支持编排、长时间运行的会话和工具使用。
推荐理由:托管服务将编排、长时间运行的会话和工具使用纳入同一入口,为构建与上线云端智能体提供了明确的工程路径。
Hugging Face 展示了如何用 Gradio Workflow 构建 Workflow1111,以 73 个节点、11 条媒体流水线重建 AUTOMATIC1111 的大部分功能。
推荐理由:将模型调用与本地处理统一为节点,并从输出自动生成接口,提供了把多模型演示转为可共享、可编程调用应用的具体方法。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
IBM Granite 团队详解 Granite 4.2 的构建流程,3B、8B、30B 模型均由 Granite-4.1 基础模型经 SFT 和多阶段强化学习训练而来。
推荐理由:分阶段训练配方将可验证奖励、真实环境任务和偏好对齐串联起来,为拆解推理与智能体能力的训练路径提供具体参考。
Mistral 推出 Agentic Search,通过多步检索与文档导航帮助 AI 系统查找、阅读和核验复杂文档中的信息。它基于现有索引提供 search、open、navigate、read 和 grep 五种工具,可通过 Mistral Search Toolkit 集成,也已内置于 Studio 和 Vibe 的 Libraries,支持云端和本地部署。
推荐理由:通过区分单次检索、循环搜索和文档导航的评测结果,材料展示了复杂文档问答中准确率提升与检索开销下降之间的关系。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Mistral Studio 现为客户提供提示词和技能的统一记录系统,集中管理版本、归属与追溯信息。系统支持不可变版本、版本比较与回滚、分类标签及审计日志,允许非开发人员即时编辑和测试,生产变更仍须经过既有测试与审批。Observability 可将生产输出追溯至资产版本,技能可直接作为 MCP 服务器访问。
Google DeepMind 将计算机操作作为内置工具集成至 Gemini 3.5 Flash,支持开发者构建跨浏览器、移动端和桌面环境的智能体。
推荐理由:从独立模型转为主模型内置工具,计算机操作可与既有工具调用能力结合,为跨环境自动化提供更集中的开发入口。
Mistral AI 为 Connectors 新增权限管控、多账户连接和故障诊断能力,提升企业平台连接的安全性。管理员可按组织、工作区及单个工具配置权限,带连接器权限范围的 API 密钥与多账户连接已正式可用。Connectors Debugger 和 Workflows 集成进入公开预览,Vibe Code 集成已正式可用。
Mistral 将 Le Chat 升级为 Vibe,以同一智能体和许可覆盖办公与编码,迁移原有对话、设置和订阅。Work Mode 支持跨企业工具的多步任务、定时执行和可复用技能;Code Mode 支持在隔离沙箱中并行运行远程编码会话并提交拉取请求,同时新增 VS Code 扩展,CLI 可通过 /teleport 在终端与云端间迁移会话并保留历史和审批记录。
推荐理由:办公与编码被纳入同一智能体和许可体系,结合可编辑计划、会话权限及终端与云端迁移,为跨工具任务的人工管控提供了具体参考。
Mistral AI 本周签署收购物理 AI 公司 Emmi AI 的最终协议,旨在增强物理建模能力并推进面向工程师的 AI 智能体。Emmi AI 创立于奥地利,其模型支持实时仿真和数字孪生,可将耗时多日的计算替换为实时仿真。其联合创始人与超过 30 名研究人员及工程师将于 5 月加入 Mistral AI 的 Science 和 Applied AI 团队。
Mistral 发布公开预览版 Mistral Medium 3.5,并将其设为 Vibe 和 Le Chat 的默认模型,支持云端编码智能体与多步骤 Work mode。
推荐理由:本地会话连同任务状态和审批记录迁至云端的设计,为长任务异步执行与保留人工审查之间的衔接提供了具体参考。
Mistral AI 在 Studio 推出公开预览版 Connectors,内置连接器与自定义 MCP 均可通过 API/SDK 用于模型和智能体调用。连接器支持程序化管理和集中注册,可跨 LeChat 与 AI Studio 复用,Vibe 支持即将到来。
Google DeepMind 发布 Gemini Robotics-ER 1.6,增强机器人空间推理、多视角理解和任务完成检测,并新增仪表读数能力。官方称其相关能力较 Gemini Robotics-ER 1.5 和 Gemini 3.0 Flash 改善,仪表读数结合视觉推理、图像放大、点位标注与代码执行,可处理压力表、液位计等设施巡检场景。
推荐理由:多视角任务完成判断与仪表读数案例,把具身推理的改进落到机器人重试决策和设施巡检这两个具体应用环节。
Mistral AI 发布 Leanstral-120B-A6B,面向 Lean 4 形式化仓库任务,以 Apache 2.0 许可开放权重,并接入 Mistral Vibe。
推荐理由:基于真实形式化仓库任务的评测同时列出得分与运行成本,为比较专用模型和通用编码智能体的证明工程取舍提供了依据。
Mistral 发布终端原生编码智能体 Mistral Vibe 2.0,由 Devstral 2 模型家族驱动,新增自定义子智能体、多选澄清、斜杠命令技能、统一智能体模式及自动更新。
推荐理由:自定义子智能体、执行前澄清与权限模式组合,为团队把终端编码自动化适配到具体任务和既有工作流程提供了可配置路径。
Mistral AI 为 Le Chat 推出含 20+ 安全连接器的目录与 Memories,两项功能均为 beta,向包括 Free 计划在内的所有用户开放。
推荐理由:自定义连接器将企业工具接入聊天流程,配合组织级访问控制与可选部署方式,为评估助手接入业务系统提供具体参考。
Mistral AI 发布 Voxtral 语音理解模型,提供面向生产应用的 24B 和面向本地、端侧部署的 3B 版本,均采用 Apache 2.0 许可证。
推荐理由:将音频问答、摘要和函数调用纳入可开放部署的语音模型,为需要兼顾数据控制与语义理解的应用提供了选型参考。
Mistral 宣布推出 Agents API,整合内置连接器、MCP 工具、持久记忆与多智能体编排,补充现有 Chat Completion API。
推荐理由:将内置工具、有状态对话与多智能体任务交接纳入同一接口,为企业搭建需要保留上下文并协调多步操作的工作流提供了具体参考。
Mistral AI 推出由 Mistral Medium 3 驱动的 Le Chat Enterprise,整合企业搜索、智能体构建、自定义数据与工具连接器、文档库、自定义模型及混合部署,所有功能将在未来两周内陆续推出。
Mistral AI 发布 Mistral Small 3.1,在 Mistral Small 3 基础上提升文本性能与多模态理解,上下文窗口扩展至 128k tokens。
推荐理由:单张消费级显卡或指定内存的电脑即可运行,加上开放的基础与指令检查点,为端侧多模态应用的部署和定制提供了具体参考。