Meta 将 AI 智能体 Muse 扩展至小企业,新增 Shopify、Slack 等集成
Meta 周二宣布将 AI 智能体 Muse 扩展至小企业,并新增 Shopify、Dropbox、Slack 等软件集成,帮助企业主管理业务和寻找客户。Muse 还可连接 Instagram 专业账户分析、Facebook 主页及 Meta 广告账户,Meta 称其能了解企业销售的产品、品牌语气及客户常见问题。
Meta 周二宣布将 AI 智能体 Muse 扩展至小企业,并新增 Shopify、Dropbox、Slack 等软件集成,帮助企业主管理业务和寻找客户。Muse 还可连接 Instagram 专业账户分析、Facebook 主页及 Meta 广告账户,Meta 称其能了解企业销售的产品、品牌语气及客户常见问题。
OpenAI 在周二的 DevDay 宣布扩展 ChatGPT 插件,让开发者构建带有侧栏专属入口、交互面板和文件查看器的应用式体验。新的 Plugin Creator 工具及改版提交流程将简化插件开发与上架,插件也可托管于 ChatGPT Sites,让同事使用各自连接的数据和权限访问共享应用。
推荐理由:相较于仅连接外部工具,侧栏入口、交互面板和事件触发自动化让插件进一步承载操作流程,为判断应用如何融入对话提供了具体参照。
OpenAI 在 DevDay 2026 推出 GPT-6.1 Sol、常驻智能体 Dots 及多项平台更新,称 Sol 以 Astra 的 1/5 价格提供接近其水平的智能。
推荐理由:将模型价格、常驻智能体和订阅额度调整放在一起比较,有助于区分单次调用降价与整体使用成本变化对工作流的不同影响。
OpenAI 在 DevDay 公布 ChatGPT 多项更新,涵盖开放插件系统、共享工作区、自动化工作流及企业软件市场。Plugin Extensions 允许开发者在 ChatGPT 内构建交互面板,Space 与 AI 助手 Dot 支持团队共享材料和任务协作,MCP Events 则让插件根据连接应用中的事件触发自动化。
推荐理由:插件扩展、共享工作区与事件触发自动化串起了团队协作流程,呈现出聊天入口向日常工作平台延伸的具体路径。
OpenAI 在周二的 DevDay 宣布推出 Dots,由 GPT-6 Astra 驱动,可在后台跨应用执行任务并逐步学习用户偏好。Dots 使用自己的云端计算机访问浏览器及超过 4,000 个受支持应用,支持文字和语音交互,并提供自定义行动规则及自动审查功能以检查操作是否符合规则与安全要求。
推荐理由:后台持续执行与自定义授权规则被放在同一产品中,为理解常驻智能体如何兼顾任务推进和用户控制提供了具体案例。
OpenAI 在 DevDay 2026 宣布扩展 Codex 与 API,加入可复用云环境、安全扫描、Decisions API 和 Ultrafast 提速档位。
推荐理由:提速档位的价格与订阅额度调整提供了具体比较依据,便于区分更快生成速度与更高使用额度在开发工作流中的不同成本。
AWS 给出 Amazon Quick 各组件的提示词工程方法,说明研究、工作流、数据分析、聊天智能体和动作集成需要不同的指令结构。Quick Research 应明确研究目标、受众和来源范围,Quick Flows 应写清触发条件、编号步骤与异常处理,Quick Sight 应指定指标、维度、时间范围和图表形式。
OpenAI 在 DevDay 2026 宣布推出 GPT-6.1 Sol,称其以 Astra 五分之一的价格提供接近其水平的智能,并推出个人智能体 Dots 和协作空间 ChatGPT Space。
推荐理由:现场记录将产品发布承诺与演示中的停顿、语音交互失败并置,为理解智能体功能展示与实际使用体验之间的差异提供具体参照。
ProvenanceGuard 为 MCP 智能体提供生成后核验,逐条检查事实支持与来源归属,识别事实有依据却引用错误来源的问题。医疗智能体测试中,它拦截了专家判定不应通过的 139 条声明中的 138 条,也拦截了 67 条有依据的声明。该方法无需重新训练智能体,可对被拦截的回答尝试修复并再次核验。
H company 发布 Holo4 智能体模型系列,包含 27B 稠密模型和 35B-A3B MoE 模型,可结合 GUI、代码、MCP 和 API 完成任务。
推荐理由:公开评测轨迹与成本计算口径为比较跨界面智能体提供了依据,文中也明确列出了任务子集和运行框架不同带来的比较边界。
GitHub Security Lab 展示了 Fuzzing Taskflow 的运行方法与架构,用智能体自动完成 C/C++ 项目的测试入口识别、测试驱动代码编写、覆盖率改进和崩溃分析。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
NVIDIA 将 AI 安全视为覆盖模型、智能体编排框架和运行环境的工程问题,要求每次部署具备可强制执行的边界、明确责任人及防护有效性的证据。运行环境应独立于智能体推理限制文件、网络和进程访问,为智能体配置可追溯身份与任务范围内的凭据,并对重大操作和权限变更保留人工审批。
GitHub Podcast 剖析 AI 开发热议观点:生成代码仍需审查,RAG 并未过时,技能也未取代 MCP。代码审查应按风险分配精力,直到开发者能解释结果并承担责任。MCP 提供工具与数据访问,技能承载流程和最佳实践,RAG 检索相关上下文,三者可在同一智能体工作流中配合。
Google Research 的 ToolGrad 利用文本“梯度”,先生成工具调用链再标注用户查询,以更低成本生成更复杂的工具使用数据。经 ToolGrad-500 微调的 ToolGrad-12B 在 BFCL 获得 83.1 分,接近 gemini-2.5-pro 的 83.2 分。
Hugging Face 展示了如何用 Gradio Workflow 构建 Workflow1111,以 73 个节点、11 条媒体流水线重建 AUTOMATIC1111 的大部分功能。
推荐理由:将模型调用与本地处理统一为节点,并从输出自动生成接口,提供了把多模型演示转为可共享、可编程调用应用的具体方法。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Google 推出语音转文字模型 Gemini 3.5 Transcribe,支持自动清理口头语、自我纠正、文本格式化及超过 85 种语言的转写。Artificial Analysis 测得其流式和非流式平均词错误率分别为 4.0% 和 2.6%,最终转写耗时较 Chirp 3 改善 70%。
推荐理由:与 Chirp 3 的延迟比较及流式、非流式识别错误率,为开发者在实时语音交互与录音转写之间选择接入方式提供了具体依据。
IBM Granite 团队详解 Granite 4.2 的构建流程,3B、8B、30B 模型均由 Granite-4.1 基础模型经 SFT 和多阶段强化学习训练而来。
推荐理由:分阶段训练配方将可验证奖励、真实环境任务和偏好对齐串联起来,为拆解推理与智能体能力的训练路径提供具体参考。
Mistral 推出 Agentic Search,通过多步检索与文档导航帮助 AI 系统查找、阅读和核验复杂文档中的信息。它基于现有索引提供 search、open、navigate、read 和 grep 五种工具,可通过 Mistral Search Toolkit 集成,也已内置于 Studio 和 Vibe 的 Libraries,支持云端和本地部署。
推荐理由:通过区分单次检索、循环搜索和文档导航的评测结果,材料展示了复杂文档问答中准确率提升与检索开销下降之间的关系。
Google DeepMind 发布 Gemini 3.7 Flash,距 3.6 Flash 发布仅三周,提升编码、知识工作及智能体工作流表现。
推荐理由:同代 Flash 模型的编码与业务工作流基准对比结合限时价格,提供了评估智能体升级收益与使用成本的具体依据。
Microsoft Research 介绍胸部 X 光研究模型 CARE-X,结合报告生成、分类与定位辅助头及 DAPO 强化学习,在 ReXVQA 上达到 94% 总体准确率。
Google DeepMind 发布 Gemini Robotics ER 2,通过连续视频理解、任务编排和多机器人协作增强具身推理能力,并由底层 VLA 模型执行动作。
推荐理由:将连续视频中的进度判断与底层控制接口编排结合,为机器人边执行边纠错、而非每一步停下重新规划提供了具体实现参考。
Google DeepMind 将计算机操作作为内置工具集成至 Gemini 3.5 Flash,支持开发者构建跨浏览器、移动端和桌面环境的智能体。
推荐理由:从独立模型转为主模型内置工具,计算机操作可与既有工具调用能力结合,为跨环境自动化提供更集中的开发入口。