如何自动化管理 Amazon Textract 适配器的跨账户生命周期
Amazon Textract 适配器跨账户生命周期管理方案将适配器配置与应用解耦,可零停机更新生产引用,无需重新部署。方案提供基础设施模板、文档预分类路由和生产安全配置。跨账户迁移目前仍需提交 AWS Support 工单,且仅转移训练后的模型权重,不含查询定义和训练数据。
Amazon Textract 适配器跨账户生命周期管理方案将适配器配置与应用解耦,可零停机更新生产引用,无需重新部署。方案提供基础设施模板、文档预分类路由和生产安全配置。跨账户迁移目前仍需提交 AWS Support 工单,且仅转移训练后的模型权重,不含查询定义和训练数据。
Amazon Nova Act 与 Amazon Bedrock AgentCore 可结合实现智能体驱动的合成监控,定期验证关键用户流程。方案通过 UI 截图和自然语言动作替代 DOM 选择器脚本,提升对界面变化的适应性,并提供托管执行、隔离浏览器、调度与失败告警,附有完整实现的示例仓库。
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
开发者可通过 AWS vLLM-Omni DLC 在 Amazon SageMaker AI 上部署 Qwen3-TTS,实现无需等待完整响应生成的流式语音播放。教程使用持久双向连接发送文本并接收音频块,提供部署脚本和 Gradio 客户端示例。
AWS 宣布 Claude Sonnet 5.5 今日在 Amazon Bedrock 和 Claude Platform on AWS 上线,面向范围明确的编码与知识工作。
推荐理由:文中按判断密集型与执行路径明确的任务划分两款模型的分工,为企业在编码和知识工作中选择模型提供了具体参考。
OpenAI 在周二的 DevDay 宣布为 Codex 增加可跨设备访问的可复用云开发环境,让远程任务环境更持久、可配置。这些环境旨在加快任务启动,并为团队提供采用获批设置与权限的共享工作空间;Codex CLI 同时新增语音任务控制和 /agents 多任务视图,ChatGPT 桌面应用也加入代码审查体验。
Amazon Bedrock 新增 Claude 模型印度境内推理支持,通过地理跨区域推理将数据处理限定在印度。可用模型包括 Claude Opus 5、Claude Sonnet 5 和 Claude Haiku 4.5。请求仅在孟买与海得拉巴区域之间路由,用户可通过控制台或 API 访问。
Amazon Bedrock 现支持在首尔对 Claude Opus 5 和 Claude Sonnet 5、在新加坡对 Claude Sonnet 5 进行区域内推理。请求和数据全程留在指定区域,吞吐量受该区域容量及服务配额限制。用户可通过控制台或 bedrock-runtime 端点调用。
GPT-6.1 Sol 现已在 Amazon Bedrock 正式可用,作为 GPT-6 Sol 的重大升级,增强了智能体编码、计算机使用和专业工作中的推理能力。
推荐理由:文中将推理质量与完成任务所需的交互次数联系起来,为评估智能体成本提供了比单看模型 token 单价更完整的比较视角。
OpenAI 未公开加入 Nvidia 的 Open Agent Safety Platform 联盟,但其发言人表示支持该工作,双方也在 OpenShell 等智能体安全技术上合作。
OpenAI 在 DevDay 2026 推出常驻智能体 Dots,运行于 GPT-6 Astra,可在独立云端电脑上持续处理工作任务。Dots 可连接超过 4,000 个应用,并在 ChatGPT、Slack 和 Microsoft Teams 间保留上下文;主动后台研究仅使用只读工具,执行操作则受用户规则和审批约束。
推荐理由:独立云端电脑与只读后台研究的区分,提供了理解常驻智能体权限边界的具体参照,也厘清了主动发现任务与执行操作的差别。
AWS 展示了用 Amazon Quick 与 Amazon Bedrock AgentCore 构建合同智能平台的架构,通过结构化提取支持跨合同汇总,并保留原文检索能力。
推荐理由:将跨文档汇总交给结构化数据库、单文档查找留给检索,为大量非结构化文档同时支持统计与问答提供了可迁移的架构方法。
Condé Nast 与 AWS 基于 Amazon Bedrock 构建多模态视频检索系统,将超过 140,000 条视频库的单次内容查找时间从 250 分钟缩短至约 2 分钟。
企业将 AI 从试验转向生产时,应按持续需求和利用率评估按量付费与自有算力,让 AI 投入成为可优化的资产。自有算力并非天然更便宜,成本交叉点取决于实际工作负载、模型、性能要求及运营成本。企业还需通过用户采用、治理和用例扩展保持算力有效利用,才能兑现投资价值。
OpenAI DevDay 2026 带来超过 20 项公告,涵盖 GPT-6 Astra、ChatGPT 和 Codex。公告内容还包括 API、安全及面向开发者的新工具。
Amazon Bedrock 已上线 xAI 的 Grok 4.7,提供 500K token 上下文窗口,以及 low、medium、high、xhigh 四档推理强度。
Mistral 在德国慕尼黑设立新中心,部署 Physics AI 与工业 AI 专项研究团队及面向企业伙伴的应用工程师。该中心正与 BMW 合作开展碰撞模拟和工程 AI 项目,并与 Siemens Energy 合作开发工业 AI 应用。Mistral 还与慕尼黑工业大学建立研究合作,利用风洞设施开发汽车空气动力学数字孪生。
Import AI 第 474 期汇总了 Michael Levin 的柏拉图式心智空间假说、Google 将 TPU 送入太空的准备,以及智谱用 GLM-5.3 优化自身推理基础设施的实践。
OpenRouter 联合创始人兼 CEO Alex Atallah 与 AMP 的 Anjney Midha 在访谈中复盘平台从早期多模型押注到加入 Stripe 的历程。
推荐理由:访谈把模型训练后的分发难题与开发者接入体验联系起来,为理解中立推理平台为何不只是接口封装提供了具体商业背景。
AWS 展示了结合 Amazon EKS、EFA 与 DeepEP 的 MoE 强化学习扩展架构,吞吐量提升 40%。该架构通过 Amazon EKS 编排大规模训练,并以 DeepEP 优化 EFA 上的专家并行通信,协调 rollout 生成与策略训练,缓解跨节点通信瓶颈。
Amazon SageMaker HyperPod 可结合开源框架 SkyRL 运行多模态强化学习训练,并提供故障恢复与训练监控能力。教程以 Qwen3-VL-8B 为例,从 VisGym SFT 检查点进行 GRPO 后训练,在固定的 64 个迷宫评测集上将通关率从 43.75% 提升至超过 95%。
NarrateAI 在 Amazon Bedrock 上结合五项质量保障技术,在生产部署中实现约 13 秒开始输出已校验响应、99.3 percent 的数值准确率。
Qwen3-TTS-12Hz-1.7B-Base 现可通过 Amazon SageMaker JumpStart 部署至全托管实时推理端点。模型仅需数秒参考音频及转录文本即可克隆声音,无需重新训练,支持跨语言克隆。部署方案使用预构建服务容器,生成 24 kHz 音频,并将音频数据保留在用户的 AWS 环境内。
Datacor 将 Amazon Quick Sight 集成到 TrackAbout,让业务用户自助分析租赁数据,无需为常规分析提交 IT 请求。方案内嵌交互式仪表板与生成式 BI 自然语言查询,并通过自动化跨云数据管道定期刷新数据,支持查看资产利用率、计费异常和收入回收趋势。
Amazon SageMaker HyperPod 与 Qumulo 的跨区域训练方案经验证,预热后可达到数据同区域训练的吞吐量。测试使用 LLaMA v3,在 60 ms 网络延迟下,吞吐量于前 100–150 批次内收敛至 115–117 samples/sec。方案通过预测缓存读取远端数据,无需完整复制数据集或修改代码。
Runway 的 GWM Worlds 2 研究预览通过 WorldPrompt 指定生成世界、首帧和带时间戳的事件,并支持实时输入动作提示词。团队在采访中解释,其音视频模型经过格式微调、自回归后训练和知识蒸馏,实现连续 720p、24 fps 视频与 48,000 Hz 音频生成。
AWS WhisperX 深度学习容器可部署到 Amazon SageMaker AI 实时或异步端点,提供逐词时间戳和说话人标签,无需构建自定义镜像。实时端点适合须在 60 秒内完成处理的短音频,异步端点推荐用于长音频;AWS Samples 提供可运行的部署示例。
Google 计划于 10 月 1 日发射 Project Suncatcher 的首颗实验卫星 MVP,以验证其轨道 AI 数据中心星座构想。MVP 大小约相当于一台冰箱,搭载 4 颗 Google 自研 TPU AI 加速器,太阳能板供电功率约为 1 千瓦。Google 原计划在 2027 年发射 2 颗定制卫星,为加快早期测试,改将芯片集成到 Planet Labs 已造好的卫星中。
LFM2.5-VL-DSpark 通过推测解码加速 LFM2.5-VL-3B,端侧解码最高提速 3.13x,且不改变输出质量。草稿模型增加约 280M 参数,增幅为 8.9%,端侧端到端最高提速 2.62x。模型已开放权重,支持 llama.cpp、MLX-VLM 和 SGLang。
GitHub Copilot 应用重构拉取请求视图,让庞大的代码差异与审查讨论仍能流畅渲染。团队以包含 2,200 个文件、超过百万行变更和超过 400 条行内审查评论的开源拉取请求进行测试。方案保留代码行虚拟化,将固定代码高度与动态评论高度分开计算,通过延迟测量及锚定修正减少滚动跳动。
Microsoft Research 对移动操作机器人工作负载的研究显示,将推理从机载 GPU 卸载至边缘或云端 GPU,可改善任务表现与电池续航。测试中,部分显存足够的 GPU 相比 A100 在建图与规划上减速最高达 383%,较轻量 GPU 的障碍物及时检测表现下降 30%,较小 GPU 上 VLA 模型的减速使准确率下降 50%。
Google 公布 Private AI Compute 架构更新方案,将引入私密的服务端持久记忆,以支持跨设备延续上下文并保持端侧隐私标准。方案把数据存入加密的用户专属数据库,解密密钥仅由个人设备持有,处理请求时通过端到端加密通道连接云端安全隔离区,在隔离内存中临时解密并将新增上下文加密保存。
NVIDIA 验证工程师 Sakeena Fiza 在量产前测试系统并排查故障,帮助硬件在规模化部署中可靠运行。她与团队从系统首次上电开始,跨硬件、固件、软件及机械设计定位问题,在真实使用条件下将硬件推至极限,力求在客户遇到故障前发现隐患。
NVIDIA 与合作伙伴在新加坡 AI Day 展示东南亚 AI 进展,涵盖公共部门规模化部署及区域语言模型开发。AI Singapore 正将 Nemotron 开放模型和 NeMo 工具纳入 SEA-LION 模型家族。Viettel AI 针对越南语和智能体应用微调 Nemotron 3 Super,在 VMLU 评测中排名最高。
NVIDIA 在 ROSCon 发布免费开源的 Isaac ROS 5.0,新增智能体开发工作流,并支持 ROS Lyrical 和 Ubuntu 24.04。
oMLX 创建者兼维护者 Jun Kim 加入 Hugging Face,将继续领导项目并为 MLX 社区贡献力量。oMLX 将从业余项目转为获得资金支持、持续维护的项目,保持 Apache 2.0 许可证,团队希望借此提高稳定性并加快开发。Hugging Face 的一项具体重点是简化 transformers 模型定义到参考 MLX 实现的转换,让不同引擎复用这些实现并专注于各自的特色功能。
Hugging Face 为 Transformers 新增高效运行 GGUF 量化模型的支持,通过复用 ggml 内核并优化 generate,初期面向 Apple Silicon 本地推理。
NVIDIA 推出 DSX Ready 资格认证计划,验证合作伙伴产品是否符合适用的 NVIDIA DSX AI 工厂参考设计要求。首批覆盖电池储能系统(BESS)和冷却分配单元(CDU),后续将扩展至更多基础设施及软件类别。认证帮助建设方评估产品、降低集成风险,但不替代现场工程评估。
NVIDIA 将物理 AI 的规模化部署安全落实到硬件、软件、AI 行为及运行环境,并以 Halos 提供全栈支持。动态环境、模型更新及复杂场景要求安全验证贯穿设计、部署与验证,而非仅在部署前检查。Halos 覆盖自动驾驶与机器人,结合仿真、真实世界验证和可重复检查,为第三方系统级认证做准备。
埃及 AI 生态正迈向规模化生产应用,NVIDIA 支持的本地企业已在语音、医疗、机器人等领域开展开发。NVIDIA Deep Learning Institute 在埃及的学员规模一年内增至十倍以上。Cassava 与 Vodafone Egypt 近日宣布 AI 工厂计划,通过 GPU 即服务提供本地基础设施,让数据留在境内。