在 SageMaker AI 上使用 vLLM-Omni 生成图像和视频教程(第 2 部分)
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
Condé Nast 与 AWS 基于 Amazon Bedrock 构建多模态视频检索系统,将超过 140,000 条视频库的单次内容查找时间从 250 分钟缩短至约 2 分钟。
Google Research 介绍基于 Gemini 和 Veo 的多智能体视频研究,通过全局优化与世界状态跟踪改善长视频的叙事及视觉一致性。Co-Director 负责创意统筹,CANVAS 维护视觉记忆,A²RD 进行分段生成,VQQA 通过视觉问答反馈优化提示词而非直接编辑像素。
推荐理由:研究将长视频的一致性问题拆成创意规划、视觉记忆、分段生成与反馈优化,为理解多智能体如何缓解跨镜头漂移提供了具体框架。
Google DeepMind 推出 Gemini 3.8 Live with Live Avatar,将近实时视频生成与语音对话结合,即日起在 Gemini Enterprise 提供。
推荐理由:后台工具调用与持续对话并行,让虚拟形象不只承担视听呈现,也能在查询数据和处理任务时保持交互连贯。
invideo 借助 GPT‑6 Astra 更精准地规划剪辑,将色彩校正和调色效果提升至原来的 3 倍。它还可在一天内制作 50 个自定义效果。
Higgsfield AI 借助 GPT-6 Astra 在一天内推出新视频功能,加快创意工具面市。GPT-6 Astra 还让小企业更容易制作视频广告。
Google DeepMind 推出智能体式视频理解功能,支持 Gemini 3.7 Flash、3.6 Flash 和 3.5 Flash-Lite。该功能通过原生视频工具动态搜索和检查画面、音频及转录文本,官方基准显示 token 消耗最多降低 88%、分析成本最多降低 66%、准确率最多提升 7%。
推荐理由:相较固定帧率处理,按任务动态检索视频片段提供了降低长视频分析开销的具体路径,也给出了准确率与成本的对照。
Google DeepMind 推出 Gemini Omni 1.1 Flash,新增场景延长、首尾帧插值、360p 预览及最高 4K 放大输出等视频创作能力。
推荐理由:低分辨率预览与高分辨率输出被纳入同一视频工作流,为开发者在创意迭代成本和最终成片质量之间提供了具体取舍路径。
Google Research 的 AMIE (Video) 在涵盖 100 个场景、300 次模拟问诊的随机研究中,核心临床能力获评与初级保健医生相当。系统基于 Gemini 和 Project Astra,通过对话、规划、感知三个异步智能体并行处理交流、临床推理和视听线索,在引导患者演员进行虚拟体格检查方面的平均评分显著高于医生组及文本版 AMIE。
推荐理由:研究将视频问诊与文本问诊、医生问诊放在同一模拟框架中比较,帮助区分视听感知带来的收益与真实临床适用性的边界。
NVIDIA 发布手术机器人生成式仿真模型 Cosmos-H-Dreams,通过知识蒸馏和 FlashDreams,在单张 NVIDIA RTX PRO 6000 GPU 上实现约 160 帧/秒的闭环交互。
推荐理由:从离线轨迹生成转向实时闭环交互的技术路径,为理解手术机器人仿真如何同时降低生成成本与应对长序列误差提供了具体参考。
Google DeepMind 发布 Nano Banana 2 Lite,并向开发者开放 Gemini Omni Flash,分别用于快速图像生成和视频生成、对话式编辑。
推荐理由:文中明确区分图像模型的速度、成本与质量定位,并列出视频模型的输入处理限制,为多媒体工作流选型提供具体依据。
Google DeepMind 发布 Gemini Omni 系列首款模型 Gemini Omni Flash,支持结合图像、音频、视频和文本生成视频,并通过多轮对话编辑。
推荐理由:多模态参考输入与多轮对话编辑把视频生成延伸到持续修改的工作流,音频输入和输出模态的开放边界也有明确说明。