在 SageMaker AI 上使用 vLLM-Omni 生成图像和视频教程(第 2 部分)
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
AWS 的示例在 SageMaker AI 上使用同一 vLLM-Omni 容器部署图像与视频端点,实现从文本生成图像再转为短视频。FLUX.2-klein-4B 通过实时推理生成图像,Wan2.1-VACE-1.3B 通过异步推理生成视频,MP4 存入 Amazon S3。
Google Research 提出 Diffusion Controller,将图像去噪重构为连续控制问题,统一生成引导与微调方法。其轻量附加网络在冻结基础模型时改善人类偏好匹配,允许修改内部权重的微调版本相对基线取得 90% 胜率。实验采用 Stable Diffusion v1.4,以 HPS-v2 评估表现。
Hugging Face 展示了如何用 Gradio Workflow 构建 Workflow1111,以 73 个节点、11 条媒体流水线重建 AUTOMATIC1111 的大部分功能。
推荐理由:将模型调用与本地处理统一为节点,并从输出自动生成接口,提供了把多模型演示转为可共享、可编程调用应用的具体方法。
作者用 TRL 和 OpenEnv 复现了以强化学习训练 Qwen3.5-35B-A3B 编写 p5.brush 水彩绘画代码的方法,并公开数据、环境、脚本和训练产物。
Google Research 从数学机制解释扩散模型的创造力,指出训练中的正则化会平滑得分函数,使模型生成训练样本之间的新数据,而非仅复制样本。实验显示,权重衰减越强,学到的得分函数越平滑;即使没有显式正则化,基于梯度的训练也可能通过隐式正则化产生这一效果。
Google DeepMind 发布 Nano Banana 2 Lite,并向开发者开放 Gemini Omni Flash,分别用于快速图像生成和视频生成、对话式编辑。
推荐理由:文中明确区分图像模型的速度、成本与质量定位,并列出视频模型的输入处理限制,为多媒体工作流选型提供具体依据。