图生视频:让一张分镜图动起来
文生视频适合从零构思镜头,但实际做分镜的时候,画面往往已经定了 —— 这时候用图生视频,把构图交给图片,模型只管"让它动"。 好消息是整个模型栈和文生视频完全一样,只多一个节点。
一、和文生视频差在哪
| 项目 | 文生视频 | 图生视频 |
|---|---|---|
| 模型(底模 / LoRA / CLIP / 双 VAE) | 完全一致,同一套文件 | |
| 起始节点 | 无 | 多一个 LoadImage |
| 提示词作用 | 描述画面内容 | 只描述运动和镜头 |
| 分辨率 / 帧数 / 步数 | 768×768 · 64 帧 · 4 步 | 同上(14 个节点 vs 13 个) |
模型文件与参数和上一篇完全相同,这里不再重复列 —— 需要的可以看 文生视频那篇的模型清单。
二、节点链路
LoadImage ──→ (参考图) ──────┐
UNETLoader ─→ LoRA ─→ SigmaShift ─┤
CLIPLoader ───────────────────────┤
VAELoader ×2 ─────────────────────┤
↓
MiniMaxH3ImageToVideo(prompt="运动描述")
↓
KSampler → CreateVideo → SaveVideo
唯一的变化:参考图接进 MiniMaxH3ImageToVideo 的 image 输入,
采样和输出部分原封不动。
三、提示词怎么写
图生视频的提示词要换个思路:画面已经给了,你说的是"接下来怎么动"。
| 要表达的 | 示例写法 |
|---|---|
| 角色动作 | the character moves naturally, slight head turn |
| 镜头运动 | subtle camera push-in / slow pan to the right |
| 整体质感 | cinematic, 4k, shallow depth of field |
一个常见误区:把出图时的提示词原样粘过来。那等于让模型把画面重画一遍,
结果就是角色变脸、构图漂移。图生视频的提示词只写动态。
四、参数与注意点
- 参考图比例:尽量和输出尺寸一致。方图的分镜就出 768×768, 横图就换 768×512 一类的比例,别让它自己拉伸。
- 帧数:同样是 64 帧 @24fps ≈ 2.7 秒。多镜头就出多条再剪,不要硬拉长单条。
- 动作幅度:提示词写得越剧烈,越容易出现变形。分镜素材的角色漂移几乎都来自这一条。
- 音频:和文生视频一样,
fl2va版本画面与声音一起出,不需要额外的音频流程。
五、什么场景用它
- 分镜已经定稿,需要把它变成可剪辑的镜头素材;
- 要保持角色形象一致 —— 先用出图工作流把人物定下来,再让每张图动;
- 镜头接续:上一镜的尾帧当作下一镜的参考图,做画面延续。
实际做的时候,这两条路线通常是配合用的:文生视频出关键画面 → 挑满意的当分镜 → 图生视频让它动起来。