搭建视频工作流(以 Wan2.2 为例)
视频生成是 AI 短剧的关键。ComfyUI 里目前最主流、最稳的开源视频模型是阿里的 Wan 2.2。本篇以它为例,带你搭「文生视频」和「图生视频」两条工作流。
视频工作流和图片工作流的关系
结构几乎一样,只是把「画布(Empty Latent Image)」换成了「视频画布」,并把「VAE Decode」换成视频专用解码。核心链路不变:
text
加载模型 → 视频画布 → 提示词 → 采样 → 解码视频 → 保存视频准备工作:下载 Wan2.2 模型
Wan 2.2 拆成三个文件(都在 Hugging Face 的 Comfy-Org/Wan_2.2_ComfyUI_Repackaged):
| 文件 | 放到 | 作用 |
|---|---|---|
wan2.2_ti2v_5B_fp16.safetensors | models/diffusion_models/ | 5B 混合模型(文生+图生二合一) |
umt5_xxl_fp8_e4m3fn_scaled.safetensors | models/text_encoders/ | 文字编码器 |
wan2.2_vae.safetensors | models/vae/ | 视频解码器 |
TIP
新手选 5B 版本即可,8GB 显存就能跑(ComfyUI 自带显存优化)。14B 画质更好但要 20GB+ 显存。
文生视频工作流(5B TI2V)
节点顺序(用 Load Diffusion Model 替代 Load Checkpoint):
text
Load Diffusion Model(wan2.2_ti2v_5B) ──→ KSampler
Load CLIP(umt5) ──→ CLIP Text Encode(正向/负向) ──→ KSampler
Load VAE(wan2.2_vae) ──→ VAE Decode
EmptyHunyuanLatentVideo(宽高+帧数) ──→ KSampler
KSampler ──→ VAE Decode ──→ Save Video三个视频特有参数
| 参数 | 建议值 | 说明 |
|---|---|---|
| length(帧数) | 49~81 帧 | 24fps 下约 2~3.4 秒,越长越慢越容易崩 |
| width / height | 832×480 或 480×832 | 竖屏短剧用高>宽 |
| prompt | 见《提示词怎么写》视频篇 | 动作描述要具体 |
图生视频工作流(I2V)
多加一个 Load Image 作为首帧:
text
Load Image(首帧图) → Wan22ImageToVideoLatent → KSampler → VAE Decode → Save Video思路:先用文生图工作流做出「定妆照/分镜图」,再喂给图生视频变成动态镜头。这样角色长相、构图都是锁死的——这就是直播课老师强调的一致性。
进阶:首尾帧视频(FLF2V)
上传「开始图」和「结束图」两张图,AI 会生成中间过渡:
text
Load Image(开始帧) ─┐
├→ WanFirstLastFrameToVideo → KSampler → 保存
Load Image(结束帧) ─┘适合做「转场」「变身」「场景切换」等短剧常用效果。
视频工作流常见问题
- 出视频很慢 → 视频生成本就耗时,帧数、分辨率、steps 是主要成本,先降低这三样测试。
- 画面闪烁/跳动 → 帧数别太多、运动描述别太夸张,固定 seed 重跑对比。
- 人物动作不对 → 提示词里把「谁、做什么动作、镜头怎么动」写清楚(见下篇视频提示词模板)。
- 显存不够 → 换 5B 模型、降分辨率、用云版。
扩展:更多视频模型
- LTX-2 / LTX-2.3:更快更小,适合快速迭代。
- Hunyuan Video(混元):腾讯开源,中文理解好。
- Kling / Runway / MiniMax H3:商业 API 节点(部分要付费),画质顶尖。