Skip to content

搭建视频工作流(以 Wan2.2 为例)

视频生成是 AI 短剧的关键。ComfyUI 里目前最主流、最稳的开源视频模型是阿里的 Wan 2.2。本篇以它为例,带你搭「文生视频」和「图生视频」两条工作流。

视频工作流和图片工作流的关系

结构几乎一样,只是把「画布(Empty Latent Image)」换成了「视频画布」,并把「VAE Decode」换成视频专用解码。核心链路不变:

text
加载模型 → 视频画布 → 提示词 → 采样 → 解码视频 → 保存视频

视频工作流示意图

准备工作:下载 Wan2.2 模型

Wan 2.2 拆成三个文件(都在 Hugging Face 的 Comfy-Org/Wan_2.2_ComfyUI_Repackaged):

文件放到作用
wan2.2_ti2v_5B_fp16.safetensorsmodels/diffusion_models/5B 混合模型(文生+图生二合一)
umt5_xxl_fp8_e4m3fn_scaled.safetensorsmodels/text_encoders/文字编码器
wan2.2_vae.safetensorsmodels/vae/视频解码器

TIP

新手选 5B 版本即可,8GB 显存就能跑(ComfyUI 自带显存优化)。14B 画质更好但要 20GB+ 显存。

文生视频工作流(5B TI2V)

节点顺序(用 Load Diffusion Model 替代 Load Checkpoint):

text
Load Diffusion Model(wan2.2_ti2v_5B) ──→ KSampler
Load CLIP(umt5) ──→ CLIP Text Encode(正向/负向) ──→ KSampler
Load VAE(wan2.2_vae) ──→ VAE Decode
EmptyHunyuanLatentVideo(宽高+帧数) ──→ KSampler
KSampler ──→ VAE Decode ──→ Save Video

三个视频特有参数

参数建议值说明
length(帧数)49~81 帧24fps 下约 2~3.4 秒,越长越慢越容易崩
width / height832×480 或 480×832竖屏短剧用高>宽
prompt见《提示词怎么写》视频篇动作描述要具体

图生视频工作流(I2V)

多加一个 Load Image 作为首帧

text
Load Image(首帧图) → Wan22ImageToVideoLatent → KSampler → VAE Decode → Save Video

思路:先用文生图工作流做出「定妆照/分镜图」,再喂给图生视频变成动态镜头。这样角色长相、构图都是锁死的——这就是直播课老师强调的一致性

进阶:首尾帧视频(FLF2V)

上传「开始图」和「结束图」两张图,AI 会生成中间过渡:

text
Load Image(开始帧) ─┐
                    ├→ WanFirstLastFrameToVideo → KSampler → 保存
Load Image(结束帧) ─┘

适合做「转场」「变身」「场景切换」等短剧常用效果。

视频工作流常见问题

  • 出视频很慢 → 视频生成本就耗时,帧数、分辨率、steps 是主要成本,先降低这三样测试。
  • 画面闪烁/跳动 → 帧数别太多、运动描述别太夸张,固定 seed 重跑对比。
  • 人物动作不对 → 提示词里把「谁、做什么动作、镜头怎么动」写清楚(见下篇视频提示词模板)。
  • 显存不够 → 换 5B 模型、降分辨率、用云版。

扩展:更多视频模型

  • LTX-2 / LTX-2.3:更快更小,适合快速迭代。
  • Hunyuan Video(混元):腾讯开源,中文理解好。
  • Kling / Runway / MiniMax H3:商业 API 节点(部分要付费),画质顶尖。

下一篇

提示词怎么写(0 基础版)