两阶段2 倍上采样音频

IC-LoRA 区域重绘 —— 两阶段

在视频上遮罩一块区域 —— 要去掉的物体、要替换的招牌、要换的脸 —— LTX-2.5 只重绘这块区域,并与周围帧保持一致。两阶段保证细节;原音频可保留。

阶段数
两阶段
上采样
有 (2×)
条件输入
视频 + 遮罩(+ 冻结的音频)
适合
替换或移除现有素材中的某个区域
输出
视频 + 音频

所需模型

把每个文件放到 ComfyUI/models/ 下对应的目录,或者让 Workflow Overview 一键下载。

文件目录大小用途链接
ltx-2.5-22b-distilled-transformer-bf16.safetensorsComfyUI/models/diffusion_models/42 GBLTX-2.5 22B 蒸馏版主模型 —— 所有示例工作流都用它。采样步数少,面向快速迭代。Hugging Face
低显存替代
ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
ComfyUI/models/diffusion_models/21.5 GBINT8 —— 体积约减半,24 GB 显卡的常用选择。Hugging Face
低显存替代
ltx-2.5-22b-distilled-transformer-nvfp4.safetensors
ComfyUI/models/diffusion_models/18.7 GBNVFP4 —— 体积最小;需要支持 FP4 的 NVIDIA 显卡(Blackwell 架构)。Hugging Face
gemma4-12b-with-proj-ltx-2.5-bf16.safetensorsComfyUI/models/text_encoders/26.3 GB带 LTX-2.5 投影层的 Gemma 4 12B 文本编码器 —— 把提示词转成条件向量。所有工作流必需。Hugging Face
低显存替代
gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
ComfyUI/models/text_encoders/15.4 GBINT8 文本编码器 —— 磁盘和内存各省约 11 GB。Hugging Face
ltx-2.5-video-vae-bf16.safetensorsComfyUI/models/vae/1.5 GB视频 VAE —— 编码输入帧、把生成的潜变量解码为像素。Hugging Face
ltx-2.5-video-vae-conv-bf16.safetensorsComfyUI/models/vae/1.5 GB示例工作流解码路径引用的卷积版视频 VAE。Hugging Face
ltx-2.5-audio-vae-bf16.safetensorsComfyUI/models/vae/0.4 GB音频 VAE —— 解码 LTX-2.5 与视频同步生成的音轨。Hugging Face
ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensorsComfyUI/models/latent_upscale_models/1 GB2 倍潜空间空间上采样器 —— 所有两阶段工作流的第二阶段。Hugging Face
ltx-2.3-22b-ic-lora-in-outpainting-0.9.safetensorsComfyUI/models/loras/IC-LoRA:对参考视频做区域重绘(inpaint)或画幅外扩(outpaint)。Hugging Face
合计 ≈ 72.7 GB(bf16,不含 LoRA)查看完整模型清单

使用方法

  1. 1

    打开 ComfyUI(较新版本,并已通过 Manager 安装 ComfyUI-LTXVideo)。

  2. 2

    Workflow → Open 选择下载的 .json,或把文件直接拖到画布上。

  3. 3

    打开 Workflow Overview → Missing Models → Download all,等待文件下载完成。

  4. 4

    加载参考视频和对应的遮罩(白色 = 重绘)。

  5. 5

    描述遮罩区域应该出现什么。

  6. 6

    Run —— 两个阶段都会遵守遮罩。

显存

运行这个工作流,你的显卡该选哪个主模型版本。

显存示例显卡结论主模型建议
24 GBRTX 3090、4090、A5000可用int8可用:INT8 主模型 + INT8 文本编码器 + 低显存加载节点。两阶段工作流能跑;解码 tile 保持小尺寸。bf16 文件留给 32 GB+ 的显卡。
32 GBRTX 5090、V100 32G宽裕bf16Lightricks 官方的最低要求。bf16 主模型配低显存加载节点可以放下;INT8 文本编码器能腾出空间给更大的解码 tile 和更长的片段。
48 GB+RTX 6000 Ada、A6000、H100宽裕bf16全部 bf16、无需卸载。调大解码 tile(见每个工作流内的 Decode 说明)可以明显提速。

官方要求 32 GB+。更低档位是针对量化版本的经验参考。

显存不到 24 GB?

同一个 LTX-2 模型可以直接在浏览器里跑 —— 4K 带音频,零配置,注册送积分。

免费在线生成

故障排查

常见问题

工作流 © Lightricks,LTX-2 Community License。链接均指向官方仓库: Lightricks/ComfyUI-LTXVideo