推荐两阶段2 倍上采样音频
文生视频 / 图生视频 —— 两阶段
LTX-2.5 在 ComfyUI 里的推荐默认工作流。第一阶段根据提示词(可选首帧图)以基础分辨率采样;随后潜变量做 2 倍空间上采样并再精修 3 步 —— 大部分细节纹理来自这一步。音频在同一次推理中生成并混入输出。
阶段数
两阶段
上采样
有 (2×)
条件输入
文本 + 可选首帧图片
适合
看重画面细节时的默认选择
输出
视频 + 音频
所需模型
把每个文件放到 ComfyUI/models/ 下对应的目录,或者让 Workflow Overview 一键下载。
| 文件 | 目录 | 大小 | 用途 | 链接 |
|---|---|---|---|---|
ltx-2.5-22b-distilled-transformer-bf16.safetensors | ComfyUI/models/diffusion_models/ | 42 GB | LTX-2.5 22B 蒸馏版主模型 —— 所有示例工作流都用它。采样步数少,面向快速迭代。 | Hugging Face |
↳ 低显存替代 ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors | ComfyUI/models/diffusion_models/ | 21.5 GB | INT8 —— 体积约减半,24 GB 显卡的常用选择。 | Hugging Face |
↳ 低显存替代 ltx-2.5-22b-distilled-transformer-nvfp4.safetensors | ComfyUI/models/diffusion_models/ | 18.7 GB | NVFP4 —— 体积最小;需要支持 FP4 的 NVIDIA 显卡(Blackwell 架构)。 | Hugging Face |
gemma4-12b-with-proj-ltx-2.5-bf16.safetensors | ComfyUI/models/text_encoders/ | 26.3 GB | 带 LTX-2.5 投影层的 Gemma 4 12B 文本编码器 —— 把提示词转成条件向量。所有工作流必需。 | Hugging Face |
↳ 低显存替代 gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors | ComfyUI/models/text_encoders/ | 15.4 GB | INT8 文本编码器 —— 磁盘和内存各省约 11 GB。 | Hugging Face |
ltx-2.5-video-vae-bf16.safetensors | ComfyUI/models/vae/ | 1.5 GB | 视频 VAE —— 编码输入帧、把生成的潜变量解码为像素。 | Hugging Face |
ltx-2.5-video-vae-conv-bf16.safetensors | ComfyUI/models/vae/ | 1.5 GB | 示例工作流解码路径引用的卷积版视频 VAE。 | Hugging Face |
ltx-2.5-audio-vae-bf16.safetensors | ComfyUI/models/vae/ | 0.4 GB | 音频 VAE —— 解码 LTX-2.5 与视频同步生成的音轨。 | Hugging Face |
ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors | ComfyUI/models/latent_upscale_models/ | 1 GB | 2 倍潜空间空间上采样器 —— 所有两阶段工作流的第二阶段。 | Hugging Face |
合计 ≈ 72.7 GB(bf16,不含 LoRA)查看完整模型清单
使用方法
- 1
打开 ComfyUI(较新版本,并已通过 Manager 安装 ComfyUI-LTXVideo)。
- 2
Workflow → Open 选择下载的 .json,或把文件直接拖到画布上。
- 3
打开 Workflow Overview → Missing Models → Download all,等待文件下载完成。
- 4
在 Inputs 面板输入提示词。用一个场景描述主体、运动、镜头与光线。
- 5
可选:加载一张静态图作为首帧,即为图生视频。
- 6
设置时长(帧数必须是 1 + 8 的倍数;工作流会自动按 fps × 秒数换算)。
- 7
点击 Run。第一阶段、上采样、精修依次执行;输出节点显示带音频的成片。
显存
运行这个工作流,你的显卡该选哪个主模型版本。
| 显存 | 示例显卡 | 结论 | 主模型 | 建议 |
|---|---|---|---|---|
| 24 GB | RTX 3090、4090、A5000 | 可用 | int8 | 可用:INT8 主模型 + INT8 文本编码器 + 低显存加载节点。两阶段工作流能跑;解码 tile 保持小尺寸。bf16 文件留给 32 GB+ 的显卡。 |
| 32 GB | RTX 5090、V100 32G | 宽裕 | bf16 | Lightricks 官方的最低要求。bf16 主模型配低显存加载节点可以放下;INT8 文本编码器能腾出空间给更大的解码 tile 和更长的片段。 |
| 48 GB+ | RTX 6000 Ada、A6000、H100 | 宽裕 | bf16 | 全部 bf16、无需卸载。调大解码 tile(见每个工作流内的 Decode 说明)可以明显提速。 |
官方要求 32 GB+。更低档位是针对量化版本的经验参考。
显存不到 24 GB?
同一个 LTX-2 模型可以直接在浏览器里跑 —— 4K 带音频,零配置,注册送积分。
故障排查
常见问题
工作流 © Lightricks,LTX-2 Community License。链接均指向官方仓库: Lightricks/ComfyUI-LTXVideo