两阶段2 倍上采样音频
音频生视频 —— 两阶段
输入一段音频(可裁剪起点和时长)。工作流将其编码后在两个阶段都冻结这些音频 token,让画面按声音生成,最后把原始波形混入成片 —— 不做音频解码、不会漂移。可选首帧图。
阶段数
两阶段
上采样
有 (2×)
条件输入
音频(冻结)+ 可选图片
适合
需要对齐配乐、音乐或旁白的视频
输出
视频 + 音频
所需模型
把每个文件放到 ComfyUI/models/ 下对应的目录,或者让 Workflow Overview 一键下载。
| 文件 | 目录 | 大小 | 用途 | 链接 |
|---|---|---|---|---|
ltx-2.5-22b-distilled-transformer-bf16.safetensors | ComfyUI/models/diffusion_models/ | 42 GB | LTX-2.5 22B 蒸馏版主模型 —— 所有示例工作流都用它。采样步数少,面向快速迭代。 | Hugging Face |
↳ 低显存替代 ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors | ComfyUI/models/diffusion_models/ | 21.5 GB | INT8 —— 体积约减半,24 GB 显卡的常用选择。 | Hugging Face |
↳ 低显存替代 ltx-2.5-22b-distilled-transformer-nvfp4.safetensors | ComfyUI/models/diffusion_models/ | 18.7 GB | NVFP4 —— 体积最小;需要支持 FP4 的 NVIDIA 显卡(Blackwell 架构)。 | Hugging Face |
gemma4-12b-with-proj-ltx-2.5-bf16.safetensors | ComfyUI/models/text_encoders/ | 26.3 GB | 带 LTX-2.5 投影层的 Gemma 4 12B 文本编码器 —— 把提示词转成条件向量。所有工作流必需。 | Hugging Face |
↳ 低显存替代 gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors | ComfyUI/models/text_encoders/ | 15.4 GB | INT8 文本编码器 —— 磁盘和内存各省约 11 GB。 | Hugging Face |
ltx-2.5-video-vae-bf16.safetensors | ComfyUI/models/vae/ | 1.5 GB | 视频 VAE —— 编码输入帧、把生成的潜变量解码为像素。 | Hugging Face |
ltx-2.5-video-vae-conv-bf16.safetensors | ComfyUI/models/vae/ | 1.5 GB | 示例工作流解码路径引用的卷积版视频 VAE。 | Hugging Face |
ltx-2.5-audio-vae-bf16.safetensors | ComfyUI/models/vae/ | 0.4 GB | 音频 VAE —— 解码 LTX-2.5 与视频同步生成的音轨。 | Hugging Face |
ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensors | ComfyUI/models/latent_upscale_models/ | 1 GB | 2 倍潜空间空间上采样器 —— 所有两阶段工作流的第二阶段。 | Hugging Face |
ltx-2.5-duration-head-bf16.safetensors | ComfyUI/models/model_patches/ | 0.05 GB | 音频类工作流使用的小型时长预测头。 | Hugging Face |
合计 ≈ 72.8 GB(bf16,不含 LoRA)查看完整模型清单
使用方法
- 1
打开 ComfyUI(较新版本,并已通过 Manager 安装 ComfyUI-LTXVideo)。
- 2
Workflow → Open 选择下载的 .json,或把文件直接拖到画布上。
- 3
打开 Workflow Overview → Missing Models → Download all,等待文件下载完成。
- 4
加载音频文件,设置起始偏移和使用时长。
- 5
在提示词里描述画面;可选加首帧图。
- 6
点击 Run。两个阶段都冻结音频 token;输出包含你的原始音频。
显存
运行这个工作流,你的显卡该选哪个主模型版本。
| 显存 | 示例显卡 | 结论 | 主模型 | 建议 |
|---|---|---|---|---|
| 24 GB | RTX 3090、4090、A5000 | 可用 | int8 | 可用:INT8 主模型 + INT8 文本编码器 + 低显存加载节点。两阶段工作流能跑;解码 tile 保持小尺寸。bf16 文件留给 32 GB+ 的显卡。 |
| 32 GB | RTX 5090、V100 32G | 宽裕 | bf16 | Lightricks 官方的最低要求。bf16 主模型配低显存加载节点可以放下;INT8 文本编码器能腾出空间给更大的解码 tile 和更长的片段。 |
| 48 GB+ | RTX 6000 Ada、A6000、H100 | 宽裕 | bf16 | 全部 bf16、无需卸载。调大解码 tile(见每个工作流内的 Decode 说明)可以明显提速。 |
官方要求 32 GB+。更低档位是针对量化版本的经验参考。
显存不到 24 GB?
同一个 LTX-2 模型可以直接在浏览器里跑 —— 4K 带音频,零配置,注册送积分。
故障排查
常见问题
工作流 © Lightricks,LTX-2 Community License。链接均指向官方仓库: Lightricks/ComfyUI-LTXVideo