两阶段2 倍上采样音频

音频生视频 —— 两阶段

输入一段音频(可裁剪起点和时长)。工作流将其编码后在两个阶段都冻结这些音频 token,让画面按声音生成,最后把原始波形混入成片 —— 不做音频解码、不会漂移。可选首帧图。

阶段数
两阶段
上采样
有 (2×)
条件输入
音频(冻结)+ 可选图片
适合
需要对齐配乐、音乐或旁白的视频
输出
视频 + 音频

所需模型

把每个文件放到 ComfyUI/models/ 下对应的目录,或者让 Workflow Overview 一键下载。

文件目录大小用途链接
ltx-2.5-22b-distilled-transformer-bf16.safetensorsComfyUI/models/diffusion_models/42 GBLTX-2.5 22B 蒸馏版主模型 —— 所有示例工作流都用它。采样步数少,面向快速迭代。Hugging Face
低显存替代
ltx-2.5-22b-distilled-transformer-comfy-int8-convrot.safetensors
ComfyUI/models/diffusion_models/21.5 GBINT8 —— 体积约减半,24 GB 显卡的常用选择。Hugging Face
低显存替代
ltx-2.5-22b-distilled-transformer-nvfp4.safetensors
ComfyUI/models/diffusion_models/18.7 GBNVFP4 —— 体积最小;需要支持 FP4 的 NVIDIA 显卡(Blackwell 架构)。Hugging Face
gemma4-12b-with-proj-ltx-2.5-bf16.safetensorsComfyUI/models/text_encoders/26.3 GB带 LTX-2.5 投影层的 Gemma 4 12B 文本编码器 —— 把提示词转成条件向量。所有工作流必需。Hugging Face
低显存替代
gemma4-12b-with-proj-ltx-2.5-comfy-int8-convrot.safetensors
ComfyUI/models/text_encoders/15.4 GBINT8 文本编码器 —— 磁盘和内存各省约 11 GB。Hugging Face
ltx-2.5-video-vae-bf16.safetensorsComfyUI/models/vae/1.5 GB视频 VAE —— 编码输入帧、把生成的潜变量解码为像素。Hugging Face
ltx-2.5-video-vae-conv-bf16.safetensorsComfyUI/models/vae/1.5 GB示例工作流解码路径引用的卷积版视频 VAE。Hugging Face
ltx-2.5-audio-vae-bf16.safetensorsComfyUI/models/vae/0.4 GB音频 VAE —— 解码 LTX-2.5 与视频同步生成的音轨。Hugging Face
ltx-2.5-latent-spatial-upscaler-x2-bf16-1.0.safetensorsComfyUI/models/latent_upscale_models/1 GB2 倍潜空间空间上采样器 —— 所有两阶段工作流的第二阶段。Hugging Face
ltx-2.5-duration-head-bf16.safetensorsComfyUI/models/model_patches/0.05 GB音频类工作流使用的小型时长预测头。Hugging Face
合计 ≈ 72.8 GB(bf16,不含 LoRA)查看完整模型清单

使用方法

  1. 1

    打开 ComfyUI(较新版本,并已通过 Manager 安装 ComfyUI-LTXVideo)。

  2. 2

    Workflow → Open 选择下载的 .json,或把文件直接拖到画布上。

  3. 3

    打开 Workflow Overview → Missing Models → Download all,等待文件下载完成。

  4. 4

    加载音频文件,设置起始偏移和使用时长。

  5. 5

    在提示词里描述画面;可选加首帧图。

  6. 6

    点击 Run。两个阶段都冻结音频 token;输出包含你的原始音频。

显存

运行这个工作流,你的显卡该选哪个主模型版本。

显存示例显卡结论主模型建议
24 GBRTX 3090、4090、A5000可用int8可用:INT8 主模型 + INT8 文本编码器 + 低显存加载节点。两阶段工作流能跑;解码 tile 保持小尺寸。bf16 文件留给 32 GB+ 的显卡。
32 GBRTX 5090、V100 32G宽裕bf16Lightricks 官方的最低要求。bf16 主模型配低显存加载节点可以放下;INT8 文本编码器能腾出空间给更大的解码 tile 和更长的片段。
48 GB+RTX 6000 Ada、A6000、H100宽裕bf16全部 bf16、无需卸载。调大解码 tile(见每个工作流内的 Decode 说明)可以明显提速。

官方要求 32 GB+。更低档位是针对量化版本的经验参考。

显存不到 24 GB?

同一个 LTX-2 模型可以直接在浏览器里跑 —— 4K 带音频,零配置,注册送积分。

免费在线生成

故障排查

常见问题

工作流 © Lightricks,LTX-2 Community License。链接均指向官方仓库: Lightricks/ComfyUI-LTXVideo