ComfyUI-MiniMaxH3-TeaCache-old:基于 ComfyUI 的 MiniMax H3 视频生成加速项目

用户可用于加速 MiniMax H3 视频生成,显著减少渲染时间。核心功能是通过时间步缓存技术,在保证质量的前提下实现约 66.7% 的速度提升,支持多场景,纯 Python 实现无需编译,跨平台且开源。【此简介由AI生成】

分支1Tags1

ComfyUI-MiniMaxH3-TeaCache

ComfyUI 中 MiniMax H3 视频生成的时间步缓存加速工具。开源支持 Linux/Windows/macOS。完全从零编写,不含 .pyd 文件。

状态

实际效果(v0.1 版本)

基准(无缓存) TeaCache thresh=0.15 差异
总耗时 306.22 秒 102.08 秒 -66.7%(3.0 倍加速)
采样阶段(20 步) 246 秒 87 秒 -64.6%
平均每步耗时 12.33 秒 4.38 秒 —
感知质量 参考水平 A/B 对比下与参考水平一致 —

测试环境:MiniMax H3 fl2va int8_convrot,res_multistep + simple 调度器,20 步,1024×576 分辨率,长度 124 帧(约 5.2 秒),固定随机种子 42,硬件为 NVIDIA CMP 170HX(GA100,sm_80,64 GB 改装显存)。基准测试与缓存测试使用完全相同的输入。

加速比超越闭源竞品(TE-Speed 宣传为 45%;本工具在默认阈值下实测为 66%)。此结果在非 H3 模型或非 Ampere 架构硬件上是否依然成立有待验证。

功能说明

MiniMax H3 的 DiT 采样器为每个 5 秒视频运行 20 次约 70 亿参数 transformer 的前向传播。相邻时间步会产生极为相似的模块输出,因此我们将一次前向传播的输出复用至接下来的 k 步,前提是累积的输入变化量保持在阈值以下。

参考资料:时间步嵌入感知缓存(Liu et al. 2024)。

参考资料:时间步嵌入感知缓存(Liu et al. 2024)。

与 TE-Speed-MiniMaxH3 的区别

TE-Speed(tl2012tl) 本仓库
许可证 闭源 MIT
源码形式 仅 Windows .pyd Python(Linux/Win/Mac)
model.py 补丁 提供修改后的 comfy/ldm/minimax/model.py 使用 ComfyUI 官方 set_model_unet_function_wrapper — 无需修改核心代码
分发渠道 Bilibili + 夸克网盘 GitHub

采用相同的底层技术(自适应步长缓存),基于公开论文独立实现。

安装

cd ComfyUI/custom_nodes
git clone https://github.com/Icyoung/ComfyUI-MiniMaxH3-TeaCache
# no build step, no compile — pure Python

重启 ComfyUI。一个名为 MiniMaxH3 TeaCache 的新节点将出现在 advanced/model 目录下。

使用方法

将该节点插入到您的 UNETLoader 与引导器之间:

UNETLoader → MiniMaxH3 TeaCache → CFGGuider / BasicGuider → SamplerCustomAdvanced

参数:

  • rel_l1_thresh:相对 L1 距离阈值,低于此值时我们将重用先前的输出。默认值为 0.15。值越低,质量越高,但加速效果越不明显。取值范围为 [0.05, 0.5]。
  • start_step:缓存开始生效的第一步(早期步骤对结构至关重要,不可跳过)。默认值为 2。
  • end_step:缓存的最后一步(最终步骤决定细节,同样不可跳过)。默认值为 -2(即最后 2 步)。

可复现性(供审阅者参考)

在 rel_l1_thresh 固定的情况下,缓存决策是确定性的——相同的种子 + 相同的提示词,无论 TeaCache 是否开启,生成的潜在变量(latents)在数值容差范围内都是完全一致的。

基准测试

v0.1 版本后待定。硬件:NVIDIA CMP 170HX(GA100,sm_80,64GB 改装显存)。此配置仅作校准参考;其他显卡的绝对时间可能不同,但加速比例具有可比性。

贡献指南

欢迎提交 PR。请在 PR 描述中包含简短的基准测试差异(前后对比)。

相关工作

许可证

MIT。

项目介绍

用户可用于加速 MiniMax H3 视频生成,显著减少渲染时间。核心功能是通过时间步缓存技术,在保证质量的前提下实现约 66.7% 的速度提升,支持多场景,纯 Python 实现无需编译,跨平台且开源。【此简介由AI生成】

定制我的领域