作者:@AIwood爱屋研究室
MiniMax H3双采样进化:Self-Lift、TRT VAE与DLSS 5
一句话导读:这套 MiniMax H3 双采样工作流把 Self-Lift、H3 VAE TensorRT 和 DLSS 5 三项技术串在一起,分别减少高分辨率采样量、加快 VAE 编解码,并在成片端提供神经渲染、放大与插帧;但 RunningHub 当时的 DLSS 节点仍有问题,线上版本暂时只部署了 Self-Lift。
核心内容:
1. Self-Lift 的思路:它把原本分开的两次采样合并到一个采样器内,先以较低分辨率快速生成大致内容,再切换到高分辨率细化;切换时参考清晰但可能有瑕疵、稳定但可能模糊的两类结果,只修复更容易出问题的局部。作者称实验速度约提升 40%,同时希望降低重影、变形和文字错误。
2. 步数如何分配:示例主采样设置 8 步,加上 Sigma Refiner 的 1 步共 9 步,transition step 设为 7,意味着前 7 步跑低分辨率、最后 2 步跑高分辨率。普通文戏可尝试 6 步;激烈打斗更适合 8 步,否则快速动作容易出现像素化。
3. 低分辨率比例:总分辨率示例约为 2M、接近 1080P,低分辨率阶段设为其中 40%,约 0.8M。作者建议无论怎样调,都尽量保证低分辨率阶段不低于 480P,再结合显卡配置和最终尺寸寻找平衡。
4. 修复参数:视频展示了修复范围和力度相关参数。对 H3 模型,范围参数暂不建议拉满,示例保持为 0;力度测试值为 0.2 与 1.0,同时建议常用区间先在 0.3—0.7 内尝试。潜空间放大模型则在对应位置选择即可。
5. H3 VAE TensorRT:MiniMax H3 原生 VAE 的编码、解码都较慢,TensorRT 版本针对本机环境预编译后可显著缩短这部分耗时。安装节点和 TensorRT 依赖后,还需把 encoder、decoder 模型放入 ComfyUI 的 VAE 模型目录,并运行专用 compiler 节点生成当前环境可加载的文件。
6. TRT 使用边界:编译节点无需接入完整工作流,单独运行即可;依赖不正确时会在编译阶段失败。该节点只替代视频 VAE,音频 VAE 仍需单独接入,因此不能把它理解为整条音视频链路的一键替换。
7. DLSS 5 神经渲染:插件提供神经渲染、放大和插帧。神经渲染可以按预设改变皮肤、手部等细节与电影感,强度也可调;如果不喜欢人物风格被改变,作者在评论区明确答复可以关闭神经渲染,只做像素处理。
8. DLSS 5 放大:放大节点的特定模式才能强制启用神经渲染,其他模式可能报错。视频列出的档位包括原生模式、约 1.5 倍质量、约 1.724 倍平衡,以及 2 倍、3 倍性能模式;理论上 1080P 输入经 3 倍可到 6K 量级,但性能优先档的画质可能更差。
9. DLSS 5 插帧:插帧节点直接接收视频,可选择最高 120 帧输出、处理引擎、解码质量以及 H.264、H.265 等格式。它位于成片后处理阶段,不参与前面的 MiniMax H3 采样。
10. 为什么整体更快:虽然 Self-Lift 的低分辨率阶段可能高于旧双采样常用的 0.5 倍,但前几步推理本身较快,而且真正高分辨率只需 1—2 步;再配合 VAE 编解码加速,整体不会被分辨率提升完全抵消。评论区另有用户报告,在未用 TRT VAE 与 DLSS 5 的情况下,0.9M、15 秒素材二次采样约 150 秒;这只是其个人环境结果。
适合人群:希望在 MiniMax H3 中同时优化双采样速度、VAE 编解码和输出端放大插帧,并能自行处理 TensorRT 依赖与节点兼容性的 ComfyUI 用户。
补充说明:本文根据授权视频的完整音频转写、简介和默认第一页评论整理。Self-Lift 当时仍是实验节点;简介明确注明 RunningHub 的 DLSS 节点尚有缺陷,线上工作流暂只包含 Self-Lift,待节点修复后再更新。安装前请以各 GitHub 项目的最新说明和本机 CUDA、TensorRT 环境为准。
相关夸克网盘链接:
【模型、节点与工作流文件:https://pan.quark.cn/s/902211e9cdbe】 |