简体中文 English 日本語 Русский язык 한어

64

主题

0

回帖

1508

修为

执行合伙人

积分
3025

曼加塔第一期曼加塔第二期



作者:@AIwood爱屋研究室

Self-lift Avatar适配数字人:Minimax H3全身小脸口型不崩

Self-lift Avatar适配数字人:Minimax H3全身小脸口型不崩


一句话导读:针对 Self-lift 与既有数字人工作流不兼容、接入 Latent 报错的问题,作者在开源节点基础上做了 Avatar 适配改造,使 Minimax H3 全身/小脸场景也能稳定对上口型且不易崩脸,并给出可复用的双采样(音视频 Latent 合并)流程。

核心内容:
1. 痛点与改造动机:原版 Self-lift 发布后关注度高,但与作者既有数字人工作流不兼容,接入 Latent 会报错;作者在「饼老」节点基础上做了小幅魔改,使其可接入数字人链路。
2. 效果验证:演示工作流在脸占比很小的全身镜头下,口型仍能对齐,且不易出现常见崩脸;作者将其归因于 Self-lift 的像素/采样增强能力。
3. Self-lift Avatar 节点差异:工作流主体与普通 Self-lift 接近,关键是把节点换成 Self-lift Avatar。原节点难接入数字人,主要因为潜空间侧对 Mask 的约束——不吃 Mask,或只接受特定格式 Mask;经代码修改后可接入数字人音频 Mask。
4. 驱动方案选型:未继续使用安装成本高、体积偏大的「女武神」类节点,改用受「相速幻想 / Lap」启发的 LTX 思路——把音频编码后的 Latent 与空视频 Latent 合并,再一并送入采样器,相当于在潜空间内完成音画联合驱动。
5. 音频时长与帧数计算:前端用 SoundFall(原作者已停更,作者放到网盘供安装)读取音频长度(浮点秒),再转整数参与帧数计算;相对常规工作流额外 +24 帧(约 1 秒),一是避免浮点取整抹掉零点几秒,二是给后期裁剪留出血余量。预览区显示计算后的最终帧数。
6. 提示词与收尾:可用普通加载提示词节点;本片演示使用葫芦娃大佬的 Qwen3.8 本地 LLM 提示词强化节点,输入参考图与时长即可生成,并内置 Minimax 相关 Skill。音频经拆解处理后与视频 Latent 合并为 AV Latent,再进入带音频驱动的潜空间,输出数字人视频;链路尽量基于官方节点,降低维护成本。

适合人群:已在用 Minimax H3 / ComfyUI 做数字人口型驱动,希望把 Self-lift 接入全身或小脸场景,并需要轻量、可复现工作流与网盘节点包的读者。

补充说明:本文根据授权视频口播转写整理,节点名与参数以原视频演示为准;建议观看原片核对连线细节。项目与网盘资源见简介及下方链接。

相关夸克网盘链接:
【工作流和SoundFall节点网盘:https://pan.quark.cn/s/4c36ecb6626a
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

简体中文
繁體中文
English(英语)
日本語(日语)
Deutsch(德语)
Русский язык(俄语)
بالعربية(阿拉伯语)
Türkçe(土耳其语)
Português(葡萄牙语)
ภาษาไทย(泰国语)
한어(朝鲜语/韩语)
Français(法语)
QQArchiver手机版小黑屋粤ICP备2026002389号-1粤ICP备2026002389号-1 简体中文 English 日本語 Русский язык 한어 |网站地图