简体中文 English 日本語 Русский язык 한어

34

主题

0

回帖

1508

修为

执行合伙人

积分
3025

曼加塔第一期曼加塔第二期



作者:@AIwood爱屋研究室

MiniMax H3真音频驱动数字人:锁定原音频与多人对话工作流

MiniMax H3真音频驱动数字人:锁定原音频与多人对话工作流


一句话导读:这套 MiniMax H3 数字人工作流不是把音频只当普通参考,而是将源音频编码并锁定在联合音视频 latent 中驱动人物,同时保留原始音轨用于最终合成,以兼顾口型动作与声音清晰度。

核心内容:
1. 标准 H3 数字人流程中,音频与视频一起经过采样和潜空间重绘,可能让输出音轨出现杂音;如果生成结束后只替换回原始音频,又可能出现口型与声音对不上的问题。视频围绕这两个冲突点展示新的音频驱动方案。
2. 工作流使用 VRGameDevGirl 的 ComfyUI 节点包,核心节点名为 VRGDG MiniMax H3 Audio Drive。项目源码显示,它接收 H3 联合音视频 latent、源音频和音频 VAE,把源音频编码到音频 latent,并用零去噪掩码锁定这一部分。
3. 节点同时输出 audio_driven_av_latent 和 original_audio:前者送入采样器,让人物动作和口型受音频条件驱动;后者保持原始音频对象不变,连接视频合并节点用于最终封装,避免把 VAE 往返后的音轨当作最终声音。
4. 单人流程可用于说话、演唱和带角色参考的音乐视频。接线时应使用 MiniMax H3 参考生视频产生的联合 latent,并把同一音频同时用于参考条件和 Audio Drive;提示词中还需按工作流格式引用对应音频。
5. 双人或多人对话需要接入不同角色图片和多段音频,先合并音频,并在不同人物台词之间加入短暂静音作为过渡;随后在提示词中精确标出各角色台词的时间段,帮助模型把声音、人物与口型对应起来。
6. 首屏评论提出了“生成后再按分段对齐原音频”的替代思路,作者提醒如果音频 latent 仍经过采样器,仍可能有损失。两种路线各有取舍,实际稳定性应结合节点版本、工作流接线、音频时序与角色素材测试。

适合人群:希望用 MiniMax H3 制作说话、演唱、双人或多人对话数字人,并关注原始音质、角色参考和口型同步的 ComfyUI 用户。

相关夸克网盘链接:
【对应所需插件+工作流+模型网盘地址:https://pan.quark.cn/s/daf53a72d9a7

补充说明:本文根据授权视频约 3 分钟完整音频转写、视频简介、默认第一页评论及项目公开源码整理。节点仍需按当前仓库版本与配套工作流安装;多角色对话效果会受参考图、音频切分、静音过渡、提示词时间段和采样设置影响。
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

简体中文
繁體中文
English(英语)
日本語(日语)
Deutsch(德语)
Русский язык(俄语)
بالعربية(阿拉伯语)
Türkçe(土耳其语)
Português(葡萄牙语)
ภาษาไทย(泰国语)
한어(朝鲜语/韩语)
Français(法语)
QQArchiver手机版小黑屋粤ICP备2026002389号-1粤ICP备2026002389号-1 简体中文 English 日本語 Русский язык 한어 |网站地图