作者:@AIwood爱屋研究室
LTX 2.3数字人工作流:文/图生口播、自动帧数与35秒建议
一句话导读:这套 LTX 2.3 数字人工作流把角色场景图、录制音频和文生/图生两种数字人模式串起来,适合制作唱歌或口播视频;作者同时给出单段不超过 35 秒的稳定性边界和 5090D 上的实测耗时。
核心内容:
1. 使用场景:作者说明整段视频中的本人出镜都由数字人生成,原因是场地受限,也不想反复布置灯光与相机。LTX 2.3 在复杂动态和角色稳定性上仍有局限,但用于唱歌、口播这类数字人场景时效果相对稳定。
2. 角色图准备:第一步先生成对应场景中的人物形象。作者常用 GPT Image 2 或 Nano Banana Pro,上传一张本人照片,再描述场景和光影,希望利用这类图像模型的角色一致性与写实表现得到起始图。
3. 音频获取:口播音频可以直接使用剪映的录音功能录制并导出。工作流会根据音频长度自动计算总帧数,不需要手工换算生成时长。
4. 两种生成模式:LTX 2.3 数字人工作流支持文生数字人和图生数字人,通过一个开关切换;作者演示中 False 状态对应图生数字人模式,随后设置分辨率并上传音频即可运行。
5. 时长边界:受 LTX 模型稳定性影响,作者建议单段数字人视频不要超过 35 秒,否则可能出现画质劣化或画面崩坏。较长口播更适合拆成多个短段,再在后期组合。
6. 性能实测:作者展示的口播片段约 25 秒,在 RTX 5090D 上总运行时间约 350 秒,其中包含超分节点的计算时间。实际耗时会随显卡配置、音频长度、分辨率和后处理节点变化。
7. 工作流定位:这并不是刚出现的新技术,而是作者数月前已经发布并长期放在 RunningHub 上的 LTX 2.3 数字人方案。本期重点是回应观众对直播场景数字人制作方式的提问,并重新梳理完整操作路径。
适合人群:想用照片和录音制作数字人口播、唱歌或虚拟出镜内容,并希望在 RunningHub 或本地 ComfyUI 中复用 LTX 2.3 工作流的用户。
相关工作流:
【LTX 2.3 数字人 RunningHub 工作流:https://www.runninghub.cn/post/2 ... iteCode=kol01-rh149】
补充说明:本文根据授权视频约 3 分 10 秒的完整音频转写整理,并结合视频简介和默认首屏 3 条评论核对模型名、工作流入口与参数建议;简介和首屏评论未发现夸克网盘链接。建议观看原视频确认开关位置、分辨率设置和生成效果。 |