|
|
作者:@AIwood爱屋研究室
Prism 音视频生成演示封面
一句话导读:AIwood爱屋研究室整理了 Prism 棱镜的多场景音视频生成示例,涵盖人物对白、体育运动、音乐演奏和镜头运动,可结合画面中的提示词查看不同场景的生成内容。
核心看点
1. 人物对白与动作:约 0:20 的商店对话、0:46 的船上钓鱼和 1:10 的人物访谈,分别呈现双人交流、持物讲话以及手势与表情变化。画面叠加的提示词使用 SPEECH 标签描述台词,访谈案例还包含法语内容。
2. 动态场景与环境声设计:足球、街头指挥交通、切分食物、车内驾驶、冲浪及林间骑行,覆盖人物运动、物体接触和视角变化。部分提示词用 SFX 标签描述脚步、餐具、车辆或水流等声音,展示了声音事件与视觉场景一起设定的方式。
3. 音乐和运镜:约 1:02 的室内合奏、1:20 的运河行船,以及片尾的科幻飞行场景,扩展到多人演奏、连续镜头移动与想象场景。合奏提示词包含 MUSIC 标签。
观看时可分别关注人物口部和手势、动作接触点、声音事件及镜头连续性。视频提供的是精选案例,没有给出统一测试条件、同步误差或成功率统计;这些片段适合了解展示范围,不宜据此判断所有场景的稳定性。
复现提醒:作者在后续评论中提到,自己的 fp8scale 量化和 bf16 尝试速度较慢,复现仍有问题;评论没有披露完整测试条件。因此,这组精选演示与普通用户环境中的复现结果需要分别看待。
官方资料补充:项目页将 Prism 定位为面向原生 2K 音视频联合生成训练的动态稀疏注意力框架。这里的项目定位来自官方资料;本视频主要展示生成结果,未演示安装、节点接线或推理参数配置。
项目与模型入口:
Prism 官方项目页
Prism 官方代码仓库
Prism 官方模型文件
来源说明:本文根据 AIwood爱屋研究室的授权视频整理,案例描述对应视频画面与提示词,复现提醒引自作者后续评论,项目定位另据官方页面补充。完整展示请观看上方原视频。 |
|