作者:@AIwood爱屋研究室
开源左勾拳:Qwen Image 2.1 ComfyUI实测与开源短板补齐
一句话导读:Qwen Image 2.1 让开源图像侧明显追上闭源短板;在最新开发版 ComfyUI 模板里用官方文生图/编辑/去背景工作流,并正确接入 Prompt Enhanced(PE)提示强化,文字与细节质量会好很多。
核心内容:
1. 为什么说这是开源「左勾拳」
- 视频侧自 MiniMax H3 开源后,很多场景已能追平甚至摸到闭源头部水平;图像侧长期波澜不惊。
- Qwen Image 2.1 并非完美,但相对前代进步很大,显著缩小与闭源图像模型的差距,补上开源社区一块关键短板。
- ComfyUI 第一时间给出官方支持,开发版模板中可直接找到三套新工作流:去背景、文生图、图片编辑。
2. 模型与节点准备清单
- 主模型:BF16 与 Int8 Convert 两个版本。
- Text Encoder:实际使用 Qwen3-VL 8B,提供 BF16 / Int8 / W4A8 等量化。
- 提示词强化(PE, Prompt Enhanced):微调自约 Qwen3.5 9B 量级基座,分 T2I(文生图)与 I2I(编辑)两套,文件也放在 Text Encoder 目录侧;接到 Text Generate / Text Encode 链路后再进采样。
- 官方工作流一如既往简洁:模型加载器 + 长宽/分辨率选择 + 新 Text Encode 节点 + 采样器。
3. 采样与 PE:文生图强烈建议接,编辑要慎用
- 官方默认约 25 步也能拟合,但推荐 Euler + Simple 组合跑约 50 步,拟合更稳;25 步会略差一截。
- 直接丢短提示时,尤其文字表现偏弱。PE 会把提示扩写并丰富元素。
- 关键原因:Qwen3-VL 8B Text Encoder「不具备联想能力」——写什么出什么;小字、复杂文字细节必须靠 PE 写进提示,否则出不来。
- 文生图:UP 强烈建议接上 PE,创作效率与成图质量提升明显。
- 编辑流:PE 常会「过度思考」,输出夹带推理过程、中文提示先自我解释一通,甚至乱码;此时更建议手敲编辑指令。不用 PE 时文字会弱一些,需权衡。
4. 编辑工作流的尺寸开关
- 输出尺寸看分辨率选择器(如 16:9、约 200 万像素)。
- 若开关为 False:不按该分辨率强制输出,而按参考图 Resolution/比例缩放输出,逻辑类似 MiniMax H3 里参考图尺寸的 Max/Match 思路。
- 若要手动控制画幅比例,需把开关打开(True),才会按选择器设定输出。
5. 画质与能力实测印象
- 相对早期 Qwen Image「偏软、细节少」,2.1 画质更「结实」,颗粒感略重,有人觉得接近部分闭源图的观感。
- 肢体偶发不稳定;写实/仿 90 年代实拍、网吧、中式美学、二次元等样张整体扎实。
- 文字:未接 PE 时小字易乱;接入后招牌、原理说明、手机聊天界面等小字可非常清楚。早点摊等样张大多可读,个别字仍可能写差。
- 编辑:角色一致性、换装、指定场景站位、表情迁移(如翻白眼)整体可用;偶发头身比例失调,提示中强调「保持正常比例」可改善。
- 多参考角色:实测塞到约 10 张会出现特征融合;多角色上限体感约 6–7 张。多图需用 Batch 拼进单图像输入;数量增多时速度急剧下降(示例 10 张合计约 10 分钟,接近视频生成耗时),成功率也偏低。
- 风格迁移(如转手绘彩绘)、参考色调生成中式建筑等可行,后者可能需要抽卡。
- 像素偏移:先把参考缩到长边约 1280 再编辑并同步分辨率,偏移仍有但细节保持已明显可接受。
- 去背景流:提示可固化为「移除背景并输出透明/可编辑格式」;前景与背景边缘清晰时效果最好。
6. 速度与后续加速
- 即便 25/50 步,在约 2M 像素下速度仍快;UP 在 5090D 上单张约 20 多秒。
- LightX2V 侧也在准备加速 LoRA,后续还有提速空间。
- 与 MiniMax H3 搭配,可看作开源社区新的「组合拳」,具备与闭源方案对打的潜力。
适合人群:已更新 ComfyUI 开发版、想快速弄清 Qwen Image 2.1 官方三件套工作流、PE 该不该接、以及多图编辑上限的创作者。
补充说明:本文根据授权视频转写整理,口播中的型号/量化名以界面与仓库为准;建议观看原视频获取完整对比样张。RunningHub 亦提供文生图与图片编辑在线体验链接(见原视频简介)。
相关夸克网盘链接:
【模型网盘下载:https://pan.quark.cn/s/5b253b551318】 |