作者:@T8star-Aix
阿里Qwen Image 2.1即将开源先行效果测评:透明图多轮对齐GPT Image 2.5
一句话导读:T8star-Aix 对即将开源的阿里 Qwen Image 2.1 做先行效果测评——版本号虽是 2.1,实测在透明图生成/编辑、中英文小字与多轮一致性上已可对齐甚至局部优于 GPT Image 2.5,并明显强于官方收费的 3.0 / 3.0 Pro 观感;预计 9 月 20 日晚约 21:00 于魔搭开源。
核心内容:
1. 发布背景与定位:开篇以「不是 GPT Image 2.5 开源」破题,强调中国开源图像编辑模型正式看齐世界顶级闭源水平。UP 回顾年初对 Qwen Image 2.0→3.0 的测评,并提到作者侧长期争取开源;此前作者邀其参加云栖大会预告「有好东西」,本次确认即将开源。简介写明关注 ModelScope:https://modelscope.cn/models/Qwen/Qwen-Image-2.1/summary ,以官方通知为准(预计当晚 21:00,也可能提前)。
2. 与顶级闭源对照:口播多次强调「你说它是 GPT Image 2.5 也没太大问题」——相对当前最好的 GPT Image 2.5,「一点都不差,甚至有时更好」,尤其在可控性/预置性与文字表现上让其「测完都震惊」。同时指出实测观感优于官方收费档 3.0 与 3.0 Pro;并期待后续 3.1 闭源上限。
3. 能力要点(据演示与口播):支持透明图生成与透明图编辑;极小中英文文字「一点不崩」;审美观感突出。多参考/多视图能力被点名为「目前只有一些顶级模型才支持」。多轮编辑是重点验证:常见 AI 图像编辑多轮后易出现噪点、偏色、僵硬感乃至整体崩坏,而在 Qwen Image 2.1 上连续六轮、换多种姿势后一致性仍能保持七八成,画面干净、无明显噪点。
4. 工程与生态判断:模型偏蒸馏/轻量方向,社区优化后「基本上所有机器都可以跑得动」,但仍有顶级生成力。UP 借机评价阿里近期开源节奏与商用级生态(图像、视频、TTS、智能体链路):图像编辑这一「中间核心」被打通后,再把闭源链路(如 Codex 类智能体)打通,整体前景被看好。亦对比提到 Wan 相关视频能力逼近 Seedance 等闭源水位、以及多模态视觉对 UI/原型生成体验的重要性。
5. 测试资源:本期全部测试提示词见 https://api.seedance.nz/prompt-gallery 。简介另附无限画布整合包、贞贞整合包及多个训练器/镜像链接(本帖文末保留夸克网盘资源)。
适合人群:关注开源图像编辑、Qwen-Edit 工作流、透明图/多轮编辑一致性,以及希望在本地/社区跑通接近 GPT Image 2.5 水位模型的创作者。
相关夸克网盘链接:
相关夸克网盘链接:
【无限画布整合包v3.0.0:https://pan.quark.cn/s/5871a0142ff3】
【贞贞整合包V4.8O:https://pan.quark.cn/s/ed4f5cc2db75】 |