简体中文 English 日本語 Русский язык 한어

193

主题

43

回帖

60

修为

创始合伙人

积分
123
QQ
赵图图 2024-2-20 18:01:25 | 显示全部楼层 | 阅读模式
本帖最后由 疯狼GC 于 2026-9-15 18:26 编辑



【导语】
SD 大模型微调系列续集(作者改用数字期数,不再严格「上下集」命名)。本期聚焦素材打标:WD14、GPT-4V、以及「WD14 引导 + CogVLM VQA 自然语言」组合拳,并串赛博丹炉与 GPT-4V Image Captioner 实操。

原视频:https://www.bilibili.com/video/BV13W421N732/

【常用打标路线】

1)WD14(最简单)
多数训练器自带或有插件。打完按需求删改即可,适合快速出第一版标签。

2)GPT-4V 自然语言
可用社区 GPT-4V Image Captioner 一类工具(作者此前有完整操作视频)。痛点:对「色图」及稍露骨素材常直接拒答,覆盖面受限。

3)推荐组合:WD14 引导 → CogVLM VQA 转自然语言
CogVLM(智谱 + 清华开源视觉语言模型)在部分测评上接近甚至局部超过 GPT-4V;CogAgent 为其改进版。本地 VQA 可免费给任意素材打自然语言标,且往往比纯 Tag 更贴画面。
- 硬件:口播建议显存 ≥16GB,硬盘预留 ≥60GB 量级放模型。
- 直接用 CogVLM 有时细节不够敏:先 WD14 出引导词,再让 VQA 按引导扩成自然语言,最后用标签处理工具优化。
- 注意:CogVLM 做「单词/短语 Tag」效果较差,宜坚持自然语言段落。

【本地整合包流程(口播)】
作者在社区工具基础上做了含 GPT-4V Image Captioner、CogAgent、Models 的整合包(见原视频评论)。路径尽量全英文、无奇怪符号。
1. 解压后进 GPT-4V Image Captioner,双击启动程序;偶发加载失败多等一会。
2. 若用官方 GPT-4V:按此前视频配置 API。
3. 用 CogVLM:编辑 CogAgent 目录下「启动 API」脚本,把模型路径指到 models 最内层目录 → 启动 API 并耐心等待至界面就绪(勿关)→ 回 Captioner,API 选 common VQA 并 Switch → 改 API URL、超时约 300、图片质量高细节 → 读入提示词模板后开始打标。

【WD14 引导 + VQA 批处理串赛博丹炉】
保持上述服务不关,打开赛博丹炉走到上传素材(参数对本步不重要)→ 分辨率可 1024、无需裁切、AutoTag 约 0.35(可试 0.3/0.25)→ 预处理 → Tag 编辑器删触发词等。然后回 Captioner:提示词存档读入模板,把大括号内地址改成素材目录 → 多图批处理,覆盖策略可按默认。大批量会很慢,需干等。

对比「有引导 / 无引导」提示词,择优或用 GPT 类工具拼合两端优点。再用 Captioner 标签处理:路径填好、Top-N 可 300+、免费翻译后出词云/网络图——引导后的自然语言分布往往更均衡。回到赛博丹炉重建缩略图、开翻译,做人种、表情、服装材质等精细强化;删掉明显无用词。准确标签是高质量大模的关键一步。

【小结】
大模打标不必二选一:WD14 快、GPT-4V 拒答多、本地 CogVLM 补齐敏感素材与自然语言质量;「Tag 引导 → VQA 成段 → 人工/工具精修」是可落地的生产流。

作者:天选嘉鲤敦赵图图
您需要登录后才可以回帖 登录 | 立即注册

本版积分规则

简体中文
繁體中文
English(英语)
日本語(日语)
Deutsch(德语)
Русский язык(俄语)
بالعربية(阿拉伯语)
Türkçe(土耳其语)
Português(葡萄牙语)
ภาษาไทย(泰国语)
한어(朝鲜语/韩语)
Français(法语)
QQArchiver手机版小黑屋粤ICP备2026002389号-1粤ICP备2026002389号-1 简体中文 English 日本語 Русский язык 한어 |网站地图