|
|
本帖最后由 疯狼GC 于 2026-9-15 18:24 编辑
【导语】
Stable Diffusion 大模型微调教程上集:为何要微调、训练 vs 融合、硬件门槛、能否一次多概念、效果决定因素,以及训练集应如何准备。内容来自创作者多次「炸炉」经验归纳;下集覆盖打标、工具、正则化、过拟合判断与参数实操。
原视频:https://www.bilibili.com/video/BV1BJ4m147yo/
【1. 为什么要微调大模型】
有一种说法:只有要加入底模完全没有的新概念才需要训大模,微调用 LoRA 就够。实践中并非如此。每次出图挂多个脸模/风格 LoRA 很烦:选模、叠权、互污染、抽卡率升高,能挂的 LoRA 数量也有限。即使硬件很强,仍常需要直接微调大模——既为加入新元素,也为改进已有概念,让底模本身更接近目标提示词效果。
【2. 微调方式:训练 vs 融合】
常见两条路:训练(DreamBooth 一类技术,口播称 Google 研究团队发布的大模微调技术即可理解)与融合。融合依赖逐层手术+噪声,层间关联强,调单一因素易牵动其它,质量偏玄学,还可能带入不想要的元素与版权风险。科学训练在「加入/微调概念」上目的性更强、效果更确切;若训练集完全自备,知识产权更可控,甚至可埋隐藏 Tag 证明归属。
【3. 硬件】
核心是显存。低于约 16GB 想训出较好大模会很痛苦:即便优化跑起来,测试也更耗时。云平台可用但体验常打折。建议先把硬件条件备好。
【4. 一次训练多个概念?】
技术上可以,新手不推荐。单概念都难练完美;素材差异大时除步数外其它参数也可能要分概念调;多概念互相影响、更易过拟合,结果差时也难定位。建议一个一个来,有经验后再批量。
【5. 效果决定因素】
明确观点:高品质微调大约七成靠素材、三成靠参数。很多人陷在优化器/学习率魔咒里反复调参仍不好——问题常在素材。素材够好时,参数「随便挑一挑」也可能出好结果。
【6. 训练集怎么准备】
先问清「到底要微调什么」。例:喜欢某底模但脸不好看 → 训练集应是高清、多角度、多光照的目标脸大头照与上半身;背景等与目标无关的因素是污染,宜抠图填白再打 Tag。正则化图可放各种距离全身照,减轻「只会出上半身/面部写真」。体型会被学进去,可对身材比例做有限度调整,但不建议重做人脸(易丢细节、损真实感)。手不好看时可在半身/写真构图里刻意藏手。
质量优先于数量:DreamBooth 相关实验有「仅三张图也能微调出不错效果」的案例;单一概念几百张内往往够用。概念多、素材真多时才上几千上万,并注意降轮次、别把学习率开太高、盯紧样图防过拟合。
用不同人物脸训「亚洲女性脸」一类泛化概念:素材少时人物差异不宜过大,否则易出奇怪五官拼接感,宜同一人;素材多且质量高时,才适合多人物脸混合并认真打标。
下期预告:参数、工具、打标、正则化与带练案例。
作者:天选嘉鲤敦赵图图
|
|