|
|
作者:@天选嘉鲤敦赵图图
【作者】天选嘉鲤敦赵图图
【原视频】https://www.bilibili.com/video/BV13dECzzEiJ
【简介】LoRA 打标喂饭级教程。
【口播要点】
普遍的困擾
為何我的LORA模型效果總是不盡人意
你是否也曾經經歷過這樣的場景
滿懷期待的投入時間和經歷去訓練一個LORA
結果卻令人大失所望
比如,你想要訓練一個二次元少女克師傅模型
假設此時觸發詞設定為克師傅
你說及了幾十張風格各頁
但是著裝和形象都一致的圖片
按照網上最常見的教程
使用了某個自動打標工具
在生成的標籤前加上觸發詞
然後啟動了訓練
然而訓練過程中的預覽圖
就可能已經讓你陰影感到不安
最終得到的LORA模型生成的圖像
要麼是主體形象扭曲
比例失調如同縫合怪
要麼就是雖然主體勉強能看
但你嘗試用提示詞去控制人物形象
背景、動作或風格時
它卻並不能聽指揮
總是不能完美的還原人物形象
面對這些不好用的LORA
你是不是也曾反覆檢查流程
卻始終找不到問題所在
這種我明明照著教程做了
為什麼結果還是不行的挫敗感
在LORA訓練中非常普遍
問題究竟處在哪裡呢?
波西常見的解決方案
素材不行
選學參數
粗放打標
素材上強度派
這裡教程會告訴你
你的素材質量不夠高
數量不夠多
差別不夠大
就是告訴你要更多的素材
但是到底多少才算合適
怎麼樣的素材才是真正合格的素材
到底需不需要預處理
證責化
在新環境下
特別是面對自然語言打標
面對視頻類模型打標的情況下
如何針對性的準備素材
似乎變成了不能說的秘密
2.參數調優派
這裡教程會引導你深入研究模型
訓練的各種超參數
如學習率、優化器選擇、網絡結構
訓練部署、調度器策略等
他們相信通過精密、先進的參數組合
總能練出來好的模型
3.粗放打標派
這一派則反覆強調
打標提示詞不能過於詳細
要粗放
旅遊通常是避免模型過擬合道細節上
但至於為何不能太細
如何把握粗放的度
以及如何在粗放的同時
又能明確圖片的核心信息被捕捉
往往語言不詳
最終的實踐方法
常常是依賴自動打標工具
選擇一個看起來比較概括性的模式
生成標籤
然而大量實踐表明
這三種看似主流的方法
往往無法從根本上解決問題
素材準備的限制
否認的是
素材準備對最終模型的效果
起到非常重要的作用
但是
當我們已經準備了合理數量的素材
並且質量高
且滿足差異性的需求
這樣一套滿足模型訓練
最佳實踐的素材包
最終訓練出來的模型
仍然不能完美的實現訓練目標
最常見的問題是
總會在細節或者重要的元素上缺席
依賴於大量的抽卡操作
二
參數調優的局限
精心調整參數
確實能夠影響模型的說臉的速度
穩定性和最終的基礎質量
但這主要解決的是
Lora是否能正常跑完
以及避免訓練崩潰的問題
如果你的Lora已經能生成圖像
但內容本身是錯誤的
或不可碰的
那麼問題很可能不在參數本身
再怎麼調參數選學
也難以妙手回春
我們來簡單驗證一下
在其他條件不變的情況下
假設我們使用自動打標工具
製作兩組Lora模型
一組是對所有細節都精細打標的
一組是特意要求減化描述
忽略細節
關注主體和構圖
訓練出來的Lora
第一個模型幾乎在任何情況下
都無法完全還原
訓練對象總是缺點什麼
而第二個模型
在用非常簡單的提示詞測試時
能生成看似還不錯的圖像
但一旦加入更具體的場景
動作或風格要求時
就容易表現出不可控性
這證明粗放本身並非萬能藥
反而可能因為信息丟失
而導致其他問題
實驗結果往往讓人更加困惑
在素材和參數都很合理的情況下
減化標籤似乎有點效果
但又不能完全解決問題
我們依然沒有弄清楚
用於訓練Lora的打標題詞
到底應該遵循怎樣的原則去編寫
尋找方向
理解Clip在Lora訓練中的核心作用
要找到正確的方向
我們需要理解Lora訓練
背後的即時ZLIP模型
以及她在訓練過程中扮演的角色
無論是文生圖還是圖生圖任務中
ZLIP都承擔著連接文本語意
和視覺特徵的關鍵巧量作用
在圖像生成時
你輸入的提示詞
首先會被ZLIP或類似功能的文本編碼器解析
轉換成一系列能夠代表其語意的特徵項量
這些項量隨後
會引導擴像模型的缺造過程
最終生成符合你描述的圖像
在Lora訓練時
ZLIP或T5等同樣深度參與
打標這一步
本質上是為訓練過程提供大量的圖像文本
配對數據
模型通過學習這些數據
來理解你設定的觸發詞
如科石佛
與圖片中呈現的
特定視覺特徵之間的關聯
因此
打標的核心目標
絕非僅僅是描述圖片內容
而是要通過精準的文本描述
作為一個視覺者
最終需要教會AI模型
看到這張圖片裡的這個
我這些視覺元素風格概念嗎
它就是我用觸發詞
做指代的那個東西
基於這個理解
贏家打標內容好快的標準就清晰了
這組圖片加標籤的組合
是否能夠讓AI準確無誤的理解
並學習到素材對應的核心概念
而不是標籤本身看起來
是詳細還是粗放
四
核心訓練策略
精確定義概念與準確描述邊量
明確了打標的根本目的
正確的打標策略也就浮出水面了
這可以概括為兩個相符相成的關鍵步驟
你精確定義核心概念
這是訓練基石
你需要通過標籤
直接清晰的告訴AI
核心主體或概念
這裡取一個例子
假設我們直接將這張圖丟給AI
會生成這樣的描述
這個結果看似好像非常的詳細
也很準確
但是對於裸耳訓練的話
實際上AI會很困惑
因為AI並不清楚這裡面
到底哪個才是需要學習的新概念
即使此時我們給了一個出發詞
這個出發詞
也不能提到什麼具體的作用
更有效的方式是採用類似定義式的語句
還是我們要訓練的主題是
凸凸凸凸凸
選一個沒有任何其他奇異的詞
或者短語當出發詞很重要
前面應該改為
而這段話應該刪除
如果我們希望以後的模型
可以生成作材
在家裡吃飯的圖
那麼這句話就需要保留
三調詳細的細節描述
這種方式通過明確的內容結構
將出發詞推入
所代表的核心形象直接光源起來
AI首先就能夠建立起
對核心概念的基本認知
二 準確描述可變因素
僅僅定義核心概念還不夠
尤其是當你希望訓練出來的LORA具有
高可控性時
你還需要通過標籤
明確指出那些你希望在未來
生成圖像時能夠自由控制的
可變化的元素
這些可變因素可能包括
外觀細節 角色的髮型
髮色 配飾等
狀態與動作 表情
微笑 憤怒 悲傷
姿勢 戰力奔跑 跳躍
動作瞄準 格檔 招談等
環境與場景 背景地點
是城市 方野太空倉
時間 白天 夜晚
光照條件 強光如何光
伯倫朗光等
風格與材質 繪畫風格
縱慢寫實 油畫
來自表現金屬 布料 毛絨皮膚等
為何要描述這些變量
因為需要通過學習這些變化
理解它們是獨立於核心概念之外的
可以被單獨調用的屬性
舉例來說
如果你的訓練素材中
角色總是穿著銀色盔甲
目前你的標籤從未提及盔甲顏色
那麼AI很可能會將銀色盔甲
視為新概念的固有組成部分
當你嘗試用這個LORA
生成一個穿著毛衣的新人物時
結果很可能失敗或效果怪異
正確的做法是
縮集多顏畫素材
確保你的訓練集中包含
穿著不同顏色
顏色 紅色 藍色等
不同的表情
處於不同環境下的圖片
在標籤中精確描述這些變化
銀色盔甲圖標籤包含
Walene Silver Armor
紅色盔甲圖標籤包含
Walene Red Armor
微笑表情圖標籤包含
With a Smiling Expression
荒野背景圖
標籤包含
In a Desert West Line
Background
通過這種方式
AI就能學會
顏色是核心主體
而盔甲顏色表情背景的
是可以與之組合的
獨立可控的變量
這樣訓練出來的Laura
才能在你使用時
通過提示詞精準的
控制這些變量
實現由角色
Walene Red Armor
Smiling
In a Desert West Line
Background
這樣的複雜組合
這就解釋了
為何訓練一個
基礎可用的Laura
只需完成概念定義
可能只需要即時張圖
而訓練一個
高度可控
靈活多變的大神級Laura
需要描述大量可變因素
則需要更多的
精心挑選和標注的圖片
可控性的提升
本質上來源於
更多可變因素的
有效視角
這直接關聯
到訓練數據的
致核量
以及標注的準確水平
我再看簡化標籤
為何有時有效
比起了定義核心
與描述變量的
重要性後
我們再來
審視簡化標籤時
有時能提升
效果這一現象
其背後的原因
往往與避免
主體污染有關
當你對
非核心
非變量的主體細節
比如背景的
每一朵圓的形狀
每一個背景
元素的外觀等
進行過多
過細的描述時
這些描述
雖然可能在視覺上
是準確的
但對於AI學習
概念
核心和可控變量來說
就構成了噪音
在Flux這樣
相對正能的模型中
這種噪音
可能不會像在
老SD時代那樣
輕易的吸收掉
主體的核心特徵
但它很可能
會引發
提示自污染
這意味著
這些榮譽的
描述干擾了
AI對標籤中
其他重要信息
如動作背景
甚至核心
定義本身的
準確理解
和權重分配
其結果可能是
雖然主體形象
大致還在
但Laura對其他
提示詞元素的
響應能力下降
導致環境渲染出錯
動作執行不到味道
問題
實驗證據
正如前面提到的
如果我們基於一個
已經通過精細
定義加變量描述
訓練好的Laura
僅僅在標籤中
額外添加
大量對
其他元素細節的
描述
再訓練一個新Laura
對比兩者會發現
新Laura在
渲染環境
響應動作指令
能方便往往
表現更差
這就是污染的體現
因此
簡化標籤在
某種程度上有效
是因為它恰好
避免了對
主體固定細節的
過度描述
從而減少了
潛在的提示詞污染
但這絕不意味著
標籤越簡單越好
簡化的底線
標籤必須包含
足夠的信息
來清晰的
定義和新概念
並描述
所有你希望
控制的可變因素
如果簡化到
只剩下一個觸發詞
訓練出的Laura
將幾乎失去
所有可控性
變得毫無用處
簡化的對象
對於需要控制的
變量如顏色
表情動作被講的
進行清晰
具體準確的描述即可
不要太細
廢話太多
如何把握度
一個最實用的
參考標準是
在社區尋找
對應模型最優質的圖片
這些圖片的
提示詞
習慣於描述
到什麼程度
打標時
就盡量保持
相似的力度和風格
對於需要
控制的變量
確保準確到位即可
6. 使用
打標策略小節
綜合以上分析
一個是用
打標策略可以總結為
明確核心定義
使用清晰的語句
如出發詞
az
定義核心概念主體
準確描述
可變因素
對於
所有你希望
未來能通過
提示詞
樣式表情
動作背景光照風格等
必須在對應的
訓練圖片標籤中
進行明確的描述
同時
確保訓練集中
包含這些因素的
不同變化狀態
簡化固體細節
對於主體上
那些不打算
作為變量控制的
固定的細節特徵
盈盡量簡化描述
或不做描述
以避免不必要的
提示詞污染
平衡整體細節
標籤的整體
向細程度應示中
既要包含足夠的信息
用於定義和描述變量
又要避免過於
擁長複雜
導致難以解析
或污染嚴重
可以參考日常書寫
生成提示詞的習慣
結構清晰
盡量使用
結構化
邏輯清晰的語言
組織標籤內容
有助於模型
更好的理解
7.自動化
打標的挑戰與新可能
掌握了理想的
打標策略
一個巨大的
現實挑戰擺在面前
當訓練數據較多時
完全依賴手動
打標不僅耗時耗力
而且難以保證
一致性和準確性
自然的
我們會想到
利用自動打標工具
然而常見的
自動打標工具
無論是基於Tag
還是生成
自然語言描述的
在實踐上述策略時
往往存在局限
難以區分核心與變量
他們通常傾向於
看到什麼就描述什麼
很難智能的判斷
哪些是需要
著重定義的核心概念
哪些是需要
描述的可變因素
哪些又是
需要簡化的固定細節
容易過多描述主體
大多數工具
在生成描述時
往往會包含
大量關於主體的細節
這恰恰是
我們試圖避免的
無染源
缺乏對Laura
訓練目標的
針對性優化
他們的設計目標通常是
通用的
圖像描述或打標籤
變畏對特別針對Laura
訓練中定義核心
描述變量
避免主體
污染的特定需求進行優化
這意味著
使用現有工具
自動生成的標籤
往往還需要
大量的人工篩選
編輯和調整
而這些工具
本身往往在這方面的能力
又相對較差
導致我們的
打標效率直線下降
那麼
有沒有更好的自動化
解決方案呢
這裡就不得不提到我
專門為解決
此類需求設計的革命性
AI工具
突突的超級智能打標器
這款軟件的獨特之處
在於
它不僅僅是一個打標工具
更是一個深度
集成本地AI能力
並特別針對Laura
模型訓練
痛點進行優化的
智能標註
與數據及管理平台
它的幾個核心特性
恰好能夠幫助我們解決
前面討論的自動化
打標難題
本地化AI驅動
無封調用本地部署的各種
先進開源多模態大模型
確保隱伺安全
同時能引火選擇
最合適的模型
最重要的是
它一鍵安裝
集裝即用
徹底告別要繁瑣的
環境配置過程
智能主體過濾機制
直面了傳統打標工具
容易過度描述
主體的必定
AI會根據模型訓練
出來的最佳時間要求
顯著減少對主體
本身細節的描述
將著心放在背景
環境
光照
構圖
動作姿態等這些
我們希望控制的變量上
創新編輯與輔助功能
集成了
強大的神經網絡模型
和本地翻譯模型
它能將自然語言
描述智能拆分成句子
讓你像編輯
列表一樣輕鬆翻譯
修改
增山
調整順序
強大的P處理
流水線
支持素材調整
從秘名
相似檢測
AI處理
導出等一系列
自動化操作
小潔
最後我要說的是
經過成千上萬個模型的洗禮
我發現
其實縱觀整個模型訓練過程
每一個步驟都非常的重要
一個優質的模型
往往意味著
每一個步驟和元素
是科學和充分的
任何一個步驟的互農和省略
最後都會造成一些
意想不到的結果
必要的時候
要多用控制辨量法
嘗試不同的組合
找到最優的那個
希望本次的內容
對你能夠有所幫助
如果你也對
ANCG相關的內容
比如模型訓練
文生圖
文生視頻
圖生視頻等
知識感興趣
歡迎加入群組
和我們一起討論
相關文件和自然
我都放在下方的鏈接裡了
感謝各位小夥伴的聆聽
【备注】重试。 |
|