112 lines
5.0 KiB
Markdown
112 lines
5.0 KiB
Markdown
# 素材准备指南(给老莫)
|
||
|
||
> 训练质量 70% 取决于素材。这步值得认真做,一次做好,训练一次到位。
|
||
|
||
## 一、选片标准(15-25 张)
|
||
|
||
**总原则:宁缺毋滥,越对越好,不是越多越好。**
|
||
|
||
| 要求 | 说明 |
|
||
|---|---|
|
||
| 数量 | **15-25 张**。少于 10 张易过拟合(只记得训练照),多于 30 张收益递减 |
|
||
| 分辨率 | 每张 ≥1024×1024。**用手机原图,不要用微信/朋友圈压缩过的图** |
|
||
| 正脸为主 | 正脸/微侧特写占 8 张左右(决定五官比例、皮肤质感) |
|
||
| 半身/全身 | 8 张左右(决定身材、服装适配度) |
|
||
| 侧面/动态/生活 | 4 张左右(决定泛化能力,换姿势也像) |
|
||
| 光线 | **混合光源**(室内灯、自然光、户外),不要全同一个光线 |
|
||
| 表情 | 别全是大笑/全是抿嘴,自然表情为主,1-2 张微笑 |
|
||
| 遮挡 | **不要**戴口罩、墨镜、厚刘海、帽子遮挡五官 |
|
||
| 背景 | 尽量简单(纯色墙、普通室内),避免复杂背景干扰 |
|
||
| 年龄 | 照片年龄差距别太大(不要 10 年前的混 3 年前的) |
|
||
|
||
**反面教材**:20 张全是同一角度的自拍 → LoRA 只会画那个角度,换个姿势就不像了。
|
||
|
||
**选片来源建议**:翻手机相册挑最近 1-2 年的,证件照、日常照、户外照各来几张。
|
||
|
||
## 二、打标(每张图配同名 txt)
|
||
|
||
**原则:描述场景和动作,不描述脸。脸交给 LoRA 记。**
|
||
|
||
- 每张照片旁边放一个**同名 txt 文件**(如 `img_001.jpg` → `img_001.txt`)
|
||
- 内容:触发词 + 一句场景/姿势/服装描述(英文,ComfyUI 生态惯例)
|
||
- **禁止写**:五官特征("帅""眼睛大")、具体衣服颜色(会把衣服焊你身上)
|
||
- **懒人方案**:把照片丢给 AI(豆包/DeepSeek)批量生成描述,5 分钟搞定
|
||
|
||
### 触发词(重要)
|
||
|
||
- 自己取一个**生僻词**,不要在模型词汇里常见
|
||
- 建议:`lm_face_v1` 或 `sks_laomo` 这类(lm = 老莫)
|
||
- 推理时提示词必须带触发词 LoRA 才生效
|
||
|
||
### 打标示例
|
||
|
||
```
|
||
# img_001.txt(正脸特写)
|
||
lm_face_v1, photorealistic portrait, front view, neutral expression, soft indoor lighting, plain background
|
||
|
||
# img_002.txt(户外全身)
|
||
lm_face_v1, full body shot, standing in a park, natural daylight, casual clothing, sharp focus
|
||
|
||
# img_003.txt(侧脸生活照)
|
||
lm_face_v1, three-quarter view, sitting at a cafe table, warm ambient light, candid moment
|
||
```
|
||
|
||
## 三、关键决策规则(老莫必读)
|
||
|
||
### 1. 年龄:不要混!以最近 1-2 年为主
|
||
- 混入多年前的照片 → LoRA 学"平均脸",出图年龄飘忽,两边都不像
|
||
- 年龄跨度控制在 **±5 年内**;想要"年轻版"效果用提示词(`younger version`),或以后单独训一个年轻版 LoRA
|
||
|
||
### 2. 发型:要混!但打标必须写明
|
||
- 不同发型(寸头/长发/背头/卷发)都选 → LoRA 泛化强,换发型也像
|
||
- **关键**:每张 caption 必须写发型(如 `short black hair`),否则发型会被"焊死"在脸上,出图换发型就不像
|
||
|
||
### 3. 生活照 vs 艺术照:混,8:2 为主
|
||
- **生活照为主**(提供真实身份特征),**艺术照少量**(3-4 张,提供精致造型参考)
|
||
- 艺术照**避开**:重度磨皮/美颜(塑料脸)、浓妆(掩盖五官)、棚拍强光死白
|
||
- 选轻度修饰、五官清晰的艺术照
|
||
|
||
### 4. 20 张黄金配方
|
||
| 类型 | 张数 |
|
||
|---|---|
|
||
| 正脸特写 | 8 |
|
||
| 半身照 | 6 |
|
||
| 全身照 | 4 |
|
||
| 侧脸/生活照 | 2 |
|
||
|
||
### 5. 角度配比(老莫补充 2026-08-03)
|
||
| 角度 | 张数(20张) | 作用 |
|
||
|---|---|---|
|
||
| 正脸/微侧(±15°) | 12 | 身份核心 |
|
||
| **45° 半侧脸**(左右各一半) | 6 | 立体结构、泛化关键 |
|
||
| 纯侧面(90°) | 0-2 | 点缀 |
|
||
|
||
- 45° 半侧脸教 LoRA 认识脸的立体结构(颧骨/下颌线/鼻子的三维关系),出图换角度也像
|
||
- **左右两个方向的 45° 都要有**,别只拍一边
|
||
- 纯 90° 侧面信息少,最多 1-2 张
|
||
- **俯拍/仰拍:少量或不要**(会扭曲五官比例:俯拍额头大、仰拍鼻孔放大;AI 出图极少用极端俯仰角)。真要放:每方向最多 1 张、15-20° 轻度即可
|
||
|
||
### 6. 排除清单(看到就换)
|
||
口罩 / 墨镜 / 厚刘海遮挡 / 模糊 / 纯侧面 / 背光死黑 / 过度美颜 / 表情全是一个 / 年龄差距大
|
||
|
||
## 四、交付方式
|
||
|
||
1. 照片放进 `projects\脸部LoRA训练-Qwen-Image\素材\`(或直接发我,我来整理)
|
||
2. 我负责:重命名(img_001...)、检查分辨率/质量、批量生成 caption、整理成训练数据集格式
|
||
3. 你只需要:**选 15-25 张照片**
|
||
|
||
## 四、时间预估
|
||
|
||
- 选片:10-15 分钟
|
||
- 打标:AI 批量 5 分钟(我代劳)
|
||
- 合计:老莫只需花 10 分钟选照片
|
||
|
||
## 五、质量自检清单
|
||
|
||
- [ ] 15-25 张,全部 ≥1024×1024
|
||
- [ ] 正脸/微侧为主,角度有变化
|
||
- [ ] 光线有变化,背景不复杂
|
||
- [ ] 无遮挡五官(口罩/墨镜/厚刘海)
|
||
- [ ] 照片都是最近 1-2 年的
|
||
- [ ] 无重复角度、无模糊照
|