Files
face-lora-qwen-image/素材/素材准备指南.md
T

112 lines
5.0 KiB
Markdown
Raw Blame History

This file contains ambiguous Unicode characters
This file contains Unicode characters that might be confused with other characters. If you think that this is intentional, you can safely ignore this warning. Use the Escape button to reveal them.
# 素材准备指南(给老莫)
> 训练质量 70% 取决于素材。这步值得认真做,一次做好,训练一次到位。
## 一、选片标准(15-25 张)
**总原则:宁缺毋滥,越对越好,不是越多越好。**
| 要求 | 说明 |
|---|---|
| 数量 | **15-25 张**。少于 10 张易过拟合(只记得训练照),多于 30 张收益递减 |
| 分辨率 | 每张 ≥1024×1024。**用手机原图,不要用微信/朋友圈压缩过的图** |
| 正脸为主 | 正脸/微侧特写占 8 张左右(决定五官比例、皮肤质感) |
| 半身/全身 | 8 张左右(决定身材、服装适配度) |
| 侧面/动态/生活 | 4 张左右(决定泛化能力,换姿势也像) |
| 光线 | **混合光源**(室内灯、自然光、户外),不要全同一个光线 |
| 表情 | 别全是大笑/全是抿嘴,自然表情为主,1-2 张微笑 |
| 遮挡 | **不要**戴口罩、墨镜、厚刘海、帽子遮挡五官 |
| 背景 | 尽量简单(纯色墙、普通室内),避免复杂背景干扰 |
| 年龄 | 照片年龄差距别太大(不要 10 年前的混 3 年前的) |
**反面教材**:20 张全是同一角度的自拍 → LoRA 只会画那个角度,换个姿势就不像了。
**选片来源建议**:翻手机相册挑最近 1-2 年的,证件照、日常照、户外照各来几张。
## 二、打标(每张图配同名 txt)
**原则:描述场景和动作,不描述脸。脸交给 LoRA 记。**
- 每张照片旁边放一个**同名 txt 文件**(如 `img_001.jpg``img_001.txt`
- 内容:触发词 + 一句场景/姿势/服装描述(英文,ComfyUI 生态惯例)
- **禁止写**:五官特征("帅""眼睛大")、具体衣服颜色(会把衣服焊你身上)
- **懒人方案**:把照片丢给 AI(豆包/DeepSeek)批量生成描述,5 分钟搞定
### 触发词(重要)
- 自己取一个**生僻词**,不要在模型词汇里常见
- 建议:`lm_face_v1``sks_laomo` 这类(lm = 老莫)
- 推理时提示词必须带触发词 LoRA 才生效
### 打标示例
```
# img_001.txt(正脸特写)
lm_face_v1, photorealistic portrait, front view, neutral expression, soft indoor lighting, plain background
# img_002.txt(户外全身)
lm_face_v1, full body shot, standing in a park, natural daylight, casual clothing, sharp focus
# img_003.txt(侧脸生活照)
lm_face_v1, three-quarter view, sitting at a cafe table, warm ambient light, candid moment
```
## 三、关键决策规则(老莫必读)
### 1. 年龄:不要混!以最近 1-2 年为主
- 混入多年前的照片 → LoRA 学"平均脸",出图年龄飘忽,两边都不像
- 年龄跨度控制在 **±5 年内**;想要"年轻版"效果用提示词(`younger version`),或以后单独训一个年轻版 LoRA
### 2. 发型:要混!但打标必须写明
- 不同发型(寸头/长发/背头/卷发)都选 → LoRA 泛化强,换发型也像
- **关键**:每张 caption 必须写发型(如 `short black hair`),否则发型会被"焊死"在脸上,出图换发型就不像
### 3. 生活照 vs 艺术照:混,8:2 为主
- **生活照为主**(提供真实身份特征),**艺术照少量**(3-4 张,提供精致造型参考)
- 艺术照**避开**:重度磨皮/美颜(塑料脸)、浓妆(掩盖五官)、棚拍强光死白
- 选轻度修饰、五官清晰的艺术照
### 4. 20 张黄金配方
| 类型 | 张数 |
|---|---|
| 正脸特写 | 8 |
| 半身照 | 6 |
| 全身照 | 4 |
| 侧脸/生活照 | 2 |
### 5. 角度配比(老莫补充 2026-08-03
| 角度 | 张数(20张) | 作用 |
|---|---|---|
| 正脸/微侧(±15°) | 12 | 身份核心 |
| **45° 半侧脸**(左右各一半) | 6 | 立体结构、泛化关键 |
| 纯侧面(90°) | 0-2 | 点缀 |
- 45° 半侧脸教 LoRA 认识脸的立体结构(颧骨/下颌线/鼻子的三维关系),出图换角度也像
- **左右两个方向的 45° 都要有**,别只拍一边
- 纯 90° 侧面信息少,最多 1-2 张
- **俯拍/仰拍:少量或不要**(会扭曲五官比例:俯拍额头大、仰拍鼻孔放大;AI 出图极少用极端俯仰角)。真要放:每方向最多 1 张、15-20° 轻度即可
### 6. 排除清单(看到就换)
口罩 / 墨镜 / 厚刘海遮挡 / 模糊 / 纯侧面 / 背光死黑 / 过度美颜 / 表情全是一个 / 年龄差距大
## 四、交付方式
1. 照片放进 `projects\脸部LoRA训练-Qwen-Image\素材\`(或直接发我,我来整理)
2. 我负责:重命名(img_001...)、检查分辨率/质量、批量生成 caption、整理成训练数据集格式
3. 你只需要:**选 15-25 张照片**
## 四、时间预估
- 选片:10-15 分钟
- 打标:AI 批量 5 分钟(我代劳)
- 合计:老莫只需花 10 分钟选照片
## 五、质量自检清单
- [ ] 15-25 张,全部 ≥1024×1024
- [ ] 正脸/微侧为主,角度有变化
- [ ] 光线有变化,背景不复杂
- [ ] 无遮挡五官(口罩/墨镜/厚刘海)
- [ ] 照片都是最近 1-2 年的
- [ ] 无重复角度、无模糊照