5.0 KiB
5.0 KiB
素材准备指南(给老莫)
训练质量 70% 取决于素材。这步值得认真做,一次做好,训练一次到位。
一、选片标准(15-25 张)
总原则:宁缺毋滥,越对越好,不是越多越好。
| 要求 | 说明 |
|---|---|
| 数量 | 15-25 张。少于 10 张易过拟合(只记得训练照),多于 30 张收益递减 |
| 分辨率 | 每张 ≥1024×1024。用手机原图,不要用微信/朋友圈压缩过的图 |
| 正脸为主 | 正脸/微侧特写占 8 张左右(决定五官比例、皮肤质感) |
| 半身/全身 | 8 张左右(决定身材、服装适配度) |
| 侧面/动态/生活 | 4 张左右(决定泛化能力,换姿势也像) |
| 光线 | 混合光源(室内灯、自然光、户外),不要全同一个光线 |
| 表情 | 别全是大笑/全是抿嘴,自然表情为主,1-2 张微笑 |
| 遮挡 | 不要戴口罩、墨镜、厚刘海、帽子遮挡五官 |
| 背景 | 尽量简单(纯色墙、普通室内),避免复杂背景干扰 |
| 年龄 | 照片年龄差距别太大(不要 10 年前的混 3 年前的) |
反面教材:20 张全是同一角度的自拍 → LoRA 只会画那个角度,换个姿势就不像了。
选片来源建议:翻手机相册挑最近 1-2 年的,证件照、日常照、户外照各来几张。
二、打标(每张图配同名 txt)
原则:描述场景和动作,不描述脸。脸交给 LoRA 记。
- 每张照片旁边放一个同名 txt 文件(如
img_001.jpg→img_001.txt) - 内容:触发词 + 一句场景/姿势/服装描述(英文,ComfyUI 生态惯例)
- 禁止写:五官特征("帅""眼睛大")、具体衣服颜色(会把衣服焊你身上)
- 懒人方案:把照片丢给 AI(豆包/DeepSeek)批量生成描述,5 分钟搞定
触发词(重要)
- 自己取一个生僻词,不要在模型词汇里常见
- 建议:
lm_face_v1或sks_laomo这类(lm = 老莫) - 推理时提示词必须带触发词 LoRA 才生效
打标示例
# img_001.txt(正脸特写)
lm_face_v1, photorealistic portrait, front view, neutral expression, soft indoor lighting, plain background
# img_002.txt(户外全身)
lm_face_v1, full body shot, standing in a park, natural daylight, casual clothing, sharp focus
# img_003.txt(侧脸生活照)
lm_face_v1, three-quarter view, sitting at a cafe table, warm ambient light, candid moment
三、关键决策规则(老莫必读)
1. 年龄:不要混!以最近 1-2 年为主
- 混入多年前的照片 → LoRA 学"平均脸",出图年龄飘忽,两边都不像
- 年龄跨度控制在 ±5 年内;想要"年轻版"效果用提示词(
younger version),或以后单独训一个年轻版 LoRA
2. 发型:要混!但打标必须写明
- 不同发型(寸头/长发/背头/卷发)都选 → LoRA 泛化强,换发型也像
- 关键:每张 caption 必须写发型(如
short black hair),否则发型会被"焊死"在脸上,出图换发型就不像
3. 生活照 vs 艺术照:混,8:2 为主
- 生活照为主(提供真实身份特征),艺术照少量(3-4 张,提供精致造型参考)
- 艺术照避开:重度磨皮/美颜(塑料脸)、浓妆(掩盖五官)、棚拍强光死白
- 选轻度修饰、五官清晰的艺术照
4. 20 张黄金配方
| 类型 | 张数 |
|---|---|
| 正脸特写 | 8 |
| 半身照 | 6 |
| 全身照 | 4 |
| 侧脸/生活照 | 2 |
5. 角度配比(老莫补充 2026-08-03)
| 角度 | 张数(20张) | 作用 |
|---|---|---|
| 正脸/微侧(±15°) | 12 | 身份核心 |
| 45° 半侧脸(左右各一半) | 6 | 立体结构、泛化关键 |
| 纯侧面(90°) | 0-2 | 点缀 |
- 45° 半侧脸教 LoRA 认识脸的立体结构(颧骨/下颌线/鼻子的三维关系),出图换角度也像
- 左右两个方向的 45° 都要有,别只拍一边
- 纯 90° 侧面信息少,最多 1-2 张
- 俯拍/仰拍:少量或不要(会扭曲五官比例:俯拍额头大、仰拍鼻孔放大;AI 出图极少用极端俯仰角)。真要放:每方向最多 1 张、15-20° 轻度即可
6. 排除清单(看到就换)
口罩 / 墨镜 / 厚刘海遮挡 / 模糊 / 纯侧面 / 背光死黑 / 过度美颜 / 表情全是一个 / 年龄差距大
四、交付方式
- 照片放进
projects\脸部LoRA训练-Qwen-Image\素材\(或直接发我,我来整理) - 我负责:重命名(img_001...)、检查分辨率/质量、批量生成 caption、整理成训练数据集格式
- 你只需要:选 15-25 张照片
四、时间预估
- 选片:10-15 分钟
- 打标:AI 批量 5 分钟(我代劳)
- 合计:老莫只需花 10 分钟选照片
五、质量自检清单
- 15-25 张,全部 ≥1024×1024
- 正脸/微侧为主,角度有变化
- 光线有变化,背景不复杂
- 无遮挡五官(口罩/墨镜/厚刘海)
- 照片都是最近 1-2 年的
- 无重复角度、无模糊照