Files

5.0 KiB
Raw Permalink Blame History

素材准备指南(给老莫)

训练质量 70% 取决于素材。这步值得认真做,一次做好,训练一次到位。

一、选片标准(15-25 张)

总原则:宁缺毋滥,越对越好,不是越多越好。

要求 说明
数量 15-25 张。少于 10 张易过拟合(只记得训练照),多于 30 张收益递减
分辨率 每张 ≥1024×1024。用手机原图,不要用微信/朋友圈压缩过的图
正脸为主 正脸/微侧特写占 8 张左右(决定五官比例、皮肤质感)
半身/全身 8 张左右(决定身材、服装适配度)
侧面/动态/生活 4 张左右(决定泛化能力,换姿势也像)
光线 混合光源(室内灯、自然光、户外),不要全同一个光线
表情 别全是大笑/全是抿嘴,自然表情为主,1-2 张微笑
遮挡 不要戴口罩、墨镜、厚刘海、帽子遮挡五官
背景 尽量简单(纯色墙、普通室内),避免复杂背景干扰
年龄 照片年龄差距别太大(不要 10 年前的混 3 年前的)

反面教材:20 张全是同一角度的自拍 → LoRA 只会画那个角度,换个姿势就不像了。

选片来源建议:翻手机相册挑最近 1-2 年的,证件照、日常照、户外照各来几张。

二、打标(每张图配同名 txt

原则:描述场景和动作,不描述脸。脸交给 LoRA 记。

  • 每张照片旁边放一个同名 txt 文件(如 img_001.jpgimg_001.txt
  • 内容:触发词 + 一句场景/姿势/服装描述(英文,ComfyUI 生态惯例)
  • 禁止写:五官特征("帅""眼睛大")、具体衣服颜色(会把衣服焊你身上)
  • 懒人方案:把照片丢给 AI(豆包/DeepSeek)批量生成描述,5 分钟搞定

触发词(重要)

  • 自己取一个生僻词,不要在模型词汇里常见
  • 建议:lm_face_v1sks_laomo 这类(lm = 老莫)
  • 推理时提示词必须带触发词 LoRA 才生效

打标示例

# img_001.txt(正脸特写)
lm_face_v1, photorealistic portrait, front view, neutral expression, soft indoor lighting, plain background

# img_002.txt(户外全身)
lm_face_v1, full body shot, standing in a park, natural daylight, casual clothing, sharp focus

# img_003.txt(侧脸生活照)
lm_face_v1, three-quarter view, sitting at a cafe table, warm ambient light, candid moment

三、关键决策规则(老莫必读)

1. 年龄:不要混!以最近 1-2 年为主

  • 混入多年前的照片 → LoRA 学"平均脸",出图年龄飘忽,两边都不像
  • 年龄跨度控制在 ±5 年内;想要"年轻版"效果用提示词(younger version),或以后单独训一个年轻版 LoRA

2. 发型:要混!但打标必须写明

  • 不同发型(寸头/长发/背头/卷发)都选 → LoRA 泛化强,换发型也像
  • 关键:每张 caption 必须写发型(如 short black hair),否则发型会被"焊死"在脸上,出图换发型就不像

3. 生活照 vs 艺术照:混,8:2 为主

  • 生活照为主(提供真实身份特征),艺术照少量3-4 张,提供精致造型参考)
  • 艺术照避开:重度磨皮/美颜(塑料脸)、浓妆(掩盖五官)、棚拍强光死白
  • 选轻度修饰、五官清晰的艺术照

4. 20 张黄金配方

类型 张数
正脸特写 8
半身照 6
全身照 4
侧脸/生活照 2

5. 角度配比(老莫补充 2026-08-03)

角度 张数(20张) 作用
正脸/微侧(±15°) 12 身份核心
45° 半侧脸(左右各一半) 6 立体结构、泛化关键
纯侧面(90°) 0-2 点缀
  • 45° 半侧脸教 LoRA 认识脸的立体结构(颧骨/下颌线/鼻子的三维关系),出图换角度也像
  • 左右两个方向的 45° 都要有,别只拍一边
  • 纯 90° 侧面信息少,最多 1-2 张
  • 俯拍/仰拍:少量或不要(会扭曲五官比例:俯拍额头大、仰拍鼻孔放大;AI 出图极少用极端俯仰角)。真要放:每方向最多 1 张、15-20° 轻度即可

6. 排除清单(看到就换)

口罩 / 墨镜 / 厚刘海遮挡 / 模糊 / 纯侧面 / 背光死黑 / 过度美颜 / 表情全是一个 / 年龄差距大

四、交付方式

  1. 照片放进 projects\脸部LoRA训练-Qwen-Image\素材\(或直接发我,我来整理)
  2. 我负责:重命名(img_001...)、检查分辨率/质量、批量生成 caption、整理成训练数据集格式
  3. 你只需要:选 15-25 张照片

四、时间预估

  • 选片:10-15 分钟
  • 打标:AI 批量 5 分钟(我代劳)
  • 合计:老莫只需花 10 分钟选照片

五、质量自检清单

  • 15-25 张,全部 ≥1024×1024
  • 正脸/微侧为主,角度有变化
  • 光线有变化,背景不复杂
  • 无遮挡五官(口罩/墨镜/厚刘海)
  • 照片都是最近 1-2 年的
  • 无重复角度、无模糊照