asset-collection.md 6.4 KB

素材收集、生成、确认与登记参考

本文件定义技能在"用户发起口播视频任务"时如何锁定固定品牌素材(生成输入)、生成最终确认物料并让用户确认、登记物料清单,最终把确认后的物料映射为 wan3 的参考素材。目标:调用视频接口前,人物形象与场景风格全部锁定且经用户确认,成片一致、可直出。

一、固定品牌素材(生成输入,永远锁定,不可被自动生成覆盖)

以下 3 项是生成输入,由用户提前以「公网 URL(config.brand_assets,推荐)」或「本地文件(assets/brand/,兜底)」提供,技能每次运行直接读取并锁定:

素材 config 字段(url) 本地兜底文件名 角色 硬约束
人物五视角图 brand_assets.character_5view.url character_5view.*(png/jpg) 生成「人物完整形象照」的输入 全片同一人:脸型/五官/发型/年龄感一致
制服细节图 brand_assets.uniform_detail.url uniform_detail.* 生成「人物完整形象照」的输入 可换款式/颜色;胸牌样式必须完全一致、绝对不可变更
音色文件 brand_assets.voice_ref.url voice_ref.*(mp3/wav,单段 ≤15s) reference_audio = Audio 1(直接提交) 作为口播音色参考;超 15s 先裁剪一段代表音色
  • 这 3 项默认不直接提交 wan3——它们是用来生成「第二节最终确认物料」的输入;只有 voice_ref 作为音色直接提交。
  • 技能启动时校验这 3 项:每项要么 config.brand_assets.<key>.url 非空,要么 assets/brand/ 存在对应本地文件;两项皆无 → 主动提示用户(填 URL 或放文件),不进入后续生成。
  • 跨团队复用:给团队「URL 列表」或「3 个文件」其一即可,无需改流程。

二、生成最终确认物料(核心:先出图确认,再提交)

固定 3 项之外/之上,按用户选题/知识点生成以下最终物料,展示给用户确认后,这些确认稿才作为 wan3 的 reference_image 提交:

1. 人物完整形象照 — 1 张(可生成 2–3 张供选)

  • 来源:以 character_5view(人物五官/发型/年龄感)为人物参考、以 uniform_detail(制服款式/颜色、胸牌样式)为服装参考,用图像生成能力合成 1 张「人物身穿制服的完整形象照」。
  • 硬约束:胸牌样式与 uniform_detail 完全一致、不可变更;脸型/发型/年龄感与 character_5view 一致、不可变脸。
  • 文件名:人物_完整形象照.jpg(若多张候选:人物_形象_1.jpg …)。
  • 这是最终提交 wan3 的 Image 1(不再是原始五视角图本身)。

2. 门店空间实景图(按动线 zone 选取,不另行生成)— 1~N 张

  • 来源:从技能内置 assets/store-spatial-index/ 按动线规划涉及的 zone 直接选取对应实景照片(Z01–Z09 可用区),不另行用 AI 生成门店内景。怡呵美 LOGO 随实景图(品牌墙 Z01「YIHEMEI 你的水光肌肤管理师」/ 发光字展柜 Z02 等)自然呈现,无需单独合成。
  • 选取:按动线 zone 选图(如开场 zone = 产品陈列架 Z02 / 洽谈区 Z04 / 前台 Z03…),多 zone 动线可选取多张分别作为各段背景参考。
  • 文件名:门店_实景_Z0X.jpg(与 zone 编号对应,如 门店_实景_Z02.jpg)。
  • 此为最终提交 wan3 的 Image 2(场景参考图);U01–U03 禁用区严禁选取。

3. 内容插入插画参考图 — 2 张(抽象可视化风格启发)

  • 风格来自元素 25(插画风格);内容提炼自知识点(如"屏障受损示意""红血丝 vs 泛红对比")。
  • 约束:无真人皮肤 / 无血液 / 无伤口 / 无文字 / 无医学 UI。
  • 文件名:插画_参考1.jpg / 插画_参考2.jpg。
  • 单段 30 秒视频内,插画以"抽象皮肤科普可视化"呈现(见元素 17),这两张图作风格启发 / 参考图,不单独生成插画视频段。提交为 Image 3 / Image 4。

三、确认与自动随机指定

  • 展示:人物完整形象照(1–3 张)、插画(2 张),请用户逐类挑选/确认;门店空间实景图按动线 zone 选取(非生成,无需逐张挑选,可直接按 zone 选取)。
  • 用户未做任何选择 → 系统自动随机指定一组(记录"已自动随机指定:人物_形象_X / 插画_参考_X"),继续组装,不阻塞流程;门店实景图按动线 zone 默认选取。
  • 固定 3 项不进入"随机",始终用用户提供的素材(作生成输入)。

四、物料清单登记(写入脚本「物料清单」段)

  • 人物完整形象照:人物_完整形象照.jpg(由 character_5view + uniform_detail 生成、确认,Image 1)
  • 门店空间实景图:门店_实景_Z0X.jpg(按动线 zone 从 assets/store-spatial-index/ 选取,LOGO 随实景自然呈现,Image 2)
  • 插画参考图:插画_参考1.jpg / 插画_参考2.jpg(自动生成,Image 3 / Image 4)
  • 音色文件:voice_ref.*(确认,Audio 1,≤15s)
  • 原始输入(不提交):character_5view.* / uniform_detail.*

五、映射为 wan3 参考素材(供 generate_video.py)

media 数组顺序 = prompt 中 Image/Audio 编号。提交的是确认后的生成物料,不是原始 3 项文件本身:

--media \
  人物_完整形象照.jpg:reference_image \   # Image 1(由 character_5view + uniform_detail 生成、确认)
  门店_实景_Z02.jpg:reference_image \     # 场景参考(按动线规划从 assets/store-spatial-index/ 选取的 zone 实景图,1~N 张,此处示例开场 zone Z02)
  门店_实景_Z05.jpg:reference_image \     # 场景参考(走位经 Z05 走廊)
  门店_实景_Z04.jpg:reference_image \     # 场景参考(落点 Z04 洽谈区)
  插画_参考1.jpg:reference_image \        # Image 3
  插画_参考2.jpg:reference_image \        # Image 4
  https://cdn.x/voice_ref.mp3:reference_audio   # Audio 1(config URL 透传,或 assets/brand 本地文件)

prompt 中相应使用 Image 1…Image 4 / Audio 1 引用(详见 wan3-workflow.md 第四节)。

注:若 wan3 对一致性要求极高、希望额外锚定人物基准,可把 character_5view 也作为附加 reference_image 传入(Image 5),但默认流程仅提交上述确认物料。