asset-collection.md 6.0 KB

素材收集、生成、确认与登记参考

本文件定义技能在"用户发起口播视频任务"时如何锁定固定品牌素材(生成输入)、生成最终确认物料并让用户确认、登记物料清单,最终把确认后的物料映射为 wan3 的参考素材。目标:调用视频接口前,人物形象与场景风格全部锁定且经用户确认,成片一致、可直出。

一、固定品牌素材(生成输入,永远锁定,不可被自动生成覆盖)

以下 4 项是生成输入,由用户提前以「公网 URL(config.brand_assets,推荐)」或「本地文件(assets/brand/,兜底)」提供,技能每次运行直接读取并锁定:

素材 config 字段(url) 本地兜底文件名 角色 硬约束
人物五视角图 brand_assets.character_5view.url character_5view.*(png/jpg) 生成「人物完整形象照」的输入 全片同一人:脸型/五官/发型/年龄感一致
制服细节图 brand_assets.uniform_detail.url uniform_detail.* 生成「人物完整形象照」的输入 可换款式/颜色;胸牌样式必须完全一致、绝对不可变更
立体 LOGO 源文件 brand_assets.logo_3d.url logo_3d.* 生成「门店内景照片」的输入(LOGO 落位) 必须出现在门店前台或某场景墙面
音色文件 brand_assets.voice_ref.url voice_ref.*(mp3/wav,单段 ≤15s) reference_audio = Audio 1(直接提交) 作为口播音色参考;超 15s 先裁剪一段代表音色
  • 这 4 项默认不直接提交 wan3——它们是用来生成「第二节最终确认物料」的输入;只有 voice_ref 作为音色直接提交。
  • 技能启动时校验这 4 项:每项要么 config.brand_assets.<key>.url 非空,要么 assets/brand/ 存在对应本地文件;两项皆无 → 主动提示用户(填 URL 或放文件),不进入后续生成。
  • 跨团队复用:给团队「URL 列表」或「4 个文件」其一即可,无需改流程。

二、生成最终确认物料(核心:先出图确认,再提交)

固定 4 项之外/之上,按用户选题/知识点生成以下最终物料,展示给用户确认后,这些确认稿才作为 wan3 的 reference_image 提交:

1. 人物完整形象照 — 1 张(可生成 2–3 张供选)

  • 来源:以 character_5view(人物五官/发型/年龄感)为人物参考、以 uniform_detail(制服款式/颜色、胸牌样式)为服装参考,用图像生成能力合成 1 张「人物身穿制服的完整形象照」。
  • 硬约束:胸牌样式与 uniform_detail 完全一致、不可变更;脸型/发型/年龄感与 character_5view 一致、不可变脸。
  • 文件名:人物_完整形象照.jpg(若多张候选:人物_形象_1.jpg …)。
  • 这是最终提交 wan3 的 Image 1(不再是原始五视角图本身)。

2. 门店内景照片(含怡呵美 LOGO)— 3 张(多位置供选)

  • 来源:以 logo_3d 作 LOGO 参考,生成门店内景,确保前台/墙面出现怡呵美立体 LOGO(单靠文字描述不可靠,必须靠 LOGO 参考落位)。
  • 位置 1:面诊桌正对面(主角主讲机位);位置 2:前台侧(LOGO 主展示);位置 3:产品陈列 / 护理区。
  • 文件名:门店_内景_1.jpg / 门店_内景_2.jpg / 门店_内景_3.jpg。
  • 用户确认采用哪张作为视频主场景 → 记为 门店_内景_采用.jpg,这是最终提交 wan3 的 Image 2。

3. 内容插入插画参考图 — 2 张(抽象可视化风格启发)

  • 风格来自元素 25(插画风格);内容提炼自知识点(如"屏障受损示意""红血丝 vs 泛红对比")。
  • 约束:无真人皮肤 / 无血液 / 无伤口 / 无文字 / 无医学 UI。
  • 文件名:插画_参考1.jpg / 插画_参考2.jpg。
  • 单段 30 秒视频内,插画以"抽象皮肤科普可视化"呈现(见元素 17),这两张图作风格启发 / 参考图,不单独生成插画视频段。提交为 Image 3 / Image 4。

三、确认与自动随机指定

  • 展示:人物完整形象照(1–3 张)、门店内景(3 张)、插画(2 张),请用户逐类挑选/确认。
  • 用户未做任何选择 → 系统自动随机指定一组(记录"已自动随机指定:人物_形象_X / 门店_内景_X / 插画_参考_X"),继续组装,不阻塞流程。
  • 固定 4 项不进入"随机",始终用用户提供的素材(作生成输入)。

四、物料清单登记(写入脚本「物料清单」段)

  • 人物完整形象照:人物_完整形象照.jpg(由 character_5view + uniform_detail 生成、确认,Image 1)
  • 门店内景照片:门店_内景_采用.jpg(由 logo_3d 生成含 LOGO、确认,Image 2)
  • 插画参考图:插画_参考1.jpg / 插画_参考2.jpg(自动生成,Image 3 / Image 4)
  • 音色文件:voice_ref.*(确认,Audio 1,≤15s)
  • 原始输入(不提交):character_5view.* / uniform_detail.* / logo_3d.*

五、映射为 wan3 参考素材(供 generate_video.py)

media 数组顺序 = prompt 中 Image/Audio 编号。提交的是确认后的生成物料,不是原始 4 项文件本身:

--media \
  人物_完整形象照.jpg:reference_image \   # Image 1(由 character_5view + uniform_detail 生成、确认)
  门店_内景_采用.jpg:reference_image \    # Image 2(由 logo_3d 生成含 LOGO、确认)
  插画_参考1.jpg:reference_image \        # Image 3
  插画_参考2.jpg:reference_image \        # Image 4
  https://cdn.x/voice_ref.mp3:reference_audio   # Audio 1(config URL 透传,或 assets/brand 本地文件)

prompt 中相应使用 Image 1…Image 4 / Audio 1 引用(详见 wan3-workflow.md 第四节)。

注:若 wan3 对一致性要求极高、希望额外锚定人物基准,可把 character_5view 也作为附加 reference_image 传入(Image 5),但默认流程仅提交上述确认物料。