# 素材收集、生成、确认与登记参考 本文件定义技能在"用户发起口播视频任务"时如何**锁定固定品牌素材(生成输入)**、**生成最终确认物料并让用户确认**、**登记物料清单**,最终把确认后的物料映射为 wan3 的参考素材。目标:调用视频接口前,人物形象与场景风格全部锁定且经用户确认,成片一致、可直出。 ## 一、固定品牌素材(生成输入,永远锁定,不可被自动生成覆盖) 以下 4 项是**生成输入**,由用户提前以「公网 URL(config.brand_assets,推荐)」或「本地文件(assets/brand/,兜底)」提供,技能每次运行直接读取并锁定: | 素材 | config 字段(url) | 本地兜底文件名 | 角色 | 硬约束 | |---|---|---|---|---| | 人物五视角图 | `brand_assets.character_5view.url` | `character_5view.*`(png/jpg) | 生成「人物完整形象照」的输入 | 全片同一人:脸型/五官/发型/年龄感一致 | | 制服细节图 | `brand_assets.uniform_detail.url` | `uniform_detail.*` | 生成「人物完整形象照」的输入 | 可换款式/颜色;**胸牌样式必须完全一致、绝对不可变更** | | 立体 LOGO 源文件 | `brand_assets.logo_3d.url` | `logo_3d.*` | 生成「门店内景照片」的输入(LOGO 落位) | 必须出现在门店前台或某场景墙面 | | 音色文件 | `brand_assets.voice_ref.url` | `voice_ref.*`(mp3/wav,单段 ≤15s) | `reference_audio` = Audio 1(直接提交) | 作为口播音色参考;超 15s 先裁剪一段代表音色 | - 这 4 项**默认不直接提交 wan3**——它们是用来生成「第二节最终确认物料」的输入;只有 `voice_ref` 作为音色直接提交。 - 技能启动时**校验这 4 项**:每项要么 `config.brand_assets..url` 非空,要么 `assets/brand/` 存在对应本地文件;**两项皆无 → 主动提示用户(填 URL 或放文件),不进入后续生成**。 - 跨团队复用:给团队「URL 列表」或「4 个文件」其一即可,无需改流程。 ## 二、生成最终确认物料(核心:先出图确认,再提交) 固定 4 项之外/之上,按用户选题/知识点**生成以下最终物料**,展示给用户确认后,这些确认稿才作为 wan3 的 `reference_image` 提交: ### 1. 人物完整形象照 — 1 张(可生成 2–3 张供选) - **来源**:以 `character_5view`(人物五官/发型/年龄感)为人物参考、以 `uniform_detail`(制服款式/颜色、胸牌样式)为服装参考,用图像生成能力**合成 1 张「人物身穿制服的完整形象照」**。 - **硬约束**:胸牌样式与 `uniform_detail` 完全一致、不可变更;脸型/发型/年龄感与 `character_5view` 一致、不可变脸。 - 文件名:`人物_完整形象照.jpg`(若多张候选:`人物_形象_1.jpg` …)。 - 这是最终提交 wan3 的 **Image 1**(不再是原始五视角图本身)。 ### 2. 门店内景照片(含怡呵美 LOGO)— 3 张(多位置供选) - **来源**:以 `logo_3d` 作 LOGO 参考,生成门店内景,确保前台/墙面出现怡呵美立体 LOGO(单靠文字描述不可靠,必须靠 LOGO 参考落位)。 - 位置 1:面诊桌正对面(主角主讲机位);位置 2:前台侧(LOGO 主展示);位置 3:产品陈列 / 护理区。 - 文件名:`门店_内景_1.jpg` / `门店_内景_2.jpg` / `门店_内景_3.jpg`。 - 用户确认采用哪张作为视频主场景 → 记为 `门店_内景_采用.jpg`,这是最终提交 wan3 的 **Image 2**。 ### 3. 内容插入插画参考图 — 2 张(抽象可视化风格启发) - 风格来自元素 25(插画风格);内容提炼自知识点(如"屏障受损示意""红血丝 vs 泛红对比")。 - 约束:无真人皮肤 / 无血液 / 无伤口 / 无文字 / 无医学 UI。 - 文件名:`插画_参考1.jpg` / `插画_参考2.jpg`。 - 单段 30 秒视频内,插画以"抽象皮肤科普可视化"呈现(见元素 17),这两张图作**风格启发 / 参考图**,不单独生成插画视频段。提交为 **Image 3 / Image 4**。 ## 三、确认与自动随机指定 - 展示:人物完整形象照(1–3 张)、门店内景(3 张)、插画(2 张),请用户**逐类挑选/确认**。 - 用户**未做任何选择** → 系统**自动随机指定**一组(记录"已自动随机指定:人物_形象_X / 门店_内景_X / 插画_参考_X"),继续组装,不阻塞流程。 - 固定 4 项不进入"随机",始终用用户提供的素材(作生成输入)。 ## 四、物料清单登记(写入脚本「物料清单」段) - 人物完整形象照:`人物_完整形象照.jpg`(由 character_5view + uniform_detail 生成、确认,Image 1) - 门店内景照片:`门店_内景_采用.jpg`(由 logo_3d 生成含 LOGO、确认,Image 2) - 插画参考图:`插画_参考1.jpg` / `插画_参考2.jpg`(自动生成,Image 3 / Image 4) - 音色文件:`voice_ref.*`(确认,Audio 1,≤15s) - 原始输入(不提交):`character_5view.*` / `uniform_detail.*` / `logo_3d.*` ## 五、映射为 wan3 参考素材(供 generate_video.py) media 数组顺序 = prompt 中 Image/Audio 编号。**提交的是确认后的生成物料,不是原始 4 项文件本身**: ``` --media \ 人物_完整形象照.jpg:reference_image \ # Image 1(由 character_5view + uniform_detail 生成、确认) 门店_内景_采用.jpg:reference_image \ # Image 2(由 logo_3d 生成含 LOGO、确认) 插画_参考1.jpg:reference_image \ # Image 3 插画_参考2.jpg:reference_image \ # Image 4 https://cdn.x/voice_ref.mp3:reference_audio # Audio 1(config URL 透传,或 assets/brand 本地文件) ``` prompt 中相应使用 `Image 1`…`Image 4` / `Audio 1` 引用(详见 `wan3-workflow.md` 第四节)。 > 注:若 wan3 对一致性要求极高、希望额外锚定人物基准,可把 `character_5view` 也作为附加 `reference_image` 传入(Image 5),但默认流程仅提交上述确认物料。