本文件定义技能在"用户发起口播视频任务"时如何锁定固定品牌素材(生成输入)、生成最终确认物料并让用户确认、登记物料清单,最终把确认后的物料映射为 wan3 的参考素材。目标:调用视频接口前,人物形象与场景风格全部锁定且经用户确认,成片一致、可直出。
以下 3 项是生成输入,由用户提前以「公网 URL(config.brand_assets,推荐)」或「本地文件(assets/brand/,兜底)」提供,技能每次运行直接读取并锁定:
| 素材 | config 字段(url) | 本地兜底文件名 | 角色 | 硬约束 |
|---|---|---|---|---|
| 人物五视角图 | brand_assets.character_5view.url |
character_5view.*(png/jpg) |
生成「人物完整形象照」的输入 | 全片同一人:脸型/五官/发型/年龄感一致 |
| 制服细节图 | brand_assets.uniform_detail.url |
uniform_detail.* |
生成「人物完整形象照」的输入 | 可换款式/颜色;胸牌样式必须完全一致、绝对不可变更 |
| 音色文件 | brand_assets.voice_ref.url |
voice_ref.*(mp3/wav,单段 ≤15s) |
reference_audio = Audio 1(直接提交) |
作为口播音色参考;超 15s 先裁剪一段代表音色 |
voice_ref 作为音色直接提交。config.brand_assets.<key>.url 非空,要么 assets/brand/ 存在对应本地文件;两项皆无 → 主动提示用户(填 URL 或放文件),不进入后续生成。固定 3 项之外/之上,按用户选题/知识点生成以下最终物料,展示给用户确认后,这些确认稿才作为 wan3 的 reference_image 提交:
character_5view(人物五官/发型/年龄感)为人物参考、以 uniform_detail(制服款式/颜色、胸牌样式)为服装参考,用图像生成能力合成 1 张「人物身穿制服的完整形象照」。uniform_detail 完全一致、不可变更;脸型/发型/年龄感与 character_5view 一致、不可变脸。人物_完整形象照.jpg(若多张候选:人物_形象_1.jpg …)。assets/store-spatial-index/ 按动线规划涉及的 zone 直接选取对应实景照片(Z01–Z09 可用区),不另行用 AI 生成门店内景。怡呵美 LOGO 随实景图(品牌墙 Z01「YIHEMEI 你的水光肌肤管理师」/ 发光字展柜 Z02 等)自然呈现,无需单独合成。门店_实景_Z0X.jpg(与 zone 编号对应,如 门店_实景_Z02.jpg)。插画_参考1.jpg / 插画_参考2.jpg。人物_完整形象照.jpg(由 character_5view + uniform_detail 生成、确认,Image 1)门店_实景_Z0X.jpg(按动线 zone 从 assets/store-spatial-index/ 选取,LOGO 随实景自然呈现,Image 2)插画_参考1.jpg / 插画_参考2.jpg(自动生成,Image 3 / Image 4)voice_ref.*(确认,Audio 1,≤15s)character_5view.* / uniform_detail.*media 数组顺序 = prompt 中 Image/Audio 编号。提交的是确认后的生成物料,不是原始 3 项文件本身:
--media \
人物_完整形象照.jpg:reference_image \ # Image 1(由 character_5view + uniform_detail 生成、确认)
门店_实景_Z02.jpg:reference_image \ # 场景参考(按动线规划从 assets/store-spatial-index/ 选取的 zone 实景图,1~N 张,此处示例开场 zone Z02)
门店_实景_Z05.jpg:reference_image \ # 场景参考(走位经 Z05 走廊)
门店_实景_Z04.jpg:reference_image \ # 场景参考(落点 Z04 洽谈区)
插画_参考1.jpg:reference_image \ # Image 3
插画_参考2.jpg:reference_image \ # Image 4
https://cdn.x/voice_ref.mp3:reference_audio # Audio 1(config URL 透传,或 assets/brand 本地文件)
prompt 中相应使用 Image 1…Image 4 / Audio 1 引用(详见 wan3-workflow.md 第四节)。
注:若 wan3 对一致性要求极高、希望额外锚定人物基准,可把
character_5view也作为附加reference_image传入(Image 5),但默认流程仅提交上述确认物料。