|
@@ -28,7 +28,7 @@
|
|
|
| 素材 | 来源 | media type | prompt 引用 | 约束 |
|
|
| 素材 | 来源 | media type | prompt 引用 | 约束 |
|
|
|
|---|---|---|---|---|
|
|
|---|---|---|---|---|
|
|
|
| 人物完整形象照 | **生成物料**:以 `character_5view` + `uniform_detail`(固定素材)为参考生成并确认(见 `asset-collection.md` 第二节) | `reference_image` | `Image 1` | 全片同脸/同发型/同年龄感/同制服;**胸牌样式与确认稿一致、不可变更** |
|
|
| 人物完整形象照 | **生成物料**:以 `character_5view` + `uniform_detail`(固定素材)为参考生成并确认(见 `asset-collection.md` 第二节) | `reference_image` | `Image 1` | 全片同脸/同发型/同年龄感/同制服;**胸牌样式与确认稿一致、不可变更** |
|
|
|
-| 门店空间实景图(按动线 zone 选取) | **技能内置资源**:从 `assets/store-spatial-index/` 按动线 zone 选取对应 zone 实景图(见第二节),LOGO 随实景自然呈现 | `reference_image` | `Image 2` | 按动线 zone 选图;U01–U03 禁用;多 zone 可多张;LOGO 随实景(品牌墙/发光字展柜)自然出现 |
|
|
|
|
|
|
|
+| 门店空间实景图(按动线 zone 选取) | **技能内置资源**:从 `assets/store-spatial-index/` 按动线 zone 选取对应 zone 实景图(见第二节),LOGO 随实景自然呈现 | `reference_image` | 自然语言描述 | 按动线 zone 选图;U01–U03 禁用;多 zone 可多张;LOGO 随实景(品牌墙/发光字展柜)自然出现 |
|
|
|
| 门店空间实景图(zone 参考,技能内置) | **技能内置资源**:`assets/store-spatial-index/` 下的 `Z0X_0Y_*.png`(10 张 9:16 实景图,区域/机位/可用-禁用区见 `references/store-spatial-index.md`) | `reference_image` | 自然语言描述 | 按脚本各 Shot 所在 zone 选取对应实景图传入(**本技能唯一场景来源**);U01–U03 禁用;人物真实经过的过渡空间(如走廊 Z05)必须传对应图,只靠俯瞰图+文字会脑补「幽灵硬件」 |
|
|
| 门店空间实景图(zone 参考,技能内置) | **技能内置资源**:`assets/store-spatial-index/` 下的 `Z0X_0Y_*.png`(10 张 9:16 实景图,区域/机位/可用-禁用区见 `references/store-spatial-index.md`) | `reference_image` | 自然语言描述 | 按脚本各 Shot 所在 zone 选取对应实景图传入(**本技能唯一场景来源**);U01–U03 禁用;人物真实经过的过渡空间(如走廊 Z05)必须传对应图,只靠俯瞰图+文字会脑补「幽灵硬件」 |
|
|
|
| 插画参考图 1/2 | 自动生成(抽象可视化风格启发) | `reference_image` | `Image 3` / `Image 4` | 无真人皮肤/血液/文字 |
|
|
| 插画参考图 1/2 | 自动生成(抽象可视化风格启发) | `reference_image` | `Image 3` / `Image 4` | 无真人皮肤/血液/文字 |
|
|
|
| 音色文件 | 公网 URL `config.brand_assets.voice_ref.url`(优先)或本地 `assets/brand/voice_ref.*`(兜底) | `reference_audio` | `Audio 1` | 单段 ≤15s;超长则裁剪一段代表音色 |
|
|
| 音色文件 | 公网 URL `config.brand_assets.voice_ref.url`(优先)或本地 `assets/brand/voice_ref.*`(兜底) | `reference_audio` | `Audio 1` | 单段 ≤15s;超长则裁剪一段代表音色 |
|
|
@@ -64,7 +64,7 @@
|
|
|
声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
|
|
声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
|
|
|
口播须有自然语调起伏与停顿,禁止平淡匀速念稿。
|
|
口播须有自然语调起伏与停顿,禁止平淡匀速念稿。
|
|
|
|
|
|
|
|
-硬性约束:口播须严格限于下列分镜台词,禁止添加、删改或自由发挥任何文案之外的语句、语气词;
|
|
|
|
|
|
|
+硬性约束:口播须严格限于下列分镜台词(含已写入定本的语气词),禁止模型自行添加、删改或自由发挥任何台词之外的语句或语气词(定本已含的语气词须逐字照读,不得省略);
|
|
|
插画以画中画形式呈现,形状随机选用正方形或圆形;单个插图宽度不超过画面宽度的 1/2、高度按宽高比等比例;可置于画面任意位置,但任何情况下不得遮挡人物面部;禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
|
|
插画以画中画形式呈现,形状随机选用正方形或圆形;单个插图宽度不超过画面宽度的 1/2、高度按宽高比等比例;可置于画面任意位置,但任何情况下不得遮挡人物面部;禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
|
|
|
卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。
|
|
卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。
|
|
|
|
|
|
|
@@ -83,15 +83,17 @@ Shot 4 [12.5-19.5s]:[走到陈列架前站立,讲到核心点时镜头缓慢
|
|
|
展示[插画1](抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
|
|
展示[插画1](抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
|
|
|
稍作重音并留自然停顿{[口播句4]}。
|
|
稍作重音并留自然停顿{[口播句4]}。
|
|
|
|
|
|
|
|
-Shot 5 [19.5-26s]:[切换为画面侧边圆角区域画中画展示[插画2](同风格,不铺满整屏)];她自然亲和{[口播句5]}。
|
|
|
|
|
|
|
+Shot 5 [19.5-26s]:[切换为画面正方形画中画展示[插画2](同风格,不铺满整屏)];她自然亲和{[口播句5]}。
|
|
|
|
|
|
|
|
Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。
|
|
Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。
|
|
|
```
|
|
```
|
|
|
|
|
|
|
|
|
|
+> ⚠️ 上例 Shot 时间戳按 **T=30s** 演示(各 Shot 时长之和 = 30)。实战中 T 由本片 Shot 台词时间分配表求和得出(可能 26s、24s 等),须把末 Shot 结束时间改为 T、并把 `--duration` 传 T,**不要硬撑到 30**(详见 `assets/script-template.md` 第五节)。
|
|
|
|
|
+
|
|
|
- 口播台词用花括号 `{}` 圈出、逐句写进各 Shot 的「分镜内容」,wan3 原生生成语音并对口型;`{}` 之外的是画面/运镜描述,不会被当台词。
|
|
- 口播台词用花括号 `{}` 圈出、逐句写进各 Shot 的「分镜内容」,wan3 原生生成语音并对口型;`{}` 之外的是画面/运镜描述,不会被当台词。
|
|
|
- **人物行为动线**按口播时长设计:单段(不论 T 长短)动作切换 **≤2 个**、方向不反向(见 SKILL Step 8 元素 25);动作幅度随 T 伸缩,短于 30 秒更不宜多;**设计动线前须先阅读 `assets/store-spatial-index/《空间索引.json》` 与 `《00_俯瞰图_修订_带布局编号V4.jpeg》` 理解店内整体布局,动线长度与走动速度须与 T 匹配,切忌走太快或动线过长(避免瞬移式跨区 / 赶场感)**。
|
|
- **人物行为动线**按口播时长设计:单段(不论 T 长短)动作切换 **≤2 个**、方向不反向(见 SKILL Step 8 元素 25);动作幅度随 T 伸缩,短于 30 秒更不宜多;**设计动线前须先阅读 `assets/store-spatial-index/《空间索引.json》` 与 `《00_俯瞰图_修订_带布局编号V4.jpeg》` 理解店内整体布局,动线长度与走动速度须与 T 匹配,切忌走太快或动线过长(避免瞬移式跨区 / 赶场感)**。
|
|
|
- **运镜**每条约 2–3 种按时间轴穿插,不全程单一机位;**插画展示方式**一场内可混用多种,不恒定为一种;**门店丰富元素**随机点缀 2–3 个,增加景深与真实感。
|
|
- **运镜**每条约 2–3 种按时间轴穿插,不全程单一机位;**插画展示方式**一场内可混用多种,不恒定为一种;**门店丰富元素**随机点缀 2–3 个,增加景深与真实感。
|
|
|
-- **时间戳即控速锚点(关键)**:`Shot N [x-y s]` 连续铺满本段总时长 T(即 0→T,如 0–26s),既是分镜结构也是节奏约束,也等于 `duration` 的实际值。T 由各 Shot 时长求和得出,必须 ≤30。wan3 实测在「强制时长 > 口播实际长度」的空白时段会**自动编造废话填充**(padding 幻觉),故 Shot 时间分配须让台词真实撑满时间戳区间——靠放慢语速 + 句间留足气口,而非空撑时长。**推荐直接传算出的 T(不要硬撑到 30)**;若内容确实偏短,可改用 `−1` 智能时长(按内容自动定长,上限 30s)。
|
|
|
|
|
|
|
+- **时间戳即控速锚点(关键)**:`Shot N [x-y s]` 连续铺满本段总时长 T(即 0→T,如 0–26s),既是分镜结构也是节奏约束,也等于 `duration` 的实际值(本例 T=30 即 0–30s;若 Shot 表求和得 26s 则为 0–26s)T 由各 Shot 时长求和得出,必须 ≤30。wan3 实测在「强制时长 > 口播实际长度」的空白时段会**自动编造废话填充**(padding 幻觉),故 Shot 时间分配须让台词真实撑满时间戳区间——靠放慢语速 + 句间留足气口,而非空撑时长。**推荐直接传算出的 T(不要硬撑到 30)**;若内容确实偏短,可改用 `−1` 智能时长(按内容自动定长,上限 30s)。
|
|
|
- 时长参数 `duration` 须传**本段算出的 T**(各 Shot 时长之和,≤30),不要写死 30;`ratio=9:16`,`resolution` 按 config;若口播偏短或要规避 padding,也可设 `−1` 智能时长(按内容自动定长,上限 30s)。
|
|
- 时长参数 `duration` 须传**本段算出的 T**(各 Shot 时长之和,≤30),不要写死 30;`ratio=9:16`,`resolution` 按 config;若口播偏短或要规避 padding,也可设 `−1` 智能时长(按内容自动定长,上限 30s)。
|
|
|
- 反向约束(硬性禁令)也写进 prompt 负向描述:无字幕/无文字/无卡通化/无塑料皮肤/无变脸/无服装漂移/无场景跳变。
|
|
- 反向约束(硬性禁令)也写进 prompt 负向描述:无字幕/无文字/无卡通化/无塑料皮肤/无变脸/无服装漂移/无场景跳变。
|
|
|
|
|
|