Kaynağa Gözat

fix(self-check): 修复五轮改动遗留的 6 处矛盾——PIP 旧形状/口播红线禁语气词/示例硬30s/素材表Image2

- PIP 旧形状复活:wan3-workflow.md 与 script-template.md 示例的「侧边圆角区域画中画」改为「正方形画中画」(与 Shot4 圆形形成轮换);SKILL.md 编导分镜约束「圆形PiP/条状PiP/侧边PiP」改为「正方形/圆形」
- 口播红线与新规冲突:wan3-workflow/script-template 硬性约束与口播逐字红线原写「禁止…语气词/禁止增加任何字词(语气词)」,与『口语化加语气词写进定本』矛盾;改为『定本已含的语气词须逐字照读,禁止模型自行添加台词之外的字词』
- 示例时长与规则自相矛盾:wan3-workflow 示例末 Shot 停 30s 但正文写『0→T 如 0–26s』;补『示例 T=30s 演示、实战 T 由 Shot 表求和、不硬撑30』注释,并将 0→T 例注与示例对齐
- 素材映射表 row2 把门店实景图 prompt 引用标为 Image 2,与『绝不写 Image N』硬规则矛盾;改为『自然语言描述』
zhengqi 1 hafta önce
ebeveyn
işleme
a40e94e365
3 değiştirilmiş dosya ile 11 ekleme ve 9 silme
  1. 1 1
      SKILL.md
  2. 4 4
      assets/script-template.md
  3. 6 4
      references/wan3-workflow.md

+ 1 - 1
SKILL.md

@@ -183,7 +183,7 @@ agent_created: true
 - **动线规划最先确定**:人物出场场景由动线规划决定,不固定前台;**设计动线前必须先阅读 `assets/store-spatial-index/` 下的《空间索引.json》与《00_俯瞰图_修订_带布局编号V4.jpeg》理解店内整体布局**;动线规划须于 Step 4 选取实景图前先行确定(见 Step 4 前置说明),并填入脚本第五节【动线设计规划】表(含场景 zone 列),门店实景图据此按对应 zone 选取。
 - **原生音视频**:口播写进 prompt 作对白,音色作 reference_audio,wan3 一次性生成画面+对白+口型+环境音。
 - **插画插入点确认**:插画与口播文案都确认后,必须请用户指定插画从口播哪一句开始融入,再组装 prompt(见 Step 7);不静默默认。
-- **编导分镜(不站桩)**:单段 Prompt 必须像专业编导覆盖五块——① 人物行为动线(按内容长短设计走动/坐/起/落座,不全程正对镜头)② 运镜组合(2–3 种随机穿插)③ 插画展示方式(圆形PiP/条状PiP/侧边PiP 随机混用不固化、禁全屏)④ 门店丰富元素(前台/美容床/沙发/其他人物虚化走过随机点缀)⑤ **背景逐段锚定**(每个 Shot 绑定对应 zone 参考图元素清单,详见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`);详见 `wan3-workflow.md` 第四节与 `elements.md` 元素 12/25/26/27。
+- **编导分镜(不站桩)**:单段 Prompt 必须像专业编导覆盖五块——① 人物行为动线(按内容长短设计走动/坐/起/落座,不全程正对镜头)② 运镜组合(2–3 种随机穿插)③ 插画展示方式(正方形/圆形随机混用不固化、禁全屏)④ 门店丰富元素(前台/美容床/沙发/其他人物虚化走过随机点缀)⑤ **背景逐段锚定**(每个 Shot 绑定对应 zone 参考图元素清单,详见 `wan3-workflow.md` 坑4 与 `references/store-spatial-index.md`);详见 `wan3-workflow.md` 第四节与 `elements.md` 元素 12/25/26/27。
 - **背景一致性硬约束**:人物未走位时背景禁止漂移成其他房间;人物真实经过的过渡空间(如走廊)必须传对应实景 reference_image(仅靠俯瞰图 + 文字会脑补"幽灵硬件",zone 实景图见 `assets/store-spatial-index/`);插画内容本身不得出现人物/人形(避免与真人并置成两个主角)。
 - **口型对齐**由 wan3 原生完成,脚本只保证口播文案与停顿完整。
 - **硬性禁令**优先级最高,必须写入脚本第七节,口播文字绝不转化为屏幕文字(LOGO 视觉露出除外)。

+ 4 - 4
assets/script-template.md

@@ -99,12 +99,12 @@
 声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
 口播须有自然语调起伏与停顿,禁止平淡匀速念稿。
 
-硬性约束:口播须严格限于下列分镜台词,禁止添加、删改或自由发挥任何文案之外的语句、语气词;
+硬性约束:口播须严格限于下列分镜台词(含已写入定本的语气词),禁止模型自行添加、删改或自由发挥任何台词之外的语句或语气词(定本已含的语气词须逐字照读,不得省略);
 插画以画中画形式呈现,形状随机选用正方形或圆形;单个插图宽度不超过画面宽度的 1/2、高度按宽高比等比例;可置于画面任意位置,但任何情况下不得遮挡人物面部;禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
 卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。
 
 结构说明:以下「Shot序号 + 时间戳 + 分镜内容」为本片分镜脚本;Shot序号与时间戳是给模型的
-节奏结构指令,不是台词,禁止当作语音读出;也禁止在任意空白时段补加台词或语气词。
+节奏结构指令,不是台词,禁止当作语音读出;也禁止在任意空白时段补加台词或语气词(定本已写入的语气词除外,须照读)。
 
 > **🗺️ 动线前置必读**:设计下表动线前,必须先阅读 `assets/store-spatial-index/` 下的《空间索引.json》与《00_俯瞰图_修订_带布局编号V4.jpeg》,理解店内整体布局(各 zone 相对位置、连通关系、可步行串联关系);**动线长度与人物走动速度须与总时长 T 匹配,切忌让人物走动太快或动线过长(避免瞬移式跨区 / 赶场感)**。动线所涉 zone 据此从资源包选取实景图。
 
@@ -136,7 +136,7 @@ Shot 4 [12.5-19.5s]:[走到陈列架前站立,讲到核心点时镜头缓慢
 展示插画参考1(抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
 稍作重音并留自然停顿{[口播句4]}。
 
-Shot 5 [19.5-26s]:[切换为画面侧边圆角区域画中画展示插画参考2(同风格,不铺满整屏)];她自然亲和{[口播句5]}。
+Shot 5 [19.5-26s]:[切换为画面正方形画中画展示插画参考2(同风格,不铺满整屏)];她自然亲和{[口播句5]}。
 
 Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。
 ```
@@ -161,7 +161,7 @@ Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收
 - 人物皮肤、脸部、颈部、手臂与服装表面禁止任何 Logo、文字、字母、数字、纹身字样、标签、水印(胸牌为指定样式,不含额外文字)。
 - 全片真实拍摄质感,不生成失真或 AI 痕迹过重画面。
 - **插画内禁止出现任何人物 / 人形轮廓 / 手势 / 人影**(红线,避免与口播真人并置成"两个主角";插画只画机理示意 / 物品 / 皮肤特写 / 光线氛围)。
-- **口播逐字红线**:口播 = 且仅为确认后的台词文本,逐字一字不差;prompt 其他文字(章节标题 / 表格表头 / 规格标注 / 结构说明)一律不出声;禁止增加任何字词(语气词、口头语、英文、总结句)或据画面/主题自行补词(如"做好防晒"后追"干皮")。
+- **口播逐字红线**:口播 = 且仅为确认后的台词文本,逐字一字不差;prompt 其他文字(章节标题 / 表格表头 / 规格标注 / 结构说明)一律不出声;禁止模型自行增加任何台词之外的字词(含语气词、口头语、英文、总结句);定本中已写入的语气词/口头语属台词本身,须逐字照读、不得省略;或据画面/主题自行补词(如"做好防晒"后追"干皮")。
 - **背景一致性**:人物未走位时背景禁止漂移成其他房间;人物真实经过的过渡空间(如走廊)必须传对应实景 reference_image,仅靠俯瞰图 + 文字描述会脑补出"幽灵硬件"。
 
 ---

+ 6 - 4
references/wan3-workflow.md

@@ -28,7 +28,7 @@
 | 素材 | 来源 | media type | prompt 引用 | 约束 |
 |---|---|---|---|---|
 | 人物完整形象照 | **生成物料**:以 `character_5view` + `uniform_detail`(固定素材)为参考生成并确认(见 `asset-collection.md` 第二节) | `reference_image` | `Image 1` | 全片同脸/同发型/同年龄感/同制服;**胸牌样式与确认稿一致、不可变更** |
-| 门店空间实景图(按动线 zone 选取) | **技能内置资源**:从 `assets/store-spatial-index/` 按动线 zone 选取对应 zone 实景图(见第二节),LOGO 随实景自然呈现 | `reference_image` | `Image 2` | 按动线 zone 选图;U01–U03 禁用;多 zone 可多张;LOGO 随实景(品牌墙/发光字展柜)自然出现 |
+| 门店空间实景图(按动线 zone 选取) | **技能内置资源**:从 `assets/store-spatial-index/` 按动线 zone 选取对应 zone 实景图(见第二节),LOGO 随实景自然呈现 | `reference_image` | 自然语言描述 | 按动线 zone 选图;U01–U03 禁用;多 zone 可多张;LOGO 随实景(品牌墙/发光字展柜)自然出现 |
 | 门店空间实景图(zone 参考,技能内置) | **技能内置资源**:`assets/store-spatial-index/` 下的 `Z0X_0Y_*.png`(10 张 9:16 实景图,区域/机位/可用-禁用区见 `references/store-spatial-index.md`) | `reference_image` | 自然语言描述 | 按脚本各 Shot 所在 zone 选取对应实景图传入(**本技能唯一场景来源**);U01–U03 禁用;人物真实经过的过渡空间(如走廊 Z05)必须传对应图,只靠俯瞰图+文字会脑补「幽灵硬件」 |
 | 插画参考图 1/2 | 自动生成(抽象可视化风格启发) | `reference_image` | `Image 3` / `Image 4` | 无真人皮肤/血液/文字 |
 | 音色文件 | 公网 URL `config.brand_assets.voice_ref.url`(优先)或本地 `assets/brand/voice_ref.*`(兜底) | `reference_audio` | `Audio 1` | 单段 ≤15s;超长则裁剪一段代表音色 |
@@ -64,7 +64,7 @@
 声音:原生清晰女声普通话对白(音色参考随附音频)、轻微环境音、无背景音乐;
 口播须有自然语调起伏与停顿,禁止平淡匀速念稿。
 
-硬性约束:口播须严格限于下列分镜台词,禁止添加、删改或自由发挥任何文案之外的语句、语气词;
+硬性约束:口播须严格限于下列分镜台词(含已写入定本的语气词),禁止模型自行添加、删改或自由发挥任何台词之外的语句或语气词(定本已含的语气词须逐字照读,不得省略);
 插画以画中画形式呈现,形状随机选用正方形或圆形;单个插图宽度不超过画面宽度的 1/2、高度按宽高比等比例;可置于画面任意位置,但任何情况下不得遮挡人物面部;禁止全屏覆盖;绝对禁止出现字幕、任何画面文字、
 卡通化人物、塑料皮肤、变脸、服装漂移、场景跳变、或其他清晰正脸人物抢镜。
 
@@ -83,15 +83,17 @@ Shot 4 [12.5-19.5s]:[走到陈列架前站立,讲到核心点时镜头缓慢
 展示[插画1](抽象可视化,无真人无文字,禁全屏)]。该句放慢加重带警示,讲到「[核心重音点]」时
 稍作重音并留自然停顿{[口播句4]}。
 
-Shot 5 [19.5-26s]:[切换为画面侧边圆角区域画中画展示[插画2](同风格,不铺满整屏)];她自然亲和{[口播句5]}。
+Shot 5 [19.5-26s]:[切换为画面正方形画中画展示[插画2](同风格,不铺满整屏)];她自然亲和{[口播句5]}。
 
 Shot 6 [26-30s]:[结尾缓慢拉远收束,她保持站立、抬手手势收束,中近景];收束句温和坚定{[口播句6]},留足停顿感。
 ```
 
+> ⚠️ 上例 Shot 时间戳按 **T=30s** 演示(各 Shot 时长之和 = 30)。实战中 T 由本片 Shot 台词时间分配表求和得出(可能 26s、24s 等),须把末 Shot 结束时间改为 T、并把 `--duration` 传 T,**不要硬撑到 30**(详见 `assets/script-template.md` 第五节)。
+
 - 口播台词用花括号 `{}` 圈出、逐句写进各 Shot 的「分镜内容」,wan3 原生生成语音并对口型;`{}` 之外的是画面/运镜描述,不会被当台词。
 - **人物行为动线**按口播时长设计:单段(不论 T 长短)动作切换 **≤2 个**、方向不反向(见 SKILL Step 8 元素 25);动作幅度随 T 伸缩,短于 30 秒更不宜多;**设计动线前须先阅读 `assets/store-spatial-index/《空间索引.json》` 与 `《00_俯瞰图_修订_带布局编号V4.jpeg》` 理解店内整体布局,动线长度与走动速度须与 T 匹配,切忌走太快或动线过长(避免瞬移式跨区 / 赶场感)**。
 - **运镜**每条约 2–3 种按时间轴穿插,不全程单一机位;**插画展示方式**一场内可混用多种,不恒定为一种;**门店丰富元素**随机点缀 2–3 个,增加景深与真实感。
-- **时间戳即控速锚点(关键)**:`Shot N [x-y s]` 连续铺满本段总时长 T(即 0→T,如 0–26s),既是分镜结构也是节奏约束,也等于 `duration` 的实际值。T 由各 Shot 时长求和得出,必须 ≤30。wan3 实测在「强制时长 > 口播实际长度」的空白时段会**自动编造废话填充**(padding 幻觉),故 Shot 时间分配须让台词真实撑满时间戳区间——靠放慢语速 + 句间留足气口,而非空撑时长。**推荐直接传算出的 T(不要硬撑到 30)**;若内容确实偏短,可改用 `−1` 智能时长(按内容自动定长,上限 30s)。
+- **时间戳即控速锚点(关键)**:`Shot N [x-y s]` 连续铺满本段总时长 T(即 0→T,如 0–26s),既是分镜结构也是节奏约束,也等于 `duration` 的实际值(本例 T=30 即 0–30s;若 Shot 表求和得 26s 则为 0–26s)T 由各 Shot 时长求和得出,必须 ≤30。wan3 实测在「强制时长 > 口播实际长度」的空白时段会**自动编造废话填充**(padding 幻觉),故 Shot 时间分配须让台词真实撑满时间戳区间——靠放慢语速 + 句间留足气口,而非空撑时长。**推荐直接传算出的 T(不要硬撑到 30)**;若内容确实偏短,可改用 `−1` 智能时长(按内容自动定长,上限 30s)。
 - 时长参数 `duration` 须传**本段算出的 T**(各 Shot 时长之和,≤30),不要写死 30;`ratio=9:16`,`resolution` 按 config;若口播偏短或要规避 padding,也可设 `−1` 智能时长(按内容自动定长,上限 30s)。
 - 反向约束(硬性禁令)也写进 prompt 负向描述:无字幕/无文字/无卡通化/无塑料皮肤/无变脸/无服装漂移/无场景跳变。