暨北内部-朵朵口播视频专用技能.md 9.2 KB

暨北内部 - 朵朵口播视频专用技能

本技能是「暨北内部 - 朵朵」品牌口播短视频的专用锁定版,基于 WorkBuddy 的 beauty-talk-science-video-script 技能收口而成。 它把人物、制服、朵朵音色、百炼工作空间与模型接口全部固定,门店场景直接采用技能内置门店空间索引实景图(怡呵美 LOGO 随实景自然呈现),使用者只需填入自己的 API Key 即可一键生成可直接用于抖音 / 视频号的美业科普口播成片。

本质:把一条「美业口播科普短视频」从零散需求,沉淀为一份带固定品牌素材、由 AI 像专业编导一样分镜、并直出阿里云百炼 wan3(万相 3.0)视频的结构化脚本与成片。


一、已经固定的元素与物料(使用者不可改)

以下内容已写死在 scripts/config.json 与技能流程中,使用者无需也不会去改。

1. 固定品牌素材(3 项,公网 OSS URL 已预填)

素材 含义 固定 URL
人物五视角图 朵朵固定形象(全片不变脸) https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/duoduo-demo.jpg
制服细节图 美容师制服(胸牌样式绝对不可变,仅可换款式/颜色) https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/zhifu-demo.png
朵朵音色 口播对白音色(reference_audio,Audio 1 引用) https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/voice-demo-sd.wav

注:门店场景不属固定素材,直接采用技能内置 assets/store-spatial-index/ 的 zone 实景图(怡呵美 LOGO 随品牌墙/发光字展柜实景自然呈现),无需固定 LOGO URL。

2. 固定工程配置(百炼 wan3)

配置 固定值
工作空间 workspace_id gxuwdo0w0g13zbax
模型接口 base_url https://llm-gxuwdo0w0g13zbax.cn-beijing.maas.aliyuncs.com
地域 region cn-beijing
模型 model wan3.0-video(万相 3.0 视频)
画幅 ratio 9:16(竖屏)
分辨率 resolution 720P

3. 固定编导规则(确保真实感、不 AI 感)

  • 单段时长:整段一个片段、≤30 秒(时长不固定 30 秒,由 Shot 台词时间分配表求和得 T 作实际 duration;超 30 秒自动反馈精简,绝不拆片段)。
  • 人物动线:单段(≤30 秒)动作≤2 个、方向不反向——「走动→落座」则落座后不再起身;「坐姿→起身走动」则走动后不再落座;口播中不设计整理产品等手部摆弄动作,手部只用自然手势 / 点头。
  • 运镜组合:2–3 种随机穿插(跟随 / 推近 / 拉远 / 横移 / 手持微晃)。
  • 插画展示方式:仅限局部画中画——形状随机选用正方形或圆形,单个插图宽度 ≤ 画面 1/2、高度等比,可置于画面任意位置但不遮挡人物面部;禁止全屏铺盖 / 人物画中画式全屏(用户 2026-09-17 规则 + 2026-09-22 尺寸约束)。
  • 门店丰富元素:前台 / 美容床 / 沙发 / 桌椅 / 其他店员虚化走过,随机点缀 2–3 个增加景深。
  • 插画插入点:插画与口播文案都确认后,必须指定插画从口播哪一句开始融入(见第二节「用户可指定」)。
  • 硬性禁令:无字幕 / 无文字 / 无卡通化 / 无塑料皮肤 / 无变脸 / 无服装漂移 / 无场景跳变。

4. 固定的生产原则

  • 不支持二次创作:任何元素修改(口播、服装、场景、插画、运镜)都重新组装完整脚本、整段重发 wan3,绝不使用视频编辑 / 延长模式。
  • 逐步确认:物料、口播、插画插入点、最终分镜方案都需使用者确认后再提交生成,避免浪费生成额度。

二、用户可指定配置的选择(使用者能填 / 选的)

除「固定配置」外,使用者只需提供以下内容,其余由技能自动编排:

可指定项 说明 是否必填 备注
API Key 自己的百炼 / DashScope Key(sk- 开头) ✅ 必填 写入 .env,不进 git
选题 / 知识点 这条视频讲什么(如「敏感肌能不能用功效型护肤品」) ✅ 必填 触发即提供
口播文案 自带底稿,或让技能生成 可选 自带则转口语化;不给则技能写
风格偏好问卷 门店调性 / 插画风格 / 色调等 可选 无要求→系统自动生成物料
插画插入点 插画从口播第几句开始融入 需确认 默认技能按语义建议,使用者最终拍板
人物动线路径 走动→落座 / 坐→起身走动 可选 默认技能选,可指定
插画展示方式偏好 形状(正方形/圆形)/ 位置(任意不挡脸)偏好 可选 默认随机选形状、可指定
门店丰富元素偏好 想要哪些道具 / 路人 可选 默认随机 2–3 个,可指定
物料选材确认 门店内景 3 张选哪张 / 插画 2 张选哪张 / 人物确认 需确认 生成后逐步确认

三、使用方法(安装 + 使用)

1. 安装(拿到 git 地址即可)

# 个人级(推荐):放进用户级 skills 目录
git clone https://p-git-work.hzbeautybox.com/zhengqi/yhm-ai-video-duoduo.git \
  ~/.workbuddy/skills/beauty-talk-science-video-duoduo

# 或团队级:放进项目级 skills 目录(团队共享)
git clone https://p-git-work.hzbeautybox.com/zhengqi/yhm-ai-video-duoduo.git \
  <你的项目>/.workbuddy/skills/beauty-talk-science-video-duoduo

克隆后即启用,无需改任何配置。

2. 配置自己的 Key(唯一一步)

cd ~/.workbuddy/skills/beauty-talk-science-video-duoduo/scripts
cp .env.example .env
# 编辑 .env,把 DASHSCOPE_API_KEY 改成你自己的 sk-... key

⚠️ .env 含你的密钥,切勿提交 git;本仓库已将其加入忽略。

3. 触发使用

对 WorkBuddy 说:

「用美业口播科普视频脚本技能,做一条关于 [你的选题] 的口播视频」

技能会按下方流程图走完整 11 步,并在每个确认点停下来等你拍板,最后把成片(MP4)交给你本地预览。

4. 手动生成(可选)

python scripts/generate_video.py --help   # 查看参数

四、生产视频流程图

flowchart TD
    A[用户触发:用本技能做「选题」口播视频] --> B[Step1 文字风格问卷<br/>无要求则系统自动生成物料]
    B --> C[Step2 锁定3项固定品牌素材<br/>朵朵人物 / 制服 / 音色]
    C --> D[Step3 生成确认物料<br/>人物形象照 / 门店空间实景图 / 插画]
    D --> E[Step4 用户确认物料选材]
    E --> F[Step5 口播转口语化 + 时长软卡 ≤30s]
    F --> G[Step6 用户确认口播文案]
    G --> H[Step7 确定插画插入点<br/>指定从哪句开始融入]
    H --> I[Step8 编导分镜级 Prompt 组装<br/>动线 + 运镜 + 插画展示 + 门店元素]
    I --> J[Step9 逐步确认全部方案]
    J --> K[Step10 调用百炼 wan3 生成<br/>建任务 → 轮询 → 下载]
    K --> L[Step11 成片交付确认]
    L --> M{满意?}
    M -->|是| N[✅ 交付成片 MP4]
    M -->|否| I

流程要点

  • 物料确认(Step4):系统先用固定素材生成「人物形象照 / 插画」,并从门店空间索引按动线 zone 选取实景图作场景参考,你确认选材后才往下。
  • 口播 + 插画插入点(Step6–7):口播文案确认后,再确认插画从哪句开始融入。
  • 编导分镜(Step8):AI 像专业编导一样设计人物动线、运镜、插画展示、门店丰富元素,全部落在单段 Prompt 里。
  • 整段重发(Step11→Step8):不满意则整段重发,不做局部二次创作。

五、固定配置说明(config.json 已含)

scripts/config.json 已直接写死以下固定值,使用者不要改动:

{
  "region": "cn-beijing",
  "workspace_id": "gxuwdo0w0g13zbax",
  "model": "wan3.0-video",
  "resolution": "720P",
  "ratio": "9:16",
  "api_base": "https://llm-gxuwdo0w0g13zbax.cn-beijing.maas.aliyuncs.com",
  "brand_assets": {
    "character_5view": { "url": "https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/duoduo-demo.jpg", "name": "朵朵" },
    "uniform_detail":   { "url": "https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/zhifu-demo.png" },
    "voice_ref":        { "url": "https://jibei-open-oss.oss-cn-hangzhou.aliyuncs.com/ai-video-assets/duoduo/voice-demo-sd.wav" }
  }
}

唯一需要你提供的是 .env 里的 DASHSCOPE_API_KEY。


六、注意事项

  1. 密钥安全:.env 含个人 Key,已加入 .gitignore,切勿手动提交;重新打包技能前请删除本地 .env。
  2. 整段重发:本技能不支持二次创作,任何修改都整段重生成(对应品牌硬需求)。
  3. 逐步确认:每个确认点请认真看,避免浪费百炼生成额度。
  4. 画质:成片为 9:16 竖屏 720P、单段 ≤30 秒(时长 T 由 Shot 表求和得出),适合短视频平台直接发布。