珠宝佩戴视频生成

SkillMedia

Add 1, 3 reference objects into a mime (prop-free) performance video while keeping the person, scene, camera, pacing, and motion unchanged. Suitable for prop-free performance enhancement and object insertion.

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 珠宝佩戴视频生成 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/mime-object-video/SKILL.md and read by ahel’s review.

当用户提供一段人物无实物表演视频,并提供 1-3 张参考物品图片,希望最终视频中参考物品出现在角色指定部位时,使用本 Skill。核心承诺是:自然加入物品,但保持原视频中的人物、场景、镜头、节奏、动作和整体连续性不变。默认使用 MiniMax H3。用户明确指定其他模型时先检查能力并遵循其选择;失败后针对原因重试一次,随后切换其他可用模型。

不要把本 Skill 用于泛物体替换、完整场景重设计、产品广告、口播字体包装、纯字幕编辑或纯文本生成视频。如果用户想做新的剧情广告、品牌片或多镜头成片,应改走更完整的视频或广告工作流。

步骤 0:收集必需输入

必需输入:

  1. 源视频:一段用户上传或画布中的无实物表演视频。
  2. 物品参考图:1-3 张待插入物品、产品、配饰、服装部件或道具图片。
  3. 目标部位:物品应出现的身体部位或区域,例如手、手腕、头部、脸部、肩膀、躯干、腰部、脚、背部,或“两手之间”。
  4. 交互方式:如果不明显,询问物品是被拿着、佩戴、固定在身体上、贴近悬浮、背着,还是跟随某个手势移动。

缺少必需输入时,只询问缺失项。用户没有明确要求字幕时,不要询问字幕,也不要默认加字幕。

可选输入:

  • 输出比例或平台。未说明时,保持源视频比例。
  • 参考物品是否必须精确复刻,还是只需自然相似。默认:自然且忠实参考。
  • 是否保留原视频声音。默认:源视频有有效声音时保留原声。

步骤 1:分析源视频与参考图

分析源视频时关注:

  • 可见人物数量与主表演者。
  • 目标部位的可见性、运动范围、遮挡关系和可接触时机。
  • 镜头运动、构图、时长节奏和运动模糊。
  • 场景光线、透视、阴影和背景连续性。
  • 目标部位是否足够可见,能否支持用户要求的物品植入。

分析物品参考图时关注:

  • 物品类型与使用方式:手持、佩戴、身体固定、携带或贴近身体。
  • 必须保留可识别性的主体结构与轮廓。
  • 连接逻辑:接触身体的部位、抓握/佩戴方式、朝向镜头的面。
  • 如果多张参考图展示同一个物品,应把它们视为同一物品的多视角参考;如果明显是不同物品,应询问用户选择一个物品还是同时插入多个物品。

除非用户用文字指定颜色,不要把颜色写进提示词;让参考图直接提供颜色与材质信息。

步骤 2:生成前可行性检查

在高成本视频生成前检查:

  • 目标身体部位在视频中是否出现得足够多。
  • 请求的物品尺寸是否能合理适配目标部位。
  • 物品交互是否与原动作矛盾。例如大型双手物体需要两只手可见,或至少有明确的抱持姿态。
  • 源视频必须作为基础:不要重设计人物、服装、背景、镜头或动作。

如果需求存在歧义,只问最短的阻塞问题。例如:

  • “物品是握在手里,还是固定在手腕上?”
  • “这三张图看起来是不同物品,要插入哪一个?”
  • “目标部位大部分被遮挡,是否可以放到附近可见区域?”

步骤 3:编写编辑简报

生成紧凑的编辑简报,优先写保留约束:

  1. 源视频不变量:保持原人物身份、脸部、服装、身体比例、场景、光线、镜头、时长节奏、动作和表演节奏。
  2. 物品植入:把参考物品放到指定身体部位,匹配比例、透视、抓握/佩戴/接触、阴影、遮挡和运动跟踪。
  3. 参考忠实度:保留参考物品可识别的轮廓、部件、材质线索和功能结构。
  4. 不做多余改动:不要增加新人、改变背景、改变服装、改变姿势、改变镜头运动或引入无关道具。

对于很短的用户请求,最终编辑提示词应尽量贴近用户原话,只补充必要的保留约束和接触关系。

步骤 4:选择制作路径

使用能保持源视频的最短路径,并默认优先使用 MiniMax H3:

  • 优先使用支持“源视频 + 图片参考”的 MiniMax H3 编辑路径;能一遍完成时不要拆成复杂流程。
  • 如果 H3 或所选路径需要视觉锚点,先从源视频代表帧与物品参考图生成一张物品放置参考帧,再用它指导视频编辑。
  • 如果需要保留原声,先生成视觉增强视频,再在必要时把原视频音轨重新合回去。
  • 除非用户明确要求平台改幅,默认保持源视频比例。

不要把简单单条视频编辑升级成完整多阶段工作流;只有当用户要求多段视频、审阅分镜、复杂多物品交互,或还要音乐、字幕、成片拼接时,才进入更完整的视频工作流。

步骤 5:生成增强视频

派发视频生成/编辑时:

  • 把源视频作为主要视频来源。
  • 按用户上传顺序传入物品参考图。
  • 明确写出目标身体部位与交互方式。
  • 明确写出保留约束:人物、脸、服装、场景、光线、镜头、运动、动作和时长节奏保持不变。
  • 明确写出物理融合要求:运动跟踪、透视、比例、接触、遮挡、阴影和模糊与源视频一致。

避免堆砌负面提示词。只有当模型容易漂移时,才加入真正必要的限制,例如“不要替换演员”“不要重设计场景”。

步骤 6:审查与修复

生成后检查:

  • 物品是否出现在用户指定的身体部位。
  • 物品是否随身体运动和遮挡自然变化。
  • 物品比例与透视是否可信。
  • 原人物、服装、场景、镜头和动作是否保持。
  • 是否出现多余肢体、重复物品、人物漂移、背景重绘或物品闪烁。

如果结果失败:

  • 物品位置错误:强化身体部位与接触方式描述。
  • 人物或场景漂移:强化源视频保留约束,减少创意性描述。
  • 物品不像参考:强调参考物品的具体轮廓与功能结构。
  • 跟踪或闪烁:要求稳定附着、一致比例和逐帧连续性。

重试时必须实质性修正提示词,不要重复同一提示词。

步骤 7:交付

在画布上返回增强视频。总结时只说明:

  • 使用的源视频。
  • 参考物品数量。
  • 目标身体部位与交互方式。
  • 是否保留原声。

除非用户要求,不要暴露内部提示词、模型参数或节点 id。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
mime-object-video
Source
github.com/qxryz/workflowgenerator