视频元素替换 / Video Element Replacement
SkillMediaReplaces people, backgrounds, products, props, or other visible elements in user videos while preserving original motion, camera work, continuity, and specified audio. Supports multi-element and cross-species replacement; suitable for video element replacement, swapping people, changing backgrounds,
Available today. Use it from your connected AI after setup.
No other account needed.
Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.
Then ask your AI: use the 视频元素替换 / Video Element Replacement skill
What this skill tells your AI
The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/video-element-replacement/SKILL.md and read by ahel’s review.
适用范围
当用户提供一段视频,并希望用 H3 替换视频中的一个或多个可见元素时使用本 Skill。
默认支持:
- 人物替换:真人换真人、真人换动物或拟人化角色、真人换二次元或 CG 角色、只换脸、整体换人
- 背景替换:室内、室外、街道、房间、舞台、自然环境和动态场景替换
- 产品或物体替换:商品、包装、设备、车辆、家具、道具、手持物或画面中的其他物体
- 多元素替换:人物、背景、产品或多个道具同时替换
不把字幕、剪辑、调色、压缩转码、静态图片动画化误判为本 Skill。
STEP 1:接收并分析原视频
分析原视频的时长、画幅、镜头结构、镜头切换、主体数量、主体位置、动作、运动路径、镜头运动、景深、遮挡、接触关系和音频内容。
确认替换对象是否在多个镜头中持续出现,是否会出画后重新入画,以及是否存在多个相似主体。默认保留原视频的动作、镜头、剪辑节奏、空间关系、对白和环境声,不改变故事含义。
如果视频超过单次生成时长,按镜头或时间段规划分段替换,并为所有分段绑定同一个替换角色或产品参考。
STEP 2:确认替换类型与范围
如果用户已明确目标,直接采用用户选择;如果没有明确目标,让用户选择:
- 人物
- 背景
- 产品或物体
- 多个对象
确认替换范围:整段视频、指定镜头、指定时间段,或多个对象中的某一部分。确认哪些内容必须保留:动作、人物关系、镜头构图、背景、产品使用动作、对白、环境声或其他用户明确要求。
不要重复询问用户已经明确的内容。
STEP 3:固定采用自然适配
所有视频元素替换任务统一采用自然适配,不再让用户选择替换强度,也不再提供“保守替换 / 自然适配 / 完全重塑”的选项。
固定规则如下:
- 保留原视频的主要动作、镜头、构图、时间节奏、空间关系和故事含义。
- 允许新人物、动物、玩偶、机器人、卡通角色、产品或物体根据自身的物种、体型、结构、材质和视角自然适配原动作。
- 保留新主体的关键身份和结构特征,不强行复制原主体不兼容的解剖结构、比例或动作细节。
- 只有当用户明确要求改变动作、镜头、故事或空间关系时,才修改对应内容。
- 不因替换强度发起额外确认;仅在缺少工具执行所需信息时提问。
STEP 4:检查替换素材适配度
检查每个替换参考素材的主体数量、身份特征、轮廓完整度、角度、姿态、细节清晰度、遮挡和与原视频的比例差异,并评为:
- A 级:主体清晰、角度和构图接近,可直接替换
- B 级:身份和外观清晰,但角度、姿态或比例差异较大,可以生成但需要自然适配
- C 级:主体严重遮挡、细节不足、缺少关键角度或视频运动过于复杂,建议补充参考素材或先做短预览
在不阻塞任务的情况下提示风险。例如单张正面静态角色图用于侧面动态视频时,说明转头、口型和边缘稳定性可能需要二次优化。 在素材等级之外,必须对本次替换任务进行难度与预期评估。评估不能只判断“能不能生成”,还要判断“生成后能否稳定达到用户目标”。
难度等级
- 低难度:单主体、动作幅度小、遮挡少、参考图角度接近、主体结构简单。通常可以直接生成,预期替换稳定。
- 中难度:主体有明显运动、角度变化、局部遮挡、参考图视角有限,或新旧主体比例差异较大。可以生成,但可能出现局部闪烁、边缘不稳、细节变化或动作适配偏差。
- 高难度:多人统一替换、复杂舞蹈、快速运动、透明或半透明遮挡、人物互相遮挡、主体频繁出画、严重透视变化、跨物种或极端体型转换。可以尝试生成,但不能承诺完美替换,必须提前说明可能出现身份漂移、肢体变形、穿模、遮挡错误、服装闪烁、道具漂移或空间融合不自然。
- 极高难度:参考素材信息严重不足,同时存在多人重叠、快速运动、复杂透明材质、大幅镜头运动或多个替换目标。应明确告知用户:生成结果更适合作为测试版本或创意预览,难以保证完整时段和所有帧都稳定;如果需要商业级或逐帧无瑕效果,可能需要补充多角度素材、拆分镜头、制作遮罩或进行人工后期。
预期结果表达规则
根据难度等级,用清晰的用户语言说明:
- 哪些内容大概率能够保留
- 哪些区域或动作最容易出问题
- 问题可能表现为什么样
- 生成结果适合测试、创意展示还是正式发布
- 是否建议先生成短预览或准备补充素材
不要使用“完美”“完全无瑕”“百分之百稳定”等无法验证的承诺。应使用“预计可以较好保留”“主体替换可行,但某些区域可能出现……”“适合先做测试版本”等准确表述。
高风险任务的自动提示模板
当任务属于高难度或极高难度时,在生成前主动说明:
这次替换在技术上可以尝试,但属于高难度任务。预计原视频的动作、镜头和大体队形可以保留;参考素材与原视频在角度、比例、遮挡或运动方式上的差异,可能导致局部人物身份漂移、肢体或服装形变、边缘闪烁、遮挡穿帮或细节不一致。生成结果更适合作为测试或创意预览,不能保证每一帧都达到无瑕替换效果。
如果问题集中在某个具体区域,必须指出该区域,例如“中央透明容器后的手臂”“画面边缘被截断的舞者”“快速转身时的帽子和流苏”等,而不是只给笼统的“可能有瑕疵”。
风险来源记录
至少记录以下风险来源中的适用项:
- 人数和主体之间的遮挡
- 透明或半透明前景物体
- 参考图角度不足
- 参考图缺少背面或侧面信息
- 新旧主体体型或物种差异
- 快速动作、转身、跳跃或复杂手势
- 主体出画和重新入画
- 复杂服装、流苏、毛发或细小配饰
- 产品文字、Logo 或精细结构
- 镜头推拉、旋转、平移或强烈抖动
- 前景与背景光线、景深或透视不一致
风险评估用于调整提示词、决定是否采用短预览和编写用户预期说明,不得把风险报告写成阻止生成的绝对结论,除非输入缺失或工具无法执行。
STEP 5:绑定参考素材角色
为每个素材明确唯一或主要作用,并在编辑方案中逐一绑定:
- 原视频:动作、镜头、时间结构、空间关系和声音
- 人物图:人物身份、脸部、发型、服装、体型、角色设计和材质
- 背景图或视频:新环境、空间结构、透视和世界设定
- 产品图:产品身份、外形、结构、材质、包装和品牌信息
人物参考不自动改变背景,背景参考不自动改变人物,产品参考不自动改变手部动作。多个主体必须分别说明归属,不能只列文件名。
STEP 6:建立编辑方案与声音策略
编辑方案至少包含:替换目标、新内容、替换范围、固定采用自然适配的执行规则、需要保留的动作、镜头和空间关系、遮挡与接触关系、连续性要求、画幅、时长和声音处理。
声音策略分为:
- 只替换画面:保留原对白、环境声和音乐
- 替换画面但保留对白节奏:保持原台词时间结构,让新主体适配口型
- 替换人物声音:只有用户明确要求时才执行,需要声音参考或确认合成声音
- 静音或只保留环境声:只有用户明确要求时移除对白或音乐
画面人物替换不等于声音替换。用户未要求字幕时,不生成或烧录字幕。
STEP 7:跨物种和非人角色规则
当新主体是动物、玩偶、机器人、卡通角色、怪物或其他非人角色时:
- 新主体的物种特征、脸部结构、口腔结构和身体比例优先于原真人解剖结构
- 保留原视频的说话节奏、情绪和表演含义,但根据新主体结构重定向口型和面部动作
- 猫、狗等动物保持对应的口鼻、牙齿和胡须结构,避免直接复制真人嘴唇、牙齿、舌头和下颌
- 保持耳朵、尾巴、爪子、角、翅膀等轮廓特征在连续帧中的稳定
- 不因原人物有双手、头发或人类服装而抹除新角色的关键身体结构
- 让新角色自然适配原视频的遮挡、拿取、站立和采访动作
STEP 8:生成前确认与预览策略
不因替换类型、替换强度或参考素材等级向用户提供选择。用户已经明确替换目标和参考素材时,直接按照自然适配执行。只有在缺少时长、输入文件、替换对象或其他工具必需信息时才提问。
默认直接生成完整视频。仅当工具限制、素材风险极高或用户明确要求预览时,才采用两阶段策略:
- 短预览:生成约 4–6 秒,检查身份、轮廓、动作适配、遮挡和融合。
- 完整生成:预览通过后生成完整时长,并沿用已确认的参考素材和替换方案。
短预览不是默认步骤,也不需要向用户提供是否预览的选择;符合触发条件时由 Skill 自动采用。
STEP 9:执行 H3 视频替换
使用 H3 的视频编辑或多模态视频能力,以原视频作为动作、镜头和时间结构基础,以替换素材作为对应身份、外观、场景或产品参考。
提示词必须明确:
- 哪些元素被替换,哪些元素保留
- 每个参考素材的角色和对应对象
- 原视频的动作、镜头、构图、时间节奏和空间关系
- 新元素如何匹配原主体的位置、比例、运动、遮挡和接触
- 多镜头中如何保持同一人物、产品或场景身份
- 用户确认的声音处理方式
只补充执行所需的镜头、动作、连续性和声音信息,不新增人物、道具、剧情或用户未要求的风格方向。
STEP 10:结果检查
检查以下项目:
替换准确性
- 目标元素是否完整替换
- 原元素是否在某些帧中恢复
- 新元素是否出现重复、变形、闪烁或身份漂移
- 多个对象是否发生混淆
时间与动作连续性
- 新主体是否在相关帧中保持身份和外观一致
- 镜头切换、出画、入画、转身、快速动作是否稳定
- 动作节奏、口型、眨眼、头部移动和产品运动是否自然
空间融合
- 前景和背景是否自然融合
- 遮挡、接触、透视、比例和景深是否合理
- 手、麦克风、桌面、地面或其他前景物体是否位于正确层级
- 运动模糊、边缘、材质和光照是否连续
音频
- 是否存在重复对白或重复音轨
- 音画是否同步
- 是否保留了用户要求保留的对白、环境声和音乐
- 未请求字幕时,画面是否保持无新增字幕
STEP 11:定向修正与重试
不要重复提交完全相同的生成请求。根据问题定向修正:
- 人物身份漂移:补充更清晰的身份特征、多角度参考或连续性要求
- 跨物种嘴部违和:强化新物种口鼻、牙齿和面部结构,使用自然适配而非真人解剖复制
- 产品变形:补充多角度产品图,强调结构、比例和展示动作
- 背景穿帮:明确前景主体轮廓、遮挡边界、地面关系和背景透视
- 动作不连续:强调原视频运动路径、时间结构和动作承接
- 多对象混淆:拆分参考素材角色并分别绑定目标对象
- 多镜头不一致:按镜头补充角度、比例和身份连续性要求
- 音频重复或异常:明确只保留一个对白轨道,重新确认声音策略
保留用户已经确认的核心目标,每次只修正导致失败的部分。最多进行有限次数的定向重试;重复失败时说明原因并请求最短的必要决策。
STEP 12:最终交付
交付替换后的视频,并简要说明:
- 实际替换的元素
- 保留的原视频内容
- 输出时长和画幅
- 已发现的轻微问题或建议的下一步优化
如果用户提出修改,优先沿用已确认的替换对象、声音策略和参考素材,不重复询问已经确定的内容。
默认规则
- 默认使用 MiniMax H3。
- 用户明确指定其他模型时,先核验其替换、参考、时长与画幅能力,再遵循用户选择;指定模型失败后只做一次针对原因的修正,仍失败则切换其他兼容模型,不与同一模型反复死磕。
- 默认保留原视频动作、镜头、剪辑节奏、画幅、时长和声音。
- 默认不添加字幕。
- 默认一段输入视频对应一条替换后的视频。
- 用户未指定画幅和时长时沿用原视频。
- 跨物种替换默认使用“自然适配”。
- 复杂任务默认建议先做短预览,但用户明确要求直接生成时不强制拦截。
- 所有替换参考素材都必须有清晰角色绑定。
- 参考素材是贡献来源,不应覆盖用户明确要求保留的原视频结构。
Signals
- GitHub stars
- 26
- Last commit
- Sep 2026
Advanced
- Item type
- skill
- Key
video-element-replacement- Source
- github.com/qxryz/workflowgenerator