音乐美学MV

SkillMedia

Creates stylized music videos or mood shorts with lyric overlays based on the music, lyrics, reference images, characters, mood, and release platform. It first analyzes beat and vocal timing, distinguishes character, scene, and text references, designs spatial subtitles that shift with the rhythm, t

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 音乐美学MV skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/music-video-subtitle-generator/SKILL.md and read by ahel’s review.

用途

当用户需要创建、修改、审查或生成音乐视频提示词、情绪短片提示词时使用本 Skill,尤其是音乐、歌词、贴字、参考图、节奏、人物表演和镜头语言需要统一设计的任务。工作流会确认关键创意决策,把锁定 prompt 保存为可审阅的文本资产,并按照批准方案逐阶段产出媒体资产。

不要用于普通字幕烧录、普通视频剪辑、非音乐类产品广告,或没有 MV 结构需求的单张图片 / 单段视频简单任务。

Design 兼容规则

  • 将具体调用方式和传输细节留在工作流之外。
  • 锁定 prompt 和修订版本必须写入 Design 画布文本节点。
  • 将角色卡、场景卡、文字卡、视频片段、BGM 和最终合成拆成输入输出清晰的独立阶段。
  • 不硬编码输出路径,始终使用工具返回的 Design 文件路径。
  • 用户说“跳过确认 / 直接做”时,只对本次运行生效,除非外层编排器已将其作为当前会话授权处理。
  • 如果用户只要 prompt,交付 prompt 后停止;如果用户要完整 MV,在确认后继续生成和合成。
  • 视频生成默认推荐 H3。只有用户明确指定其他模型、H3 不可用或硬性能力无法满足时才切换。

核心原则

  1. 先理解作品,再选择结构。模板是组织工具,不是必须填满的表格。
  2. 使用用户最新确认的创意意图。
  3. 无关字段直接省略,不填空占位。
  4. 不因为预设里有表演、文字、转场、运镜或角色行为,就机械添加到不适合的作品里。
  5. 屏幕文字是设计图层,不是普通字幕;除非用户明确要求普通字幕。
  6. 如果用户上传真实歌曲或 beat,它就是主音乐床,除非用户要求替换。
  7. 多镜头自然衔接原则(针对 >15s 视频):当视频时长超过模型单次生成上限(如 15 秒)时,必须采用“多镜头分镜拆解 + 首尾帧接续 + 鼓点硬切 + 全局主音轨对齐”的标准拼接工作流。所有分段镜头必须保持同一音乐 Groove、速度感、画幅、角色逻辑、视觉预设、光影美学和文字运动规则,确保人声、音乐、节奏、画风与场景自然无缝过渡。
  8. 当用户要完整音乐美学 MV 但没有提供歌词时,先生成并锁定原创歌词。最终 MV 必须同时参考人物卡、文字包装卡和场景卡生成。文字包装卡只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。

STEP 1:前期锁定

写最终生产 prompt 前,先确认最小基础。用简洁选项给出推荐。

1.1 视频格式

提供固定选项:

使用场景画幅分辨率
TikTok / Reels / Shorts 竖屏9:161080×1920
YouTube / B站 横屏16:91920×1080
信息流方图 / Feed1:11080×1080
投流竖屏高密度9:16720×1280
电影感宽银幕 MV21:92560×1080

所选比例必须贯穿角色卡、场景卡、文字参考、shot prompt、视频片段和最终合成。

1.2 目标时长与多镜头拆解架构

写 prompt 或生成视频前,必须先确认目标 MV 时长。即使用户没有上传音乐或歌词,也不能静默使用模型默认时长来替代用户意图。

提供简洁时长选项卡:

  1. 10 秒测试版:单镜头/双镜头,最快验证人物、场景、文字和音频风格。
  2. 15 秒 hook 版:2~4 个短镜头组,更完整的副歌 / hook / performance 短句。
  3. 30 秒及以上完整 MV 版(多镜头拼接合成):由于模型存在 15 秒单次生成上限,系统将自动采用 “多分镜(Multi-Shot)拼接工作流”。先生成或锁定一首完整连续歌曲 / BGM,将 30 秒拆解为 48 个 25 秒的动态分镜头,通过卡拍(Beat-Sync)与首尾帧/场景连续性控制,拼接合成为无缝 MV。
  4. 自定义时长:用户输入目标时长;根据所选视频模型的单次生成上限(如 15 秒)规划多镜头分镜数量与拼接方案。

如果用户提供了上传音乐,确认的目标时长就是需要锁定的音乐窗口长度。

1.3 音乐窗口

如果上传或指定的音乐长于已确认目标时长,必须先锁定片段再写 prompt。

提供三种模式:

  1. 推荐窗口:assistant 判断最强副歌 / hook / 情绪转折,并请求确认。
  2. 用户时间戳:用户给出开始和结束秒数;检查时间落在音频内。
  3. 多变体:只用于投流钩子测试或多创意方向。

如果音乐短于目标时长,使用完整音频。除非用户明确要求,不拉伸、不补长。

1.3.0 歌词锁定与歌词先行补全

写最终视频 prompt 或生成视频前,必须先确定歌词归属:

  1. 如果用户提供了歌词,这份歌词就是锁定歌词。除非用户明确要求改词,否则不得再生成、添加、改写、扩写、翻译、转述或替换成其他歌词。
  2. 如果用户想要完整音乐美学 MV 但没有提供歌词,才生成与所选音乐风格、vocal 模式、目标时长、情绪温度和视觉预设匹配的短篇原创歌词,并将其锁定。
  3. 锁定歌词是人物说唱 / 演唱表演和可见文字包装内容的唯一源文本。
  4. 从锁定歌词拆出每个分镜头的 Rap line:、Vocal line:、Soft vocal line: 或 Spoken line:。
  5. 每个 Typography: 字段也必须来自同一份锁定歌词。有人声表演时,文字必须逐字匹配正在表演的词。
  6. 在最终贴字 MV 中,人物必须根据锁定歌词说唱 / 演唱:可见嘴型、下颌动作、呼吸、面部重音、点头和手势重音都应跟随歌词 phrasing 和 rhythm。

1.3.1 大于 15 秒视频的多镜头拼接默认流程

对于 >15 秒的 MV(如 30 秒),必须以“全局多镜头分镜 Prompt 脚本”作为权威生成来源:

  1. 锁定完整 Master 音频:先锁定一首完整连续的歌曲/BGM轨(包含完整的 Vocal 与 Groove),作为整个拼接流程的唯一音频基准。
  2. 构建多分镜时间轴(Shotlist Timeline):将 30 秒拆解为 48 个短镜头(每个镜头 25 秒),精确映射到歌词时间戳与鼓点(Snare/808/Drop)上。
  3. 首尾帧与场景接续控制:
    • 若镜头 A 与镜头 B 为同一场景的长镜头延续:将镜头 A 的最后一帧(Tail Frame)作为镜头 B 的起始首帧(Head Frame)输入模型生成。
    • 若镜头 A 与镜头 B 为硬切换景:保持相同的人物卡/服装/光影美学 Prompt,并使用同向运镜或视觉元素匹配切(Match Cut)。
  4. 生成与剪辑组装:按 Shotlist 生成各短片段,再在全局 Master 音轨上根据拍子(Beat Grid)进行裁切、调速(Speed Ramping)与拼接,确保人声口型、鼓点卡拍与画面过渡自然。

STEP 2:Creative Contract

最终 prompt 前先建立简洁创意合约:

  • 音乐类型、器乐、速度感(BPM)、vocal 模式、情绪温度。
  • 歌词来源(锁定歌词)。
  • 目标时长与多镜头拆解结构(例如:30s 拆分为 6 个 Short Shots)。
  • 参考图角色分工:人物卡、场景卡、文字包装卡。
  • 运镜、景别、对焦、剪辑卡拍密度与转场衔接逻辑。
  • 明确排除项(如:严禁淡入淡出、严禁油亮 AI 美颜脸、严禁单镜头硬撑导致变形)。

STEP 3:参考图分工与场景采样

每张参考图只分配一个窄任务:

  • 文字参考卡:只控制文字包装样式、字体质感、图形设计、排版比例和动效语言。严禁出现人物或场景。
  • 人物参考卡:只控制人物形象、脸部气质、发型、服装轮廓、角色比例、姿态和整体气场。
  • 场景参考卡:只控制场景视觉风格、空间氛围、影像质感、背景层次和光影气质。

3.1 近景场景切换与多镜头采样规则

对于 Trap、Dark-pop、Cyber-grunge 等快节奏 MV,全片应在多个近景场景之间快速切换:

  • 场景气质保持统一,但每个镜头的空间必须明显不同(局部背景、隧道、墙面、灯带、反光地面)。
  • 场景切换必须由明确音乐冲击触发:bass hit、808 drop、snare、vocal 重音或文字砸屏。
  • 镜头切换是 trap beat 上的“视觉采样”:硬切、跳切、扫描 glitch 硬切、闪切、动作匹配切。

STEP 4:预设语法(以 Dark-pop / Cyber-grunge & Trap 为例)

视觉与剪辑语言

  • 写实高时装质感、胶片杂志质感(90年代末-00年代初独立杂志/复印纸/胶片扫描/zine拼贴)。
  • 粗颗粒、轻微胶片抖动、半色调网点、印刷毛边、扫描错位。
  • 剪辑绝对只使用硬切(Hard Cut),严禁淡入淡出、溶解或柔和转场。
  • 画面与文字强响应鼓点:hi-hat roll(微震/跳帧)、snare(放大/硬切/肩膀下压)、808 bass hit(低频压屏/拉伸/错位)。

文字包装规则

  • 文字是空间中的动态图形主体(不是普通字幕条),可以处于前景、中景、背景或被人物肩膀/手部遮挡。
  • 文字绝不遮挡眼睛或主要面部表情;对嘴时避免遮挡嘴部。
  • 有人声时,显示文字必须逐字匹配正在表演的歌词。每个镜头只出现一个主文字事件。

STEP 5:Prompt 结构模板

多镜头分镜脚本必须按镜头(Shot)进行模块化输出,每个 Shot 标注准确的时长与音频映射:

[Global Aesthetic & Character Lock]: (全局人物与美学锚点 Prompt)

Shot 1 (0.0s - 3.5s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: Bass-hit 上硬切至 Shot 2 / 同向甩镜

Shot 2 (3.5s - 7.0s)
Vocal Line: "..."
Typography: "..."
Visual & Action: ...
Camera & Motion: ...
Transition Out: ...

STEP 6:BGM 连续性与多镜头自然衔接系统

6.1 音频全局连续性

全片必须强绑定同一轨 Master Audio(完整歌曲/Beat)。在分段生成视频时,严禁使用独立、断裂的片段音轨。所有视频片段在剪辑合成阶段均对齐至 Master Audio 的对应时间戳(Timeline)。

6.2 多镜头自然衔接系统(Natural Stitching Protocol)

为保证 >15 秒视频拼接后的极其自然,必须在 Prompt 规划与后期合成中严格执行以下“五大衔接锁”:

人声与口型衔接锁(Vocal & Lip Continuity): 分镜切替点(Cut Point)必须落在歌词的句间停顿(Pause/Breath)或强鼓点(Snare/Drop)上。严禁在人物发出某个元音或唱词中途进行硬切,除非后一个镜头是极近特写且口型完全接续。

音乐与节奏衔接锁(Rhythm & Beat Matching): 剪辑点必须精准裁切在音乐的 1/4 或 1/8 拍(Beat Grid)上。利用画面动作的“加速/减速(Speed Ramping)”微调,使视频中人物的头点拍、手势或眨眼精准踩在鼓点上。

画面美学与色彩衔接锁(Aesthetic & Color Grading): 跨镜头生成必须携带相同的 Aesthetic Header Prompt(相同的胶片颗粒度、色调 LUT、光影方向)。最终合成时,全局叠加一层 35mm Film Grain Overlay 和统一调色 LUT,掩盖跨批次生成的微小色差。

空间与转场衔接锁(Transition & Motion Continuity): 长镜头延伸:使用上一镜头的末帧(Tail Frame)作为下一镜头的首帧(Head Frame)输入,Prompt 加上 continuation of action。镜头切换:采用动能延续转场(如 Shot 1 结尾向右快速 Pan,Shot 2 开头从左向右 Pan 入;或利用人物手势遮挡镜头完成 Match Cut)。

文字动态衔接锁(Typography Motion Stitching): 跨镜头的文字动效,前一镜头的文字在切替瞬间跟随 Bass Hit 执行“破碎/扫出/砸屏”,下一镜头的文字在重音上“砸入/展开”,形成视觉动能的连贯传递。

STEP 7:审查清单(Checklist)

交付前静默检查:

  • 目标时长超过 15 秒时,是否已自动采用多镜头(Multi-Shot)拆解结构?
  • 是否已锁定唯一的全局 Master Audio,且分镜切替点对齐到了音乐拍子上?
  • 镜头切替是否避开了人声唱词中途,口型与呼吸是否自然?
  • 相邻镜头之间是否有明确的转场衔接机制(首尾帧接续 / 同向运镜 / Match Cut / 鼓点硬切)?
  • 剪辑风格是否严格保持“纯硬切”,绝无淡入淡出或柔和转场?
  • 三张参考卡(人物/场景/文字)是否角色隔离,且未互相污染?
  • 文字包装是否作为空间图层,且绝未遮挡眼睛和主要面部表情?
  • 全局画质、颗粒感、色彩与光影是否保持高度一致?

STEP 8:画布交付

完整 MV Prompt 脚本锁定后,必须写入专用画布文本节点,命名为 Complete MV Prompt 或 完整MV Prompt。节点内容必须是完整的多分镜 Prompt 脚本与衔接说明,后续修改时更新该节点。

STEP 9:最终 MV 生成与合成流程

  1. Prompt 锁死与画布写入:确认完整的多镜头 Prompt 脚本(包含时间戳、歌词映射、转场逻辑)已写入画布。
  2. 分镜素材并行生成:根据 Shotlist 逐个生成 2~5 秒的短片段。需要长镜头接续的片段,提取上一片段末帧作为首帧图生视频(I2V)。
  3. 多轨剪辑与自然缝合(Editing & Stitching):导入全局 Master Audio 轨,将生成的各 Shot 视频按时间戳对齐上轨,在鼓点(Beat Grid)上进行精细剪辑与速度曲线微调(Speed Ramping),确保人声口型与画面动作卡拍。检查镜头接缝处,应用同向运镜或闪切遮瑕。
  4. 全局调色与质感统一(Finishing):全局叠加统一的 Movie LUT 与 35mm 胶片颗粒 Overlay,消除 AI 塑料感并锁定画风一致性。
  5. 输出交付:输出无缝衔接的完整 MV 视频文件。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
music-video-subtitle-generator
Source
github.com/qxryz/workflowgenerator