Vox 风格解释视频制作管线

SkillMedia

Turns a topic, article, or report into a confirmed Vox-style explainer video. First confirms requirements and outputs a plan, script, storyboard, and narration draft, then generates keyframes, collage animations, audio, subtitles, and the final video. Suitable for science explainers and short docume

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the Vox 风格解释视频制作管线 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/vox-style-video-generator/SKILL.md and read by ahel’s review.

从一个主题、文章或报告出发,制作完整的 Vox 风格解释型视频。优化后的流程是 短流程 + 先确认再生成:先确认用户需求,再写出详细制作方案文档;用户确认方案后,生成主视觉图和关键帧;用户确认画风后,再生成动画;最后匹配口播和 BGM,并完成合成。

核心规则:不要在初始需求之后直接进入高成本图片、视频或音频生成。确认需求后的第一个交付物,必须是可供用户审核的制作文档。

用户需求 → 制作方案文档 → 用户确认 → 主视觉 + 关键帧 → 画风确认 → 动画 → 口播 + BGM → 合成 + 质检

STEP 1:确认用户需求

在规划或生成前,先确认会显著影响成片的交付信息:

  • 主题或来源材料:主题、文章、报告、文稿或参考文件。
  • 视频内语言:旁白语言和画面文字语言。
  • 目标时长:时间型媒体必须明确。常用选项:45–60 秒、90 秒、3 分钟。
  • 画幅和平台:16:9 横屏、9:16 竖屏、1:1 方屏。
  • 受众和深度:大众、学生、专业观众、儿童等。
  • 字幕需求:字幕默认不主动添加;只有用户明确要求或确认后才加。
  • 视觉偏好:默认 Vox 风格 editorial collage,并优先吸收参考视频中的 2.5D 混合媒介拼贴动效语言;如果用户指定其他风格,以用户为准。
  • 声音和音乐偏好:如果用户对音色、语气、BGM 情绪有明确要求,需要记录。

如果用户没有说明时长或画幅,先用简短问题确认,再进入制作方案。若信息已经足够,则直接制作方案文档。

STEP 2:生成制作方案文档

确认需求后,创建一份详细制作文档并放到画布上。这份文档是所有高成本媒体生成前的审核关口。

文档必须包含:

  1. 制作简报

    • 工作标题
    • 选题角度和核心问题
    • 目标受众
    • 时长、画幅、视频语言、字幕选择
    • 视觉风格方向、强调色和参考动效语言
    • 音频方向:口播语气、BGM 情绪
  2. 叙事结构

    • 冷开场 hook
    • 背景转入
    • 解释性 beat
    • 复杂化、矛盾或转折
    • 结尾重构观点
  3. 完整脚本 / 旁白逐字稿

    • 使用用户确认的视频内语言写出完整旁白。
    • 历史叙述可优先使用现在时。
    • 多用具体事实、短句、明确判断,每个 beat 只讲一个想法。
    • 避免“本视频将介绍……”这类寒暄式开头。
    • 总字数要匹配目标时长。
  4. 分镜和镜头规划

    • 每个 beat 单独列出。
    • 每个 beat 包含:编号、预计时长、旁白摘录、画面描述、画面文字、动效想法、转场说明。
    • 画面大字要短且有信息价值,通常控制在 5 个词以内;文字量保持适中,只负责定位概念,不替代口播讲解。
  5. 关键帧规划

    • 主视觉 / 风格锚图描述。
    • 参考风格设计规则:2.5D 分层拼贴、纸张边缘、信息标签框、编辑式几何元素、克制的定格剪纸动效。
    • 关键帧清单:构图、主体、背景、排版要求。
    • 风格一致性规则:配色、纸张质感、白边、字体、边框和留白。
  6. 动画规划

    • 动作保持克制:二维推近 / 拉远、纸片视差、路线绘制、图标滑动、半调网点闪动、云烟或水面缓慢漂移。
    • 明确避免三维旋转、镜头晃动、人脸变形、文字扭曲、画风漂移和过度实拍化运动。
  7. 音频与合成规划

    • 在动画画风确认后,再生成一条连续完整口播,不要把分段旁白当主时钟。
    • 根据视觉节奏生成一条纯器乐 BGM。
    • 最终剪辑按真实口播时间匹配画面,不优先拉伸旁白。
    • 如果字幕已确认,则根据最终口播时间生成并烧录字幕。

文档结尾必须明确请求用户确认:请用户批准制作方案,或提出修改意见。用户确认前,不生成主视觉、关键帧、动画、口播或音乐。

STEP 3:制作方案确认关口

等待用户明确确认制作方案。普通聊天确认和画布 / 看板确认都有效。

如果用户提出修改:

  • 先修改制作文档。
  • 下游媒体资产保持未生成状态。
  • 如果修改影响脚本、分镜、视觉方向、时长、画幅、语言或音频方案,需要再次等待确认。

只有方案确认后,才进入视觉生成。

STEP 4:生成主视觉图和关键帧

方案确认后,先生成 主视觉图 / 风格锚图,再生成其余关键帧。

主视觉要求:

  • 代表影片 hook,同时定义整条片子的视觉系统。
  • 除非方案另有说明,默认使用 Vox 式 mixed-media editorial collage。
  • 锁定有限配色、纸张纹理、白色贴纸边、半调网点、编辑式字体、充足留白和一个强调色。
  • 明确强化 Vox 拼贴工艺:重要主体和道具应像按轮廓裁剪出来的独立纸片,带撕纸边、手工不规则边缘、贴纸白边、纸纤维、胶带、折角和分层阴影;避免物品只是平铺印在矩形纸片上。
  • 使用确认过的画幅。

默认优先吸收的参考视频视觉规则:

  • 画面搭建为 2.5D 分层混合媒介拼贴:前景放核心主体,中景放地标 / 道具 / 辅助人物,背景使用抽象纸张纹理或图形底纹。
  • 将历史感或档案感剪贴元素与现代编辑式几何图形、印章、撕纸、地图碎片、图表、圆点、箭头和标签卡片并置。
  • 重要主体要有清晰纸张边缘、贴纸白边、撕纸边、按轮廓裁剪的剪影或折页卡片载体,让画面像手工拼贴,而不是实拍素材。
  • 在拼贴风格内保留主体可读细节:除非方案明确要求剪影,不要把人物做成只有黑块、看不清衣领、手部或面部线条的形态。
  • 关键术语使用 有载体的信息框,例如牌匾、卷轴卡、贴纸标签、地图钉、标题面板;避免文字直接悬浮在复杂背景上。
  • 视觉层级服务解释:旁白提到某个概念时,对应元素应通过弹出、缩放、滑入、高亮、箭头或标签获得视觉焦点。

关键帧要求:

  • 除非方案另有拓扑要求,通常每个 storyboard beat 一张关键帧。
  • 所有帧保持主视觉锚图的风格。
  • 画面文字短、稳定且适中:要有足够标签帮助观众定位,但不要堆满解释段落;解释性内容优先放入口播。
  • 尽量批量生成关键帧,同时保留分镜顺序。

主视觉和关键帧生成后,把它们整理到画布分组,并请求用户确认画风。此时不要生成动画。

STEP 5:画风确认关口

等待用户明确确认主视觉和关键帧画风。

如果用户不满意画风:

  • 先重生成主视觉 / 风格锚图。
  • 再用新的锚图重生成受影响关键帧。
  • 用户确认画风和关键帧前,不进入动画。

如果用户只要求修改某一帧,则只重生成该帧,同时保持已确认的锚图风格。

STEP 6:生成静音动画

画风确认后,把已确认关键帧生成静音动画片段。

默认视频模型策略:

  • Vox 风格关键帧转动画片段默认使用 MiniMax-H3。如果用户明确选择其他模型,先检查其能力,兼容时遵循用户选择。
  • 如果生成失败,先根据失败原因修复并重试一次;仍失败时切换其他兼容模型,不反复死磕同一个模型。
  • 此阶段动画片段默认保持静音;口播和 BGM 在最终合成阶段再加入。

动画指导:

  • 动作要像 motion graphics,不像电影实拍:要比静态图更丰富,但不能乱。
  • 适合的动作:可见的背景纸层视差、相关时的雾气或纸条漂移、路线绘制、证物卡或图标滑入并停稳、半调纹理闪动、每帧一到三个受控动态细节。
  • 纸艺拼贴关键帧转动画时,优先使用 自然搭建逻辑:先出现背景底板,再让纸屑、地图、报纸、证物卡、道具、铜钉、红线、最后的信息标签框依次滑入或被摆放到画面中,像手工证据板正在被搭建。设计动效时要先问:画面上的每个可见元素如何来到这里、如何被钉住、如何被红线连接、如何最终停稳。
  • 使用 分层阶梯式入场,而不是无动机的画面热闹:先背景,再装饰几何元素,再中景地标,再主体,最后信息标签框。元素可以滑入、轻压贴合、被铜钉固定、被红线连接并 settle down;避免突然翻页 / 翻起、灯光式闪烁、魔法弹出、夸张弹跳,或与画面可见元素无关的随机运动。
  • 保持人物和道具纸片的物理一致性:手、肢体、工具和手持物应随同一个纸片身体一起运动,除非分镜明确要求拆分傀儡部件;避免手先出现、道具漂浮、肢体分离、突然上升或结尾无动机跳动。
  • 谨慎使用 剪纸傀儡动画:人物、动物、车辆只做低帧率旋转或位移,例如手臂单轴转动、轻微点头、骆驼或马腿机械式小幅移动,不做完整骨骼动画。
  • 可加入少量环境粒子和编辑装饰:漂浮纸屑、旋转几何块、地图钉、印章痕迹、圆点、图表箭头。
  • 合成转场优先使用参考风格:纸张 wipe、撕纸边缘遮罩、卡片滑过、印章覆盖揭示、推进到某个细节后进入下一场景。
  • 每条动画提示都必须保留已确认关键帧的平面拼贴设计和 2.5D 分层结构。
  • 禁止:镜头晃动、三维旋转、人脸变形、文字扭曲、画风漂移、失控缩放、实拍化运动、新增未规划主体。

先生成全部动画片段,再进入音频。检查画风漂移或文字扭曲;只重试失败或不可接受的片段。

STEP 7:匹配口播和 BGM

只有在静音动画生成后,才生成最终音频。

口播:

  • 尽可能使用确认过的完整旁白逐字稿,生成一条连续口播。
  • 整条片子使用一个稳定声音。如果必须分段重生成旁白,也要用已确认的完整旁白或音色参考作为锚点保持同一音色;不要混用不同音色的分段旁白。
  • Vox 口播语气:克制、温暖、清晰、有好奇心,避免预告片腔。
  • 检查真实时长。若明显偏离目标时长,先压缩或扩写逐字稿,再重新生成一次完整口播;优先改写文案,不要用极端视频慢放或长时间静止画面硬凑时长。

BGM:

  • 为整条片子生成一条纯器乐音乐床。
  • 音乐应低于旁白,纪录片感、克制,并与主题相符。
  • 避免人声和突兀 drop,不要抢解释内容。

时间匹配:

  • 转写或对齐最终口播,获得句子或从句时间点。
  • 最终合成前建立 beat-to-clip 时间映射:每段动画必须对应匹配的旁白句子和字幕 cue;字幕只应出现在解释该画面主题的段落内。
  • 以口播时间为主时钟,同时尊重已确认的镜头边界。如果某段口播长于该段动画,先改写压缩该段口播,再考虑轻微变速、修剪、延长或短暂停帧。
  • 交付前必须单独检查最后一条字幕,确保最终句在视频结束前可见。

STEP 8:最终合成和质检

最终合成:

  1. 拼接规整后的动画片段。
  2. 添加连续口播音轨。
  3. 把 BGM 混在旁白下方。
  4. 如已确认字幕,则添加字幕。
  5. 按确认画幅编码最终视频。

交付前质检:

  • 口播和字幕同步。
  • 每条字幕 cue 和旁白句子都对应正确动画段落;镜头切换不切断重要单词或短语。
  • BGM 不压过口播。
  • 动画片段没有明显文字扭曲、形变或画风漂移。
  • 动效符合确认过的参考风格语法:自然纸艺拼贴搭建、可见背景视差、纸张转场、信息标签框、红线 / 图标绘制、证物卡被摆放和钉住的运动,以及克制且连贯的剪纸傀儡动画。
  • 最终成片符合已确认的制作方案和关键帧。

交付最终视频到画布,并在回复中用准确文件名引用最终成片。

References

  • references/vox-style-guide.md — 写作语气、视觉语法、关键帧提示结构、动效风格、字幕样式。
  • references/ffmpeg-assembly.md — 合成、字幕烧录、混音和编码配方。

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
vox-style-video-generator
Source
github.com/qxryz/workflowgenerator