白板火柴人拆书视频工作流

SkillMedia

Whiteboard stick-figure book-breakdown short-video workflow. Used to turn a book or a long piece of content into a 60-90 second vertical (9:16) whiteboard hand-drawn infographic-style narrated book-breakdown short video, and render the final video locally without platform watermarks using HyperFrame

Available today. Use it from your connected AI after setup.

Connect ahel once, and every AI you use reads what you have installed.

Then ask your AI: use the 白板火柴人拆书视频工作流 skill

What this skill tells your AI

The instructions your AI receives, as published by nutllwhy/whiteboard-book-video-skill in SKILL.md and read by ahel’s review.

把一本书做成 60-90 秒竖屏白板手绘口播短视频。全流程分 6 个阶段,每个阶段产出后都要先向用户确认再进入下一阶段。最终成片用 HyperFrames 本地渲染,不用云端视频生成模型(本地渲染环节无平台水印,不消耗云端视频生成额度)。

总流程(每阶段产出 → 用户确认 → 下一步)

  1. 选节奏模式(开跑前先问):问用户要「慢版」还是「高密版」(见下方"节奏模式")。两种模式各有对应脚本/图片/渲染参数,用户也可自定义画面数。
  2. 调研与脚本:读懂书的核心内容 → 产出「调研报告 + 拍摄脚本」(含按所选模式生成的分镜表 + 口播逐字稿 + 每镜头生图提示词)。→ 用户确认脚本
  3. 分镜图:按白板火柴人信息图规范,根据所选节奏模式生成对应数量的竖屏图。→ 用户确认风格/图(含人设或火柴人讲师选择)
  4. 口播配音:按脚本逐字稿生成配音,先问用户要男声还是女声。→ 用户试听确认
  5. 背景音乐:生成 BGM,先问用户要活泼还是沉稳(或其他风格)。→ 用户确认
  6. 渲染装配:HyperFrames 逐步画出动效 + 词级字幕卡点 + BGM 侧链混音 → 无水印成片。
  7. 交付:拷贝到项目根目录,present_files 交付,留系列化建议。

节奏模式(用户在开跑前二选一,可自定义)

模式画面数每画面时长口播字数适合
慢版约 6-8 画面6-9s约 320-380 字讲书逻辑/深度解读,节奏从容
高密版约 16-20 画面4-5s约 280-340 字信息密度高、快节奏、防单调,适合短视频完播
  • 两种模式都用同一套白板信息图风格与"逐步画出"动效,差异只在画面切分粒度与口播断句。
  • 用户未表态时默认问一次;用户自定义画面数时按其要求生成。
  • 渲染阶段:慢版直接每画面一镜;高密版可把相邻画面合并成"多小节一镜"(每镜内依次 reveal),减少渲染镜头数,具体见 references/render-and-assemble.md

关键默认(可被用户覆盖)

  • 画幅:竖屏 9:16,1080×1920;单张分镜图 1152×2048(9:16)。
  • 时长:60-90 秒;镜头硬切 + 每镜"逐步画出"揭示动效(约 1.9s)。
  • 配音时长 = 视频总时长(视频按配音长度铺)。
  • 字幕:词级卡点(用 faster-whisper ASR 词级时间戳),白板便签风样式(白底黑边圆角、黑字、红高亮),高密版字幕更多更短、慢版字幕更少更长。
  • 画面角色:默认角落简笔画火柴人讲师;若用户提供个人 IP 形象(AI 生成卡通头像),先征询是沿用 IP 当主角还是用火柴人。

阶段细则(按需读取 references)

阶段读哪个 reference要点
脚本references/script-writing.md钩子→痛点→核心观点→案例→行动→收尾;7 镜头分镜表+逐字稿
分镜图references/image-prompt.md白板/网格底、马克笔线条、红蓝黑三色、角落火柴人、30%+ 留白、单图高密度
配音references/audio-voice.mdseed-audio T2A;男/女声模板;下载核验真实时长;ASR 词级字幕
音乐references/audio-music.md活泼/沉稳/其他风格模板;ffmpeg 循环拼接;侧链 ducking 混音命令
渲染装配references/render-and-assemble.mdHyperFrames lint/check/render、逐步画出动效、抽帧验证、混音交付

必须遵守的纪律

  • 每个阶段结束必须停下来等用户确认,不擅自连续跑完。
  • 配音和 BGM 的音色/风格是用户点名的选择项,必须先问再生成。
  • 生成图片若要做系列延展(保持白板背景/字体/配色一致),用 image_edit 并传已确认的核心图 URL,不靠文字重画。
  • 涉及书的价格、评分、销量、豆瓣数据等外部事实,必须来自检索结果并标注来源,不编造。
  • 成片交付前必须抽帧验证真实渲染画面(逐步画出、字幕位置、无重叠),不只看静态预览。

Signals

GitHub stars
59
Forks
12
Last commit
Sep 2026
Advanced
Catalog kind
skill
Gateway key
whiteboard-book-video-skill
Source
github.com/nutllwhy/whiteboard-book-video-skill