沉浸式第一视角短片

SkillDev tools

Turns ideas, scripts, reference images, or existing footage into immersive short films shot in strict first-person POV. First locks in the protagonist's eye-level perspective and visual rules, then completes asset planning, storyboarding, camera prompts, quality checks, and assembly suggestions. Sui

Available today. Use it from your connected AI after setup.

Add ahel to your AI once: Claude, ChatGPT, Cursor, Claude Code or Codex. Then ask it to use this.

Then ask your AI: use the 沉浸式第一视角短片 skill

What this skill tells your AI

The instructions your AI receives, as published by qxryz/workflowgenerator in skills/library/pov-short-film-generator/SKILL.md and read by ahel’s review.

本 Skill 用于把用户的一句话创意、短剧梗概、剧本片段、参考图或片段,转化为严格第一人称 POV 的沉浸式短片生产方案。核心目标是:全片像主角亲眼所见,避免任何第三人称穿帮,并通过可落地的视觉风格引擎保持画面统一。

使用边界

适合:

  • 第一人称 POV 短剧、沉浸式悬疑、逃生、恋爱、复仇、探险、惊悚、职场压迫、现实生活片段。
  • 用户明确要求“第一视角”“主观镜头”“像我亲眼看到”“手持沉浸感”“POV 短片”。
  • 需要从剧本或概念拆成规格书、分镜、图像提示词、视频提示词和 QC 清单。

不适合:

  • 普通第三人称剧情短片、多机位人物表演、群像戏、正反打对话戏。
  • 以展示产品为主、没有主观视角叙事的广告或开箱。
  • 需要长期连续剧统筹的完整剧集。本 Skill 只负责短片、开篇或紧凑 POV 段落。

全局硬锁规则

  1. 全片严格第一视角:first-person POV from protagonist; camera is his/her eyes; no external shot of protagonist.
  2. 主角面部零曝光:不得生成主角正脸、半身外部镜头、背影跟拍或第三人称表演镜头。
  3. 主角可见范围仅限:手、鞋、衣袖、胸前物件边缘、身体局部倒影、屏幕反光、呼吸雾气或手持物。
  4. 任何分镜必须回答:这一镜头是否可能由主角眼睛看到?如果不能,必须改写。
  5. 不生成字幕、标题卡、画面文字叠层或卖点卡片。需要台词或旁白时只作为声音内容规划。

STEP 1: 接收输入并提炼 POV 核心

从用户输入中提取:

  • 主角身份:谁的眼睛在看。
  • 当前处境:主角正在经历什么危险、欲望、秘密、压力或冲突。
  • 关键外部对象:对手、恋人、怪物、物品、门、手机、车窗、镜子、桌面、走廊等。
  • 主角可见局部:手、袖口、鞋尖、呼吸雾气、手持物、手机边缘、伤口、工牌、工具。
  • 禁止出现的第三人称内容:主角正脸、主角远景、主角背影、外部跟拍。

若用户只给一句概念,自动补齐一个短片钩子:

  • 3 秒内出现强冲突或异常物。
  • 10 秒内出现主角必须反应的压迫动作。
  • 结尾保留一个可继续发展的悬念或情绪余味。

STEP 2: 视觉风格引擎

在生成规格书前,必须确定视觉风格。若用户已给风格,直接进入自定义输入解构;若用户没有给风格,根据语境提供或选择以下风格之一。

A. 现实生活纪实(默认)

  • 画面调性:真实县城乡村、城中村、职场、出租屋、日常空间,自然光或实用光,低饱和。
  • 物理映射:现实纪实、实用光源、低饱和、手持手机压缩噪点、磨损布料、真实生活杂物。
  • 适用:现实题材、都市悬疑、市井日常、职场压迫、生活困境。

B. 赛博迷幻雨夜霓虹

  • 画面调性:冷暖对比、高反差、水面反光、湿冷空气。
  • 物理映射:湿路面、霓虹反光、高反差色差、冷青色阴影、暖琥珀高光。
  • 适用:科幻、暗夜追逐、迷幻梦境、都市黑色气质。

C. Y2K / 旧家用录像复古

  • 画面调性:低像素、CCD 噪点、偏色、怀旧暖雾。
  • 物理映射:旧家用 DV 质感、轻微偏色、CCD 传感器噪点、暖雾光、边缘轻微糊。
  • 适用:青春回忆、旧物回溯、DV 感叙事、90 年代/00 年代记忆。

D. 工业冷冽

  • 画面调性:重工业灰冷、金属、低饱和、冷雾。
  • 物理映射:钢灰色调、工业金属材质、低对比雾气、冷荧光灯、粗粝混凝土氛围。
  • 适用:悬疑、犯罪调查、末世、工厂、制度压迫。

E. 电影级 ARRI 质感

  • 画面调性:高宽容度、柔和漫反射、高级暗部、有机暖光。
  • 物理映射:柔和自然漫射光、电影动态范围、丰富暗部细节、高级有机纹理。
  • 适用:情感大片、高品质短剧片头、现实但更精致的短片。

F. 自定义输入

若用户输入抽象风格,如“王家卫式的孤独霓虹”“落日余晖下的温柔”“像坏掉的监控录像”,必须翻译成可执行的物理视觉锚点:

  • 光源方向、色温、曝光倾向、快门或运动特征
  • 饱和度与对比度、介质纹理或传感器噪点、空气感、场景证据

禁止在提示词里只堆抽象艺术词。例如:

  • “悲凉” → 空旷构图、冷色散射光、手部微微颤抖、雨水打在窗户上。
  • “旧回忆” → CCD 噪点、轻微偏色、边缘柔糊、褪色生活物件。
  • “职场压迫” → 冷白荧光灯、低饱和玻璃隔断、键盘声、低头视线、手握工牌。

STEP 3: 生成 Final_Video_Spec

进入分镜和图片生成前,先产出规格书。规格书必须包含:

# Final_Video_Spec

标题:
类型:第一视角现实主义短片
画面比例:16:9 / 9:16 / 用户指定
目标时长:
视觉风格定义:
风格映射参数:
  - 光照/色温:
  - 介质纹理:
  - 饱和度与对比度:
  - 空气感/环境质感:
核心规则:严格第一视角 POV,禁止第三人称镜头;主角正脸零曝光
主角可见局部:
关键外部对象:
图片模型:用户指定或由代理选择 Hub 兼容图像生成能力
视频模型:用户指定或由代理选择 Hub 兼容视频生成能力
声音策略:环境声、动作声、呼吸声、台词或旁白的唯一 owner 规划

若用户已经授权“你看着办”,可直接采用合理默认,不再等待确认。

确认 / 修改问题卡片 Gate

为了减少用户反复输入“下一步”“继续”的繁杂操作,每个关键阶段交付后,不要只用开放式文字询问“是否继续”。应弹出一个紧凑的确认 / 修改问题卡片,提供清晰选项:

  • 确认并进入下一步(推荐):用户选择后,立即执行下一生产步骤。
  • 修改当前结果:询问用户要修改哪一部分,只改当前阶段的对应内容,再继续。
  • 暂停 / 导出当前结果:停止推进,保留当前文档或资产,方便用户稍后继续。

建议在以下关键节点使用该卡片:

  1. Final_Video_Spec 与分镜方案交付后。
  2. 关键首帧图生成后。
  3. 视频 Clip 生成后。
  4. 最终合并 / 导出成片前。

当用户选择 确认并进入下一步 时,视为该 Gate 已确认,必须立即推进下一步,不要再重复确认。当用户选择 修改当前结果 时,后续问题要聚焦具体可改项,例如风格、时长、镜头顺序、台词、首帧构图或某条 Clip 重生成。如果用户已经明确输入“继续”“下一步”“go on”等同义指令,则跳过卡片,直接进入下一步。

STEP 4: 锁定参考图职责

如果用户提供参考图,必须先分配职责,避免风格污染:

  • R 图:风格与构图锚点。继承画面风格、构图、光影气质;不继承特定主体人脸。
  • C 图:角色入画锚点。只继承服饰、体型、局部特征;隔离原图色彩、光影和环境风格。
  • P 图:道具锚点。只继承形状、材质、磨损、尺寸关系;隔离原图色调和场景氛围。
  • E 图:场景锚点。只继承空间布局;最终调色由统一风格容器控制。

多张参考图职责不明时,先让用户选择;能从上下文明确推断时直接标注并继续。

STEP 5: POV 资产设计

不生成主角正脸资产。根据短片需要设计:

  • 主角局部资产:手部、袖口、鞋尖、手持物、伤口、戒指、胸前吊坠、工牌边缘、手机边缘、工具等。
  • 外部角色资产:只要会出现在主角视野里的人或生物。
  • 道具资产:手机、钥匙、门把手、电话、工牌、水瓶、药盒、笔记本、撬棍等。
  • 场景资产:走廊、出租屋、车内、楼梯间、办公室、便利店、厂房、街口等。

角色资产图或主角 POV 局部资产提示词结构:

[风格容器词] close-up photo of [手部/鞋/衣袖/局部资产描述], [物理风格参数词], real-life texture, no studio lighting, no posters, no professional commercial look, no full face of protagonist, no third-person camera.

STEP 6: 分镜设计

每条 Clip 必须以主角眼睛为摄影机。分镜字段建议:

Clip时长POV 视点主角可见局部外部对象动作阶段镜头运动风格锚点声音证据禁止项

分镜写法原则:

  • 用“我低头看见”“我推门”“我的手伸向”“视线被拽向”这类主观动作组织镜头。
  • 镜头运动是头部、身体、手持视线的运动,而不是外部摄影机调度。
  • 不写“镜头拍到主角走进房间”,改为“视线从门缝推进,手扶住门框”。
  • 不写“主角惊恐的脸”,改为“呼吸声变急,手指收紧,视线晃动”。

STEP 7: 反抽卡预检

每条 Clip 生成前执行 Anti-Lottery Gate:

  • 是否存在任何第三人称主角画面?有则改写。
  • 主角面部是否被看见?有则改写为手、袖口、鞋、倒影局部或呼吸声。
  • 摄影机是否等于主角眼睛?不是则改写。
  • 主角动作是否能从主观视角成立?不能则改写。
  • 风格词是否已转化为光线方向、色温、介质颗粒、材质、空气感?
  • C 图、P 图是否只承担身份或道具职责,排除了原有环境风格干扰?
  • 自定义感性词是否被翻译成可见证据?

STEP 8: 图像与视频提示词结构

视频提示词必须包含以下模块:

【参考图输入】
- 参考图1 (R / 风格与构图锚点):继承 [画面风格类型];不继承 [特定主体人脸]
- 参考图2 (C / 角色入画):只继承 [服饰/体型/局部特征];隔离 [原有色彩/光影/环境]
- 参考图3 (E / 场景):只继承 [空间布局];由 [风格容器] 统一调色

【影像容器】
[用户选择或输入风格的物理化容器]

【画面】
first-person POV from [protagonist]; camera is his/her eyes; no external shot of [protagonist]. [场景、外部对象、主角可见局部、动作]

【光影质感与风格硬锁】
[光照/色温/饱和度/对比度/介质纹理/空气感]

【动作阶段】
0-2s:
2-5s:
5-8s:

【镜头运动】
以主角头部、步伐、手部动作、呼吸造成的视线变化表达;禁止外部摄影机跟拍。

【声音证据】
环境声、脚步、衣料摩擦、呼吸、道具声、远处人声;不写字幕。

【负向硬禁】
third-person shot, external shot of protagonist, protagonist face, over-the-shoulder shot showing protagonist, selfie angle, cinematic drone shot, title card, subtitles, on-screen text.

STEP 9: 逐条 Clip 生成与 QC

每条 Clip 完成后检查:

  • POV 是否穿帮:是否出现主角脸、背影、外部跟拍、无人称摄影机视角。
  • 风格是否断代:前后 Clip 的饱和度、色彩倾向、噪点颗粒、空气感是否一致。
  • 运动是否符合身体视线:是否像眼睛、头部、步伐和手部带来的运动。
  • 声音是否服务沉浸:是否有动作声、空间声、呼吸声或环境声证据。

若风格跑偏:不要疯狂堆砌风格形容词;增强 R 图或风格锚点;删除与风格冲突的场景色彩词;把冲突物体改写为被统一光源照亮。

若 POV 穿帮:立刻重写镜头为“主角眼睛看到的动作结果”;用手部、袖口、鞋尖、局部倒影、视线晃动替代主角表情。

STEP 10: 组装建议

最终组装时保持:

  • Clip 顺序遵循主角注意力变化,而不是外部镜头美学。
  • 声音空间连续,避免同一条台词或音乐由多个 owner 重复生成。
  • 不添加字幕或画面文字。如用户要求字幕,提示其当前不支持字幕功能,建议后期用专业剪辑软件添加。

触发示例

应该触发:

  1. “帮我做一个第一人称 POV 短片,内容是我半夜回家发现门缝里有人。”
  2. “把这个短剧开头改成主观视角沉浸式视频。”
  3. “生成一个眼睛视角的雨夜追逐片段,要赛博迷幻风格。”

不应触发:

  1. “做一个普通剧情短片,男女主在咖啡厅对话。”
  2. “给产品做一个开箱展示视频。”
  3. “生成一张角色三视图设定图。”

Signals

GitHub stars
26
Last commit
Sep 2026
Advanced
Item type
skill
Key
pov-short-film-generator
Source
github.com/qxryz/workflowgenerator