镜头意图 → 视频提示词翻译手册
SkillMediaA manual for translating 'shot intent' into video prompts — camera movement translation table (push/pull/pan/follow/orbit… → prompt wording), focus translation, composite shot (multi-clip) patterns, iron rules for replacing contaminated words, and converting abstract actions/emotions into physical a
Available today. Use it from your connected AI after setup.
No other account needed.
Connect ahel once, and every AI you use reads what you have installed.
Then ask your AI: use the 镜头意图 → 视频提示词翻译手册 skill
What this skill tells your AI
The instructions your AI receives, as published by aqm857886159/nomi in skills/director-shot-translation/SKILL.md and read by ahel’s review.
你已经知道这一镜「拍什么」(景别、运镜、焦点、动作、情绪)。这份手册只管一件事:把它翻译成一段能写进 Nomi 视频 shot prompt 字段的文字,让 Seedance / 可灵在应用内生成时不跑偏。产出是给 i2v 模型看的提示词措辞,不是给人看的分镜说明。
它管什么 / 不管什么:只管「运镜/焦点/污染词/抽象动作怎么翻成 prompt 文字」。时长怎么算、拆几镜、锚怎么建,是故事板规划师的活,这里不重复。
三条底层认知(决定怎么写)
- 参考图承担 90% 视觉信息。角色长相、场景陈设、光影、服装都在参考图里锁定了——
prompt只写动态:运镜翻译 + 人物行动 + 台词。绝不重复参考图已有的静态外观(重复只会稀释、还可能和参考图打架)。精度靠参考图的质量与精准对应,不靠文字堆长。 - 一条 = 一段连续叙事,一个情绪核心。写之前先一句话定这镜的整体感受(他在忍 / 空荡的孤独 / 危险逼近 / 松了口气),所有细节都往这一个感受靠。宁可只写 2 个准的,别堆 5 个平的。自检:读起来像并列清单(A、B、C、D)=错,模型会糊;所有细节都在说同一件事=对。
- 只写动态、不写抽象。不写情绪词、氛围词、音效(那些是后期/参考图的事);动作直接取用,只做下面的污染词替换。
情绪核心怎么翻(抽象情绪 → 物理动作)
模型不懂「愤怒地 / 焦虑地 / 深情地」这类抽象词,必须翻成能拍的身体信号:眉 / 颌 / 喉 / 手 / 肩 / 呼吸 / 视线焦点 + 具体动作。
- 承载情绪重量的动作放句首、给最具体的物理描写,其余从属或省略——别把情绪核心埋在中间。
- 剧本里
(...)括注定义这个时刻「关于什么」,优先级最高,先读它、译成物理动作。
(压抑的计算) → 瞳孔微缩,右手食指轻点桌面一次后静止
(恐惧被理性压制)→ 喉结微微滚动,手指收紧后缓缓松开,呼吸幅度极小
(愤怒辩解) → 眉头紧锁、下颌收紧、喉结滚动,扑身抓起东西举到脸前,手微微发抖
正误对比(动作链「盯着屏幕两秒后点击接受·无感情评估」):
- ✗
角色看向屏幕,手伸向杯子,眨眼,点击,周围窗口闪烁。(「看向」是污染词,情绪核心被噪声淹没) - ✓
角色面部完全静止,瞳孔微缩,右手食指缓慢抬起点击一次后放下。(static→冷静·客观·疏离)
运镜翻译表(核心 · 完整保留)
| 运镜 | 提示词怎么写 | 可靠度 |
|---|---|---|
| static(固定) | 不写运镜,只写角色动作/表情变化 | ★★★★★ |
| slow dolly in(缓推) | 镜头缓慢向前推近,[角色动作] | ★★★★★ |
| dolly out(拉远) | 镜头缓慢后退,[角色/环境揭示] | ★★★★★ |
| pan(横摇) | 镜头水平向[左/右]缓慢摇动 | ★★★★★ |
| tilt up/down(纵摇) | 镜头[上/下]摇 | ★★★★★ |
| track(侧跟) | 镜头与角色保持平行向[方向]移动 | ★★★★ |
| handheld(手持) | 镜头带与[脚步/心跳/呼吸]频率一致的震颤·必须指定节奏源 | ★★★★ |
| crane up/down(升降) | 镜头[上升/下降] | ★★★★ |
| orbital(环绕) | 镜头绕角色[顺/逆时针]弧形移动至[终止角度](≤180°,360° 出不来) | ★★★ |
| whip pan(甩镜) | 镜头快速横扫向[方向],约 0.3 秒完成,中间成运动模糊 | ★★★★ |
| rack focus A→B(变焦) | 焦点从[A·清晰]缓慢转移到[B·从模糊变清晰] | ★★★ |
加速度曲线(可选细化,不改运镜方向):ease-in→「起始缓慢逐渐加速」;ease-out→「起始迅速最后缓缓停下」;punch-stop→「瞬间高速[推/拉]然后突然停住」。
运镜多样性:连续 2 个以上镜头同一运镜 → 换一换,别全是缓推。
超能力预警:360° 环绕、精确希区柯克变焦这类,模型抽卡不稳——照给 + 多抽,或标注替代(如环绕降到 ≤180°),别默默降级成别的运镜。
焦点翻译表
| 焦点指令 | 提示词怎么写 |
|---|---|
| 深景深·全局 | 不写焦点(默认全清晰) |
| 锁定 [对象] | 加强该对象的细节描述(靠密度控制景别,见下) |
| 极浅·隔离 | 只写该物件细节,其他一律不描述 |
| rack focus A→B·缓慢 | 焦点从前景[A·清晰]缓慢转移到背景[B·从模糊变清晰],[A]同时变虚焦 |
| rack focus A→B·瞬间 | 焦点瞬间从[A]切到[B],[A]立刻虚焦 |
rack focus 三要素(缺一即被模型忽略):① 起点清晰的对象 ② 终点变清晰的对象 ③ 速度/快慢。
污染词铁律(最容易翻车的一处)
模型看到某个词就脑补整套刻板印象,即使被否定也不例外(写「不戴护士帽」照样把人放进医院;写「意识」直接生成大脑发光)。破解:只描述具体动作/姿态/物体,不用事件名或抽象概念。 写之前对照黑名单自查,命中即改。
| ❌ 污染词 | 模型脑补的坑 | ✅ 改成 |
|---|---|---|
| 意识 / 记忆 / 命运 等抽象概念 | 大脑发光、神经元放电等 | 具体物理表现(瞳孔收缩、手指无意识抽搐、屏幕波形变化) |
| 望向 / 注视 / 凝视 / 看向 | 强行出正脸(眼睛必须可见) | 身体朝向 + 视线所及物体的具体描述(见下表) |
| 背对 + 望向(叠加) | 模型妥协给一个侧身 | 拆成两条物理描述(背对怎么站 + 那个物体在哪) |
| 打游戏 / 驾驶 / 战斗 / 瞄准 等事件名 | 好莱坞刻板造型 | 拆成具体动作/姿态/操作的物体 |
| 深空 / 太空 | 彩色星云壁纸风 | 漆黑背景,冷白针点恒星,无星云无彩色天体,纯粹黑暗 |
抽象动作 → 视觉元素(视觉代偿)
模型没有世界模型,不理解「背对/望向/俯视/回眸」这类抽象动作,只会画「对应的具体视觉元素」凑数;两个抽象动作叠加时画一个两者都能凑到的妥协姿态。黄金法则:只描述画面能看到的东西。 抽象动作=身体朝向 + 头部方向 + 眼睛焦点。
| 抽象动作 | 翻成(视觉元素) |
|---|---|
| 背对镜头望向某物 | 角色背对镜头站立;画面对应方向出现该物体的具体描述 |
| 注视远处 / 凝视前方 | 身体朝某向,远景中呈现注视目标(具体物体) |
| 俯视地面 / 低头看物 | 头顶、肩膀、颈部、地面透视占据画面 |
| 回眸 | 侧身向右,头部左转,侧脸四分之三面向镜头 |
| 跟着她 / 追上去 | 背影占据前景(后背+发丝+肩线),身后环境向前展开(跟拍) |
| 望向窗外 | 角色朝窗户方向,窗外景物细节占据画面 |
用细节密度控制景别(模型对「特写/全景」这类抽象词识别不稳,改用「哪里写得多,注意力就去哪」):
| 想要的景别 | 就多写这些细节 |
|---|---|
| 特写面部 | 面部疤痕纹理 / 瞳孔 / 睫毛 / 皮肤毛孔 |
| 中近景上半身 | 服装肩章 / 徽章 / 领口 / 颈部线条 / 锁骨 |
| 全景 | 环境大尺度元素 + 人物作为小剪影 |
| 俯拍 | 头顶 / 肩膀 / 背部 / 地面透视 |
| 仰拍 | 下巴 / 颈部 / 服装下缘 / 天花板背景 |
| 推进 | 逐分镜递增主体细节(轮廓→徽章→面部→瞳孔) |
复合镜头模式(多 clip)
一段复杂镜头拆成硬切子镜头 C01 / C02 / C03,按事件发生顺序标识、不标秒数;每个 clip 一句话、一个核心动作,入画出画用方位词。什么时候拆:大幅姿态切换 / 位移 >1/3 画幅 / 场景状态变化 / >2 个离散动作 / 景别切换。
- OTS(过肩):
画面左前方一个人的右肩和后脑勺柔和虚焦占据画面 25%,形成自然框架。焦点在画面右侧的 B,面朝左前方,[表情]。浅景深,前景肩膀完全虚化。只写 B 的动作/表情变化,前景过肩人物是静态构图元素、不写动作。 - 正反打:两个相邻 OTS 各写一段(镜1 焦点 B / 镜2 焦点 A),后期交替拼接。一致性硬规则:两张场景光线方向/色温一致;同一角色始终在画面同一侧(守 180° 轴线);背景一致。
- 建场 → 景别递进:建场用远景,写环境动态(灯光/粒子/舱门),角色不写;进入镜头用中景,以角色动作为主。
- 插入 + 反应:插入
极特写,[物件]占满画面。极浅景深,仅[物件]清晰,周围完全虚化。[微动态];反应写角色的物理反应(深吸一口气,瞳孔微缩,嘴唇缓缓抿紧,别写「表情变悲伤」)。 - rack focus + dolly in:两个变化写进一句
镜头缓慢向前推近,同时焦点从前景的手(清晰)缓慢转移到角色面部(从模糊变清晰),手逐渐虚焦。 - 鸟瞰:
俯拍鸟瞰视角,摄影机正上方垂直向下。[主体]在画面中央,[场景]四周展开。 - 倒影 / 镜面:
画面中央一面[反射面],其中映出[角色]的倒影。[倒影中的姿态/表情]。只描述倒影、不描述本体。
前景层(告别塑料感)
i2v 默认画面「真空感」(无遮挡、无粒子,像塑料模型)。除极近特写外,最好带一层前景描述——但必须明写虚化,否则前景会和主体一样清晰、层次全丢。必须出现的词:失焦 / 虚化 / 严重散景 / 柔焦。
- 物理遮挡型:设备边缘 / 面板框 / 管线 / 栏杆 / 舷窗框 / 家具棱角 / 窗框(按场景选)。
- 氛围粒子型(i2v 在粒子上有专项优化,用好效果拔群):光束中尘埃 / 灰尘微粒 / 屏幕反射光斑 / 星尘颗粒 / 暖色微尘(回忆/梦境)/ 数据流光斑(界面)。
写法:前景(虚化):[物体/粒子 + 严重散景 + 光线]——用自然语言,不用尖括号标签。
收尾自检(写完扫一遍)
- 污染词:动作链有没有命中事件名/抽象概念?命中 → 换物理动作。
- 视觉代偿:背对/望向/凝视有没有翻成「身体朝向 + 头部方向 + 眼睛焦点」?
- 一个核心:读起来是不是所有细节都在说同一件事?像并列清单就重写。
- 只写动态:有没有重复参考图已锁的外观、混进情绪词/氛围词/音效?删掉。
- 强弱词配对:每个运动元素配一个强词(定义动作:下落/抬起/转头)+ 一个弱词(控制质感:极缓/轻微/克制)——缺强词模型不知做什么,缺弱词幅度失控。用肯定句排除(「肩颈几乎不动」)而非否定指令(不写「不要移动」)。
Signals
- GitHub stars
- 507
- Forks
- 109
- Last commit
- Sep 2026
Advanced
- Catalog kind
- skill
- Gateway key
director-shot-translation- Source
- github.com/aqm857886159/nomi