第十章 AI 视频制作应用
视听语言是 AI 视频时代的"新编程语言"——AI 生成视频的质量上限,取决于你能否用专业术语精确描述想要的镜头。
10.1 为什么学视听语言对 AI 制作至关重要
- 文生视频模型(Sora、可灵、即梦、Runway、Veo 等)都在海量影视素材上训练,对专业术语的响应远好于模糊描述。"a cinematic dolly-in shot" 比 "camera moves closer" 生成质量更稳定。
- AI 能生成单个镜头,但分镜设计、镜头组接、节奏控制仍然完全依赖人——这正是视听语言的核心。
- 会看片、会拆片的人,才能判断 AI 生成结果好不好、差在哪、怎么改提示词。
10.2 用视听语言写视频提示词
一条结构化的视频提示词 = 主体 + 动作 + 场景 + 景别 + 运镜 + 光线 + 风格/氛围。
术语对照速查
| 中文 | 提示词(英文) |
|---|---|
| 大远景/远景/全景 | extreme wide shot / wide shot / full shot |
| 中景/中近景/特写/大特写 | medium shot / medium close-up / close-up / extreme close-up |
| 平拍/俯拍/仰拍/顶拍 | eye-level / high angle / low angle / top-down (overhead) |
| 推/拉 | dolly in (push in) / dolly out (pull back) |
| 摇/移/跟 | pan left-right, tilt up-down / trucking shot / tracking (following) shot |
| 环绕/升降/航拍 | orbit (arc) shot / crane shot / aerial drone shot |
| 手持/固定 | handheld camera / static (locked-off) shot |
| 浅景深/焦点转移 | shallow depth of field, bokeh / rack focus |
| 黄金时刻/蓝调时刻 | golden hour / blue hour |
| 逆光/轮廓光/三点布光 | backlight / rim light / three-point lighting |
| 柔光/硬光/体积光 | soft diffused light / hard light / volumetric light, god rays |
| 电影感/胶片感 | cinematic / 35mm film look, film grain |
| 慢动作/延时 | slow motion, 120fps / timelapse |
| 橙青色调/低饱和 | teal and orange grading / desaturated muted tones |
提示词模板与示例
模板:
[景别] + [角度] of [主体+外观细节] [动作], in [场景环境],
[运镜], [光线], [色调/风格], [氛围情绪]
示例 1(产品):
Close-up, slow dolly-in on a ceramic coffee cup with steam rising,
on a wooden table by a rainy window, soft window light from the left,
shallow depth of field, warm muted tones, cozy cinematic mood, 35mm film look.
示例 2(人物叙事):
Medium tracking shot following a young woman walking through a neon-lit
alley at night, handheld camera, shallow depth of field, teal and orange
color grading, light rain, reflective wet ground, moody cinematic atmosphere.
示例 3(大场面开场):
Aerial drone shot slowly pulling back to reveal a coastal village at
golden hour, volumetric sunlight, warm tones, epic establishing shot.
提示词技巧
- 一个提示词只写一个镜头、一个运镜意图,想要多镜头就分多次生成再剪辑——正如实拍"一镜一意图"。
- 描述具体可见的东西(材质、天气、光源方向),不要写抽象概念("美丽的""震撼的"信息量为零)。
- 保持角色/场景一致性:固定主体描述文案、使用参考图(图生视频)、用同一 seed。
- 生成不满意时,按视听语言逐项排查:是景别不对?光线不对?还是运镜不对?定向修改而非重写。
📺 相关视频(B站)
10.3 AI 视频工作流
完整流程:策划 → 分镜 → 生成 → 剪辑 → 声音 → 成片
- 脚本策划:用 Claude 等 LLM 头脑风暴主题、写脚本、生成分镜表(直接要求输出"景别/运镜/光线"列的分镜表)。
- 视觉预演:文生图(Midjourney/即梦)先出关键帧/分镜图,确认构图风格后再生成视频,省时省钱。
- 镜头生成:图生视频(一致性好)或文生视频;每个镜头生成 2-4 个候选,挑最好的。
- 剪辑组装:按蒙太奇逻辑组接——AI 单镜头普遍 5-10 秒,正好符合"短镜头快节奏"剪辑;用 J/L cut 和音效缝合。
- 声音:TTS 配音(ElevenLabs、剪映配音)、AI 音乐(Suno、Udio)、音效库补细节音。
- 后期统一:全片统一调色 LUT 掩盖不同批次生成的色差;加胶片颗粒/字幕增强整体感。
AI 辅助实拍剪辑(Vlog 场景更常用)
- 自动字幕+文稿剪辑:剪映"图文成片/智能剪口播"、DaVinci 文本剪辑——按文字删减,口播剪辑效率提升数倍。
- AI 降噪/人声分离:Voice Isolation 一键救回嘈杂环境收音。
- 智能抠像/跟踪:无绿幕换背景、自动追踪打码。
- 素材检索:按内容语义搜索素材("找出所有有海的镜头")。
- AI 调色匹配:一键匹配参考画面色调。
📺 相关视频(B站)
10.4 注意事项
- 工具迭代极快,但视听语言不变:把学习投资在"镜头思维"上,工具只是执行层。
- AI 素材商用注意各平台版权条款;人物肖像、品牌标志谨慎处理。
- 平台对 AI 内容可能要求标注声明,发布前确认规则。




