第十章 AI 视频制作应用

视听语言是 AI 视频时代的"新编程语言"——AI 生成视频的质量上限,取决于你能否用专业术语精确描述想要的镜头。

10.1 为什么学视听语言对 AI 制作至关重要

  • 文生视频模型(Sora、可灵、即梦、Runway、Veo 等)都在海量影视素材上训练,对专业术语的响应远好于模糊描述。"a cinematic dolly-in shot" 比 "camera moves closer" 生成质量更稳定。
  • AI 能生成单个镜头,但分镜设计、镜头组接、节奏控制仍然完全依赖人——这正是视听语言的核心。
  • 会看片、会拆片的人,才能判断 AI 生成结果好不好、差在哪、怎么改提示词。

10.2 用视听语言写视频提示词

一条结构化的视频提示词 = 主体 + 动作 + 场景 + 景别 + 运镜 + 光线 + 风格/氛围

术语对照速查

中文 提示词(英文)
大远景/远景/全景 extreme wide shot / wide shot / full shot
中景/中近景/特写/大特写 medium shot / medium close-up / close-up / extreme close-up
平拍/俯拍/仰拍/顶拍 eye-level / high angle / low angle / top-down (overhead)
推/拉 dolly in (push in) / dolly out (pull back)
摇/移/跟 pan left-right, tilt up-down / trucking shot / tracking (following) shot
环绕/升降/航拍 orbit (arc) shot / crane shot / aerial drone shot
手持/固定 handheld camera / static (locked-off) shot
景深/焦点转移 shallow depth of field, bokeh / rack focus
黄金时刻/蓝调时刻 golden hour / blue hour
逆光/轮廓光/三点布光 backlight / rim light / three-point lighting
柔光/硬光/体积光 soft diffused light / hard light / volumetric light, god rays
电影感/胶片感 cinematic / 35mm film look, film grain
慢动作/延时 slow motion, 120fps / timelapse
橙青色调/低饱和 teal and orange grading / desaturated muted tones

提示词模板与示例

模板:
[景别] + [角度] of [主体+外观细节] [动作], in [场景环境],
[运镜], [光线], [色调/风格], [氛围情绪]

示例 1(产品):
Close-up, slow dolly-in on a ceramic coffee cup with steam rising,
on a wooden table by a rainy window, soft window light from the left,
shallow depth of field, warm muted tones, cozy cinematic mood, 35mm film look.

示例 2(人物叙事):
Medium tracking shot following a young woman walking through a neon-lit
alley at night, handheld camera, shallow depth of field, teal and orange
color grading, light rain, reflective wet ground, moody cinematic atmosphere.

示例 3(大场面开场):
Aerial drone shot slowly pulling back to reveal a coastal village at
golden hour, volumetric sunlight, warm tones, epic establishing shot.

提示词技巧

  • 一个提示词只写一个镜头、一个运镜意图,想要多镜头就分多次生成再剪辑——正如实拍"一镜一意图"。
  • 描述具体可见的东西(材质、天气、光源方向),不要写抽象概念("美丽的""震撼的"信息量为零)。
  • 保持角色/场景一致性:固定主体描述文案、使用参考图(图生视频)、用同一 seed。
  • 生成不满意时,按视听语言逐项排查:是景别不对?光线不对?还是运镜不对?定向修改而非重写。

10.3 AI 视频工作流

完整流程:策划 → 分镜 → 生成 → 剪辑 → 声音 → 成片

  1. 脚本策划:用 Claude 等 LLM 头脑风暴主题、写脚本、生成分镜表(直接要求输出"景别/运镜/光线"列的分镜表)。
  2. 视觉预演:文生图(Midjourney/即梦)先出关键帧/分镜图,确认构图风格后再生成视频,省时省钱。
  3. 镜头生成:图生视频(一致性好)或文生视频;每个镜头生成 2-4 个候选,挑最好的。
  4. 剪辑组装:按蒙太奇逻辑组接——AI 单镜头普遍 5-10 秒,正好符合"短镜头快节奏"剪辑;用 J/L cut 和音效缝合。
  5. 声音:TTS 配音(ElevenLabs、剪映配音)、AI 音乐(Suno、Udio)、音效库补细节音。
  6. 后期统一:全片统一调色 LUT 掩盖不同批次生成的色差;加胶片颗粒/字幕增强整体感。

AI 辅助实拍剪辑(Vlog 场景更常用)

  • 自动字幕+文稿剪辑:剪映"图文成片/智能剪口播"、DaVinci 文本剪辑——按文字删减,口播剪辑效率提升数倍。
  • AI 降噪/人声分离:Voice Isolation 一键救回嘈杂环境收音。
  • 智能抠像/跟踪:无绿幕换背景、自动追踪打码。
  • 素材检索:按内容语义搜索素材("找出所有有海的镜头")。
  • AI 调色匹配:一键匹配参考画面色调。

10.4 注意事项

  • 工具迭代极快,但视听语言不变:把学习投资在"镜头思维"上,工具只是执行层。
  • AI 素材商用注意各平台版权条款;人物肖像、品牌标志谨慎处理。
  • 平台对 AI 内容可能要求标注声明,发布前确认规则。