返回首页

可灵 3.0、Veo 3.1 与 Seedance 2.0 视频生成工作流

可灵 3.0、Veo 3.1、即梦 Seedance 2.0 文生视频与图生视频实战:多镜头分镜、口播同步、原生音频,以及 TikTok/Reels UGC 广告提示词写法。

AI 视频的日常生产场景

文生视频、图生视频已是广告与社媒团队的常规产能。可灵适合多镜头分镜与口播同步 UGC,Veo 适合带原生音效的电影感片段,即梦 Seedance 适合口播级唇形同步的带货数字人。当产品或人物必须跟 approved 静帧一致时,很多团队会走文生图再图生视频流水线。

PixelPrompt 支持先优化结构化提示词再生成,把积分花在符合 brief 的片段上。

端到端视频工作流

1. 明确交付物

场景常见格式重点
付费信息流9:16,3–10 秒产品主体清晰,预留 CTA 区域
自然流短视频9:16,5–15 秒前 1 秒有钩子
产品演示16:9 或 1:1慢镜头、标签可读
品牌氛围16:9氛围、缓慢漂移、可用原生音效

2. 选定画幅与时长

先做 3–5 秒短版,确认构图和运动,再延长或拼接。

3. 撰写并优化提示词

正式投放建议走 提示词优化 出 3 个版本对比。

4. 生成、检查、迭代

关注主体稳定、运动平滑、标签是否融化、光线是否符合品牌。

5. 沉淀模板并批量

记录提示词 + 画幅 + 时长 + 模型,SKU 变体直接复用。

高质量视频提示词结构

主体 + 场景 + 镜头运动 + 光线 + 风格 + 节奏/时长

产品广告示例:

护肤精华瓶摆在大理石台面,镜头缓慢推进,暖色影棚光,极简高级广告风,运动平滑,约 5 秒

多镜头分镜(可灵 O3)

叙事型广告建议按镜头拆 prompt,而不是一段写完:

镜头时长提示词重点
钩子1–2 秒大特写、强运动或 reveal
产品 hero2–3 秒慢推、标签可读、构图稳定
生活场景2–3 秒手持、环境、UGC 感
CTA 帧1–2 秒产品居中,下方留 CTA 叠字区

各镜头独立生成后剪辑拼接。各镜复用同一套光线词汇,序列才 cohesive。

口播同步与数字人提示词

对白驱动的 UGC 或带货数字人:

  1. 先在直聊模式定脚本 — 控制语气与句长(短句同步更好)
  2. 优化时在 prompt 里引号写对白 — 如:「这改变了我的晨间习惯,」她温暖地说。
  3. 构图留脸或留产品 — 口播用胸以上;保健品广告可产品在手
  4. 首条 clip 控制在 5 秒内 — 确认口型再延长

即梦、可灵 2.6+ 在镜头运动 modest(轻微 handheld,非快摇)时对引号对白表现更好。

Veo 3.1 原生音频

Veo 可生成与画面匹配的环境音。在 prompt 里单独写音频 mood:

雨夜城市街道,霓虹倒影,缓慢 tracking 镜头,环境音为雨声与远处车流,电影感,8 秒

避免指定有版权的音乐;描述环境质感即可(咖啡馆人声、海浪、影棚安静)。

模型选型参考

需求常见选择原因
口播/对白同步可灵 2.6+引号对白与口型同步较强
较长电影感 + 环境音Veo 3.1场景一致性与原生音效
大批量社媒、成本敏感可灵 3.0单条成本友好,支持 4K

在 PixelPrompt 内按 brief 选模型;频繁换模型不如先把提示词写稳。

模型选型决策树

不确定用哪个视频模型时,prompt 结构类似,侧重点不同:

画面里需要口型/对白?
├─ 是 → 可灵 2.6+ 或即梦 Seedance(引号对白 +  modest 镜头)
└─ 否 → 需要原生环境音?
    ├─ 是 → Veo 3.1(音频 mood 单独写)
    └─ 否 → 多镜头且角色要一致?
        ├─ 是 → 可灵 O3(每镜一条 prompt,光线词统一)
        └─ 否 → 仅产品静帧加微动?
            └─ 图生视频(先小运动)

长片拼接思路

单次生成通常仍限制在约 5–15 秒。做 30 秒广告:

  1. 纸上分 4–6 镜(钩子 → 产品 → 证明 → CTA)
  2. 各镜共用同一套风格词(同一光线短语、同一「手持 UGC」或「滑轨」)
  3. 在剪辑软件拼接——不要一条 prompt 写「包含 4 个场景」
  4. 若支持续写/remix,可从上一段 clip 的 ID 延续

音频描述速查(Veo / 可灵)

场景音频怎么写避免
产品桌拍轻微 room tone,陶瓷轻碰指定流行歌名
雨夜街景远处车流、雨打路面有版权 BGM
UGC 厨房冰箱低频、室内生活感过长歌词描述
影棚产品干净静音、产品触碰轻 foley「史诗预告片音乐」

PixelPrompt 推荐参数

交付物画幅首条时长参考图
抖音/Reels 广告9:165 秒试片AI 图片出的产品静帧
产品演示1:1 或 16:95–10 秒清晰 packshot
口播 UGC9:163–5 秒可选人脸参考
品牌 mood16:98 秒可选 mood board

静帧定稿后再优化运动 prompt——见 先优化再生成。

图生视频要点

  1. 静帧要清晰
  2. 先小运动,再大动作
  3. 锁构图:产品始终居中、标签保持可读
  4. 静帧若来自 先优化再生成,视频 prompt 复用同一套光线词

多模态参考输入(2026 生产向)

当人物或产品必须与 approved 静帧一致时,纯文生视频往往不如 「参考图 + 结构化运动描述」 稳。2026 年主流工作流(可灵 O3、即梦 Seedance 等)支持在一条请求里组合多张参考——团队通常这样用:

输入类型典型用途prompt 写法要点
产品静帧图生视频微动与参考图相同构图,轻微蒸汽,标签保持可读
人脸参考口播 UGC与参考图为同一人,胸以上景别, modest handheld
mood 参考品牌氛围片匹配参考图调色与光线方向,缓慢推镜
分镜上一段多镜串联复用同一套光线短语,只改主体动作

实操顺序:

  1. 在 AI 图片 用 先优化再生成 定稿静帧
  2. 把静帧上传至 AI 视频,运动 prompt 只描述变化(镜头、蒸汽、手势),不重新发明场景
  3. 首条 clip 5 秒内、运动 modest;通过后再延长或拼接下一镜

这与电商团队「packshot 定稿 → 微动广告」的路径一致——见 电商产品图优化。

常见问题与修复

现象可能原因处理
主体变形运动幅度过大减弱镜头描述;缩短时长
包装文字融化模型重绘标签换更干净静帧;加「保持标签」
口型漂移对白过长或过快缩短台词;减少镜头运动

上线前检查清单

  • 社媒前 1 秒有视觉钩子
  • 480p 宽度下产品/ Logo 仍可辨认
  • 提示词已存档(含模型与时长)

相关教程

  • 先优化提示词再生成
  • 社媒批量创意工作流
  • 电商产品图优化
AI 视频的日常生产场景端到端视频工作流1. 明确交付物2. 选定画幅与时长3. 撰写并优化提示词4. 生成、检查、迭代5. 沉淀模板并批量高质量视频提示词结构多镜头分镜(可灵 O3)口播同步与数字人提示词Veo 3.1 原生音频模型选型参考模型选型决策树长片拼接思路音频描述速查(Veo / 可灵)PixelPrompt 推荐参数图生视频要点多模态参考输入(2026 生产向)常见问题与修复上线前检查清单相关教程