跳到主要内容
erika.taranto
ITENDE中文RU
Blog 指南

Veo 3:是什么、怎么用、多少钱

Google 的 Veo 3,由拿它干活的人讲解:是什么、在哪里用 Gemini 和 Flow 免费试用、Veo 2、3 和 3.1 的区别、真实成本和诚实的局限。

Erika Taranto Erika Taranto
官方入选 · AI for Good 2026 阅读约 11 分钟
Veo 3:是什么、怎么用、多少钱
简而言之

Veo 3 是 Google DeepMind 的视频生成模型,2025 年 5 月发布:你描述场景,它生成一条八秒的 clip,同步音频就在里面,对白也不例外。在 Gemini 应用里使用,那里也有带每日限额的免费额度;在 Flow(Google 专门的 AI 视频工具)里使用;或通过 API 使用。它是五大引擎里跟随提示词最精确的那个:你要一条逆光下雨中的侧向轨道镜头,得到的就是那个场景,不是它的表亲。这里告诉你怎么开始、真实成本、Veo 2、3 和 3.1 的区别,以及没人写的局限。

在我每周的工作里,Veo 3 的 clip 是最常一次成活的镜头。不是因为它魔法:因为它是忠实于你写的那句话的引擎。别人送你一个漂亮变体,和你要的场景相似;Veo 倾向于给你你想要的那个场景。如果你为客户做视频,而 brief 不容谈判,这个差别就是一切。

这篇指南是对 Veo 3 的放大镜:五个引擎的完整地图,谁在哪赢,在总指南用 AI 创建视频里。

其他模型给你一个和你要求相似的场景。Veo 给你那个场景:这就是 brief 写死时它总出现在我项目里的原因。

Veo 3 是什么(从哪来)

Veo 3 是 Google DeepMind 的 text-to-video 模型:你给它一段描述,或一张起始图,它返回一条八秒的 clip,运镜、动作和音频一起生成。音频是它和上一代区分开的转折:雨有自己的声音,脚步跟着步子走,人物说话时嘴唇同步。

三步的历史帮你定位,因为 Veo 上什么版本都还能找到,容易混:

  • Veo 2 是上一代:clip 无音频、分辨率更低、对运镜的控制更少。有时还会作为「快速」选项出现:试试可以,生产是另一回事。
  • Veo 3,2025 年 5 月发布,带来了同步音频和经得起与电影摄影对比的质量。那是 AI 视频不再是哑巴的时刻。
  • Veo 3.1,当前版本,加入了连贯性:从最后一帧续起以延长场景的能力,以及在不同 clip 之间保持同一人物和物体的参考图。

今天有人搜「Veo 2」,几乎都是想知道跳到 3 值不值:值,音频是第一位的理由。

Veo 的三步时间线:Veo 2 无音频,Veo 3 带同步原生音频,Veo 3.1 带参考图和场景连贯性
Veo 的三步:从哑巴 clip 到原生音频,再到场景之间的连贯。

Veo 3 免费:真正能试的地方

我最常收到的问题是 Veo 3 能不能免费用。能,限制很明确:

  • Gemini 里,免费计划:你可以每天用 Veo 的 Fast 版本生成几条视频,分辨率降低并带水印。确切数字没有官方公布而且会变:在我这几周大概每天三条。了解这个工具适不适合你,够了。
  • Flow 里:Google Labs 的视频工具起步送试用积分,消耗得很快。Flow 适合搭场景,不适合免费生产。
  • 所有正经的免费路径,放在一起,在专门的指南里:免费 AI 视频生成,Veo 是完整全景里的一项。

我的生产者诚实:Veo 的免费是用来学会写提示词的,不是用来干活的。如果你有一个带截止日期的项目,每日限额会让你停在半路,而停在半路是认识一个工具最糟的方式。

Veo 的三个家:Gemini 用对话生成,Flow 搭建延长场景,API 用来开发产品
Veo 的三个家:一个用来说话,一个用来搭建,一个用来开发。

怎么用:五个步骤做第一条 clip

这是我今天会给起步者的路线,在 Gemini 免费计划上试过:

  1. 打开 Gemini(应用或网页),用自然语言要一段视频:「生成一段……的视频」。不需要记命令:Veo 读那句话。
  2. 用五个要素写场景:主体、动作、运镜、光、声音,按这个顺序,一句话写完。下面我留一个我真正在用的例子。
  3. 看结果,在错的部分上迭代。运镜漂了?重新声明它。光平了?点出光源。不要盲目重生成:每次尝试都有成本,即使免费,因为时间才是第一预算。
  4. clip 站得住、又需要延续场景时,把它转进 Flow:在那里你可以从最后一帧延长,并保留素材,也就是让后续 clip 保持一致的人物和物体参考。
  5. 在外面剪辑。八秒是一个镜头,不是一部视频:剪切、节奏和最终音频在剪辑里决定。没有模型给你这个。
Google 标志与 Veo 3 字样
Veo 3 属于 Google:在 Gemini 和 Flow 里生成。
## Veo 上的提示词:五个零件,一句话

在 Veo 上写作的回报比别处高,因为这个模型照办。我用的结构,一个适合第一次尝试的例子:

A woman in a beige trench coat walks alone through a night market, camera tracks laterally at walking pace, warm string lights and steam from food stalls, ambient chatter and her footsteps.

主体(有谁),动作(只有一个),运镜(声明出来),光(点出光源),声音(要求的声音)。Veo 认真对待每个零件:你声明了运镜,运镜就照做;你点出了光,光就从那里来。完整规则,包括「背景不要有人」反而招来背景有人这类陷阱,在总指南的提示词章节里。

即使发布的是意大利语视频,提示词也用英文写。Veo 主要用英文训练,英文跟得更精确:我的提示词永远从英文开始,视频最后配音或配字幕成意大利语。唇形对英文跟得好;意大利语对白的配音放在后期。

Veo 2、Veo 3、Veo 3.1:实际差在哪

 Veo 2Veo 3Veo 3.1
音频没有,哑的有,同步,对白也不例外有,更好
clip 时长短 clip8 秒8 秒,可从最后一帧延长
一致性有限单条 clip 内好clip 之间的人物和物体参考
在哪里找到作为某些工具里的快速选项Gemini、Flow、APIGemini、Flow、API:当前版本
什么时候选它永远不,只要 3 够得着写死的场景必须原样出来有固定人物的项目
Veo 2、Veo 3 和 Veo 3.1 的实际对比:音频、clip 延长和一致性参考图
从 Veo 2 到 Veo 3 到 Veo 3.1,真正变的东西。

Veo 3 多少钱

三条路,三种价格逻辑。数字 2026 年 8 月核实:这个行业每月都在动,把它们当快照,决定前再核对官方页面。

路线你付什么什么时候合理
Gemini 免费0:每天几次 Veo Fast 生成,分辨率降低,带水印学写提示词,试场景
Google AI 计划月订阅解锁更多生成、更高画质,Flow 给更多积分每周生产
Gemini API按 clip:720-1080p 约 0.40 美元,4K 0.60 美元搭建产品和自动化流程
真正的账单是尝试次数。即使在 Veo 上,它比别人错得少,一条 clip 的第一版几乎从不是能用的那版:每次重生成和成功一次成本一样。需要十条 clip,就按十六条算。完整的规则,连同所有对手的数字,在总指南的成本章节里。
Veo 3 的三条价格路线:带每日限额的免费,订阅的 Google AI 计划,按 clip 付费的 API
三条价格路线。数字 2026 年 8 月核实。

Veo 在哪里摔跤(以及怎么绕)

我每周用 Veo 并且推荐它,所以真缺点我也得讲:

  • 每条 clip 八秒。这是镜头的格式,不是视频的:在 Flow 里延长或者剪辑。从「给我来个一分钟视频」过来的人要重新校准预期:一分钟是八条 clip,也就是八个写好的场景。
  • 安全护栏。名人面孔、真实人物、敏感内容:Veo 过滤得很严。在给品牌做的工作里这几乎总是优点,但在把你们代言人的脸写进提示词之前,先知道这一点。
  • 视频里的文字。和大家一样:字出来是歪的。文字永远在剪辑里合成。
  • 意大利语唇形。英文跟得好,意大利语差一些:意大利语对白的配音放后期。
  • 隐形水印。Veo 的视频内嵌 SynthID,Google 的隐形签名,声明文件的 AI 来源。看不见,去不掉,社交平台认得出它:来源要声明,永远。
一分钟视频等于八条八秒 clip:需要写和剪的镜头胶卷
八秒是一个镜头,不是一部视频:一分钟是八个写好并剪好的场景。

什么时候我选 Veo,什么时候不

在我把场景分给引擎的方式里,Veo 拿走精确值钱的镜头:场景已经写好,客户确认了参考,必须原样出来。场景要求别的,我换引擎:

  • 走动的人、手势、身体的物理:Kling 动得更好;
  • 多个动作连续的场景、长 clip:Seedance 全都记得;
  • 运镜、一致性和延长要一起管理的整个项目:我用导演平台 Higgsfield,引擎们带着周边工具一起住在那里。

如果你需要视频是为你的品牌,而且更希望天天做这件事的人在你这边:这就是我的本行。写信给我,从一个想法开始。

视频系列各篇指南

来源

Telegram

想第一时间看到更新和动态,可以加入我的 Telegram 频道

AI 视频工具的最新消息,我都会先发布在那里。

进入频道 →
喜欢吗?分享一下。
评论

发表评论

评论会经过审核后才会公开显示。

你的邮箱不会被公开。

FAQ

常见问题

Veo 3 是免费的吗? +
部分免费。Veo 3 包含在 Gemini 的免费计划里:你可以每天用 Fast 版本生成几条视频,分辨率降低并带水印。确切数字没有官方公布,而且会变。要正经生产需要付费的 Google AI 计划或 API。
Google 的 Veo 3 是什么? +
它是 Google DeepMind 的视频生成模型,2025 年 5 月发布。生成八秒带同步音频的 clip,对白也不例外,生活在 Gemini 里、Flow(Google 专门的 AI 视频工具)里和开发者 API 里。当前版本是 Veo 3.1,加入了让人物和物体在 clip 之间保持一致的参考图功能。
Veo 3 多少钱? +
三条路:包含在 Gemini 免费计划里,有每日限额;付费的 Google AI 计划,提高限额和质量;开发者 API,2026 年 8 月时一条 clip 在 720-1080p 是 0.40 美元,4K 是 0.60 美元。价格会动:决定前永远核实官方页面。
Veo 2 和 Veo 3 有什么区别? +
Veo 2 是上一代:clip 无音频、分辨率更低、控制更少。Veo 3 带来了同步音频,对白也不例外,以及经得起和电影摄影对比的质量。Veo 3.1,当前版本,加入了 clip 之间的连贯性和人物、物体参考图。
Veo 3 在哪里用? +
三种方式:在 Gemini 的应用和网页版,用自然语言和模型对话;在 Flow,Google Labs 为搭建场景、保持人物一致而做的工具;通过 Gemini API,给开发的人。Gemini 是我推荐给起步者的入口。
Veo 3 生成的视频多长? +
一条 Veo 3 的 clip 八秒。可以在 Flow 里延续场景来延长,实际操作中 clip 要挑选、要剪辑,和电影一样:没有模型替你剪辑,视频是在剪辑里变成你的。
Veo 3 支持意大利语吗? +
支持,它接受意大利语提示词,但视频模型主要用英文训练,英文跟得更好:即使最终视频面向意大利观众,我的提示词也永远先用英文写。唇形对英文跟得好;意大利语的配音放在后期更划算,就像配音行业一直做的那样。
继续阅读
免费 AI 视频生成:2026 年真正可行的路径 指南
2026年9月

免费 AI 视频生成:2026 年真正可行的路径

阅读
AI 视频:2026 年指南 指南
2026年9月

AI 视频:2026 年指南

阅读
Higgsfield:是什么、怎么用、多少钱 指南
2026年9月

Higgsfield:是什么、怎么用、多少钱

阅读