Veo 3 是 Google DeepMind 的视频生成模型,2025 年 5 月发布:你描述场景,它生成一条八秒的 clip,同步音频就在里面,对白也不例外。在 Gemini 应用里使用,那里也有带每日限额的免费额度;在 Flow(Google 专门的 AI 视频工具)里使用;或通过 API 使用。它是五大引擎里跟随提示词最精确的那个:你要一条逆光下雨中的侧向轨道镜头,得到的就是那个场景,不是它的表亲。这里告诉你怎么开始、真实成本、Veo 2、3 和 3.1 的区别,以及没人写的局限。
在我每周的工作里,Veo 3 的 clip 是最常一次成活的镜头。不是因为它魔法:因为它是忠实于你写的那句话的引擎。别人送你一个漂亮变体,和你要的场景相似;Veo 倾向于给你你想要的那个场景。如果你为客户做视频,而 brief 不容谈判,这个差别就是一切。
这篇指南是对 Veo 3 的放大镜:五个引擎的完整地图,谁在哪赢,在总指南用 AI 创建视频里。
其他模型给你一个和你要求相似的场景。Veo 给你那个场景:这就是 brief 写死时它总出现在我项目里的原因。
Veo 3 是什么(从哪来)
Veo 3 是 Google DeepMind 的 text-to-video 模型:你给它一段描述,或一张起始图,它返回一条八秒的 clip,运镜、动作和音频一起生成。音频是它和上一代区分开的转折:雨有自己的声音,脚步跟着步子走,人物说话时嘴唇同步。
三步的历史帮你定位,因为 Veo 上什么版本都还能找到,容易混:
- Veo 2 是上一代:clip 无音频、分辨率更低、对运镜的控制更少。有时还会作为「快速」选项出现:试试可以,生产是另一回事。
- Veo 3,2025 年 5 月发布,带来了同步音频和经得起与电影摄影对比的质量。那是 AI 视频不再是哑巴的时刻。
- Veo 3.1,当前版本,加入了连贯性:从最后一帧续起以延长场景的能力,以及在不同 clip 之间保持同一人物和物体的参考图。
今天有人搜「Veo 2」,几乎都是想知道跳到 3 值不值:值,音频是第一位的理由。
Veo 3 免费:真正能试的地方
我最常收到的问题是 Veo 3 能不能免费用。能,限制很明确:
- Gemini 里,免费计划:你可以每天用 Veo 的 Fast 版本生成几条视频,分辨率降低并带水印。确切数字没有官方公布而且会变:在我这几周大概每天三条。了解这个工具适不适合你,够了。
- Flow 里:Google Labs 的视频工具起步送试用积分,消耗得很快。Flow 适合搭场景,不适合免费生产。
- 所有正经的免费路径,放在一起,在专门的指南里:免费 AI 视频生成,Veo 是完整全景里的一项。
我的生产者诚实:Veo 的免费是用来学会写提示词的,不是用来干活的。如果你有一个带截止日期的项目,每日限额会让你停在半路,而停在半路是认识一个工具最糟的方式。
怎么用:五个步骤做第一条 clip
这是我今天会给起步者的路线,在 Gemini 免费计划上试过:
- 打开 Gemini(应用或网页),用自然语言要一段视频:「生成一段……的视频」。不需要记命令:Veo 读那句话。
- 用五个要素写场景:主体、动作、运镜、光、声音,按这个顺序,一句话写完。下面我留一个我真正在用的例子。
- 看结果,在错的部分上迭代。运镜漂了?重新声明它。光平了?点出光源。不要盲目重生成:每次尝试都有成本,即使免费,因为时间才是第一预算。
- clip 站得住、又需要延续场景时,把它转进 Flow:在那里你可以从最后一帧延长,并保留素材,也就是让后续 clip 保持一致的人物和物体参考。
- 在外面剪辑。八秒是一个镜头,不是一部视频:剪切、节奏和最终音频在剪辑里决定。没有模型给你这个。
在 Veo 上写作的回报比别处高,因为这个模型照办。我用的结构,一个适合第一次尝试的例子:
A woman in a beige trench coat walks alone through a night market, camera tracks laterally at walking pace, warm string lights and steam from food stalls, ambient chatter and her footsteps.
主体(有谁),动作(只有一个),运镜(声明出来),光(点出光源),声音(要求的声音)。Veo 认真对待每个零件:你声明了运镜,运镜就照做;你点出了光,光就从那里来。完整规则,包括「背景不要有人」反而招来背景有人这类陷阱,在总指南的提示词章节里。
Veo 2、Veo 3、Veo 3.1:实际差在哪
| Veo 2 | Veo 3 | Veo 3.1 | |
|---|---|---|---|
| 音频 | 没有,哑的 | 有,同步,对白也不例外 | 有,更好 |
| clip 时长 | 短 clip | 8 秒 | 8 秒,可从最后一帧延长 |
| 一致性 | 有限 | 单条 clip 内好 | clip 之间的人物和物体参考 |
| 在哪里找到 | 作为某些工具里的快速选项 | Gemini、Flow、API | Gemini、Flow、API:当前版本 |
| 什么时候选它 | 永远不,只要 3 够得着 | 写死的场景必须原样出来 | 有固定人物的项目 |
Veo 3 多少钱
三条路,三种价格逻辑。数字 2026 年 8 月核实:这个行业每月都在动,把它们当快照,决定前再核对官方页面。
| 路线 | 你付什么 | 什么时候合理 |
|---|---|---|
| Gemini 免费 | 0:每天几次 Veo Fast 生成,分辨率降低,带水印 | 学写提示词,试场景 |
| Google AI 计划 | 月订阅解锁更多生成、更高画质,Flow 给更多积分 | 每周生产 |
| Gemini API | 按 clip:720-1080p 约 0.40 美元,4K 0.60 美元 | 搭建产品和自动化流程 |
Veo 在哪里摔跤(以及怎么绕)
我每周用 Veo 并且推荐它,所以真缺点我也得讲:
- 每条 clip 八秒。这是镜头的格式,不是视频的:在 Flow 里延长或者剪辑。从「给我来个一分钟视频」过来的人要重新校准预期:一分钟是八条 clip,也就是八个写好的场景。
- 安全护栏。名人面孔、真实人物、敏感内容:Veo 过滤得很严。在给品牌做的工作里这几乎总是优点,但在把你们代言人的脸写进提示词之前,先知道这一点。
- 视频里的文字。和大家一样:字出来是歪的。文字永远在剪辑里合成。
- 意大利语唇形。英文跟得好,意大利语差一些:意大利语对白的配音放后期。
- 隐形水印。Veo 的视频内嵌 SynthID,Google 的隐形签名,声明文件的 AI 来源。看不见,去不掉,社交平台认得出它:来源要声明,永远。
什么时候我选 Veo,什么时候不
在我把场景分给引擎的方式里,Veo 拿走精确值钱的镜头:场景已经写好,客户确认了参考,必须原样出来。场景要求别的,我换引擎:
- 走动的人、手势、身体的物理:Kling 动得更好;
- 多个动作连续的场景、长 clip:Seedance 全都记得;
- 运镜、一致性和延长要一起管理的整个项目:我用导演平台 Higgsfield,引擎们带着周边工具一起住在那里。
如果你需要视频是为你的品牌,而且更希望天天做这件事的人在你这边:这就是我的本行。写信给我,从一个想法开始。
视频系列各篇指南
- 用 AI 创建视频,所有工具的完整地图(本系列的支柱文章);
- Higgsfield,引擎们干活的导演平台;
- Seedance,长场景的引擎;
- Kling AI,写实派,最好的免费学校;
- Sora 2,storyboard 的先驱,今天背后全是追赶者;
- 免费 AI 视频生成,所有零成本路径。
来源
- Google DeepMind,模型官方页面:deepmind.google/models/veo
- Gemini,Veo 也能免费用的地方:gemini.google.com
- Flow,Google Labs 的视频工具:labs.google/flow
- Gemini API,视频生成价格:ai.google.dev
- 免费计划限额与模型行为:2026 年 8 月在应用内核实,与总指南同一轮核查
想第一时间看到更新和动态,可以加入我的 Telegram 频道
AI 视频工具的最新消息,我都会先发布在那里。
发表评论
评论会经过审核后才会公开显示。