跳到主要内容
erika.taranto
ITENDE中文RU
Blog 指南

AI 视频:2026 年指南

2026 年怎么用 AI 做视频:Sora 2、Veo 3、Kling、Seedance 和 Higgsfield,由靠它们吃饭的人讲解。提示词一步步来、真实成本、局限和使用权。

Erika Taranto Erika Taranto
官方入选 · AI for Good 2026 阅读约 15 分钟
AI 视频:2026 年指南
简而言之

2026 年用 AI 做视频是这样运作的:你描述场景(或给它一张起始图),模型生成一条几秒的 clip,带运镜、动作,旗舰引擎还带同步音频。然后 clip 要挑选、要剪辑,和电影一样。五个主要工具是 Sora 2Veo 3KlingSeedance 和托管它们、再往上加导演工具的平台 Higgsfield。质量已经是电视级;真正的限制是 clip 时长和 clip 之间的一致性。下面有全部原理、价格和能用来干什么活。

两年前 AI 生成的视频像玩笑:身体像蜡一样变形,人走到一半融化掉。今天用同样的工具能做出广告和短片:我的迷你电影 UNSEEN 进了联合国 AI for Good Film Festival 全球 10 强决赛,而且正是用这篇指南里的工具拍的。想看能达到什么样的结果,这里有 UNSEEN 的完整 case study,幕后也包括。

短片 UNSEEN 的一帧,用本指南的 AI 视频工具生成
UNSEEN 的一帧,联合国 AI for Good Film Festival 入围短片。完整 case study 在网站上。

我叫 Erika,我的本行就是为品牌和自己的项目用 AI 生成图像和视频。所以没有那种读新闻稿拼出来的二十个工具清单:我给你讲五个主要的,各自在哪赢、在哪吃力,以及怎么从零搭一条视频,用我自己的流程。提到的每个工具都有专门的指南,页面最后有完整清单,免费路线也包括在内。

模型、应用还是平台?马上讲清楚,这是 AI 视频的第一号混淆。模型是生成视频的引擎:Sora 2、Veo 3、Kling、Seedance。应用或网站是你写提示词、用模型的地方:比如 Sora、Gemini 和 Flow。平台把多个模型聚在一起并加上导演工具:Higgsfield 托管 Seedance 和 Kling,并在上面搭运镜、clip 延长和人物一致性。你打交道的永远是应用或平台,但真正生成视频的是模型:记住这一点,那些名字就不再搞混你。

今天的 AI 视频生成怎么运作

原理和图像一样,多一个复杂度:时间。视频模型不仅要决定每一帧长什么样,还要决定帧与帧之间发生什么。所以入口有三条。

从文字到视频(text-to-video)。你写下场景,模型把它拍出来:主体、动作、运镜、光。这是所有人都认识的路,也非常适合探索想法,因为每句话都能变成一个镜头。

从图到视频(image-to-video)。从一张图出发,你的或 AI 生成的,模型让它动起来:在保住起点的前提下决定场景里的运动。需要控制时这是最可靠的路,因为主体已经原样在那里,模型直接让它动起来。这是我用得最多的路:先用图像模型生成关键帧,再把它们动画化。

从视频到视频。第三条路是修改一段你已经生成的视频,或一段实拍。对生成的素材它是走得最少的路,因为这些模型生来是为了创造,不是为了重搅。但在相反方向,对真实视频做特效,结果很扎实:从真实素材出发,往里面加 AI 生成的天空、爆炸、生物和魔法。这是一门独立的手艺,有自己的规则:等专门的帖子出来我再讲。

然后是相对去年改变一切的那个数据:音频。Sora 2 和 Veo 3 生成与场景同步的音频,对白包括在内。不久前 AI 视频还是哑的,声音后期加;今天雨有雨声,人物说话嘴唇跟着字走。这不是细节:这是一个实验和一件产品之间的差别。

信息图:用 AI 做视频的三条路,文字、图像和视频起点
三条入口:从文字探索,从图像控制,从视频修改。

五个主要的(以及为什么)

每周都找上我的问题是「哪个最好?」。这是错的问题:它们是五个不同的工具,而当你不再找赢家、开始把每个场景分给最会做它的工具时,工作就变好了。我一个一个讲,按我自己用的方式。

Sora 2(OpenAI)改变了工作的方式:在 Sora 里你不只写提示词,你写项目。你描述脑子里的视频,Sora 把它组织成场景:storyboard 模式让你在时间线上整理每个段落,不喜欢的部分重新生成而不动其余,最长到二十五秒。音频是同步的,而 cameo,也就是把一个反复出现的人(你自己也算)放进场景的能力,让 Sora 的视频一眼能认出来。起步的人我推荐它。Sora 2 指南

Veo 3 和 Veo 3.1(Google DeepMind)是跟随提示词最精确的。它住在 Gemini 和 Flow 里,当前版本照你写的执行:你要一条逆光下雨中的侧向轨道镜头,得到的就是那个场景,运镜和光都照你描述的。原生音频在最好的之列,对白撑得住。这是视频必须和你描述的完全一致时该选的引擎。Veo 3 指南

Kling(快手)把人动得最真实:走路、手势、身体的物理。它是我用来生成 UNSEEN 场景的工具之一,画面里有人动时它仍是我的首选。加上每天刷新的免费积分,它也是不花钱学习的最好方式。Kling AI 指南

Seedance(ByteDance)是五个里跟随长提示词、多个连贯动作最准的。场景有三件事要按顺序发生时,别的模型做两件、丢一件;Seedance 全都照做。刚出的 2.5 版把时长拉到一次生成三十秒,接受最多五十张参考图。如果你写的是戏,不是一张张会动的图,它就是对的引擎。Seedance 指南

Higgsfield是另一样东西:不是模型而是导演平台。里面有多个引擎,Seedance 和 Kling 都在,引擎之上是别人没有的工具:现成的运镜,从轨道到环绕,clip 延长,一次生成到下一次的人物一致性。这是我过日子的地方,也是我用来做参赛项目的工具。Higgsfield 指南把平台、积分和计划讲得很细;想试的话,我每天从 higgsfield.ai 进。

哪个用在哪

这张表总结什么时候选哪个。免费额度上的数字更新到 2026 年 8 月,经常变。

 强项今天免费给什么什么时候选它
Sora 2Storyboard、音频、cameo每天少量生成,低分辨率带水印起步,带对白的场景
Veo 3控制,提示词被跟随包含在 Gemini 免费计划里:Fast 版本每天约 3 条视频(数字非官方,会变)结果忠于提示词
Kling写实,运动每天 66 积分,不用就清零运动中的人,免费学习
Seedance长提示词,时长Dreamina(CapCut)上的免费试用多动作场景
Higgsfield (平台)导演、一致性、运镜注册送试用积分整个项目,从 reel 到短片

不花钱而正经生成 AI 视频的路很少:上面的数字够弄清能试到什么程度,不够用来干活。免费路径的完整清单,收拢并讲解过,在专门的指南里:免费 AI 视频生成

实操中不是选一个工具:是搭一个组合。我用图像模型生成关键帧,用适合场景的引擎动画化,再把项目整个装进一个导演平台里,在那里人物一致性和运镜从一条 clip 稳到下一条。

用 AI 做一条视频,一步一步

我自己的流程,从白纸到发布的视频。完整给你,包括尝试:

  1. 写计划,不是写提示词。碰任何工具之前,我把视频拆成句子:一句话一个镜头。「一个雨夜的女人走在沙滩与水的交界处」是一条 clip。「咖啡馆的招牌映在水洼里」是另一条。三十秒的 reel 是六到八句话。
  2. 立刻选格式。横屏 16:9 给 YouTube 和网站,竖屏 9:16 给 reel 和 Stories。之后改格式等于全部重生成,因为镜头是在格式里诞生的。
  3. 生成第一条 clip。提示词五到八秒,一句一条。第一枪几乎从不够用。
  4. 撑不住的重生成。重生成到 clip 站得住为止:运镜漂、物理塌、细节变。按我的平均,三条 clip 里有一条要重做。这是这个行当的正常成本,不是失败。
  5. 保持人物一致。如果视频里有一张必须不变的脸,方法是先生成人物 sheet:同一个人的系列图,多个视角,远景、脸部近景、侧面、四分之三侧。此后每条 clip 都从这些图作参考出发,人物在场景之间保持可辨认。跳过这一步是人物拍到一半换脸的第一号原因。
  6. 剪。clip 上时间线,按节奏切,加音频。没有模型给你剪辑:视频是在这里变成你的。
  7. 凑近检查细节。手、文字、会变形的物体。AI 视频要慢慢过一遍:惊喜也有,但不能闭着眼发布。
信息图:六步工作流程,从计划到 clip 到剪辑
一个项目的完整路径:从工具之前的书面计划,到最后的剪辑。

怎么写一条管用的视频提示词

每天写提示词写了一年之后,我把一切缩到五个要素,按这个顺序:主体、动作、运镜、光、声音。一个一个来,在同一句话里。

Una donna con l'impermeabile giallo cammina sul bagnasciuga di notte, camera laterale che la segue a passo d'uomo, pioggia fine e insegne colorate riflesse sull'acqua, il suono delle onde e dei suoi passi.

这是我 reel 的一条提示词。它管用因为每个部分决定一件事:有谁、做什么、运镜怎么看她、场景什么光、什么声音伴随。模型不用猜任何东西,错误就少。

而当场景里有情绪,规则是演出来,不是贴标签。「一个忧伤的女人」是标签:模型拿它想干什么就干什么。「她慢慢走,目光向下,肩膀收着,在熄灯的橱窗前停了一瞬」是一场看得见的戏,忧伤从看得见的东西里自己来。在我的提示词里,只要有人物,我永远写她怎么动、看向哪里、和周围是什么关系:差别就在这三件事上。

真正造成差别的规则,我付过学费的:

  • 一条 clip 一个动作。同一条 clip 里两个动作是看物理崩塌最快的方式。两个动作,两条 clip,剪在一起。
  • 一个运镜,或者没有。「固定镜头」是一条有效却少有人用的提示词:模型爱漂,声明镜头不动能稳住一切。否则就一个运动,声明出来:侧向轨道、缓慢推近、环绕。
  • 用肯定的说法。模型不会否定:写「背景没有人群」是让背景出现人群的最稳方式,因为模型捡到的词是「人群」和「背景」。永远改写成你要的:「一个女人独自走在空城」。同一个场景,用有什么来讲,不用没什么来讲。
  • 引擎生成音频时声明它。在 Sora 2 和 Veo 3 上音频写进提示词里要:海浪的声音、远处的车流、人声。不要的话它自己决定,不总是按你想要的。
  • 主体必须留得住时用起始图。文字负责描述,参考负责保证。对固定人物,sheet 是最可靠的解。
信息图:一条真实视频提示词拆成五段彩色,主体、动作、运镜、光、声音
我 reel 的示例提示词,拆成五个部分:每个只决定一件事。

用 AI 做视频多少钱

价格逻辑人人一样:免费试用,付费生产。下面的数字更新到 2026 年 8 月:这个行当每月都在变,决定前再核对官方页面。

工具免费生产
Sora 2每天少量生成,低分辨率,水印ChatGPT Plus(每月约 20 美元)每天约 30 条 720p 视频;Pro 计划去水印、提限额
Veo 3.1包含在 Gemini 免费计划里:Fast 版本每天约 3 条视频(数字非官方)付费的 Google AI 计划;API 每条视频 720-1080p 0.40 美元(4K 0.60 美元)
Kling每天 66 积分,不用就清零Standard 每月约 10 美元(660 积分),之后随积分上涨
SeedanceDreamina(CapCut)免费试用包含在托管它的平台计划里,Higgsfield 也在内
Higgsfield (平台)注册送试用积分月度积分计划;高档位打开 Unlimited 窗口,七天里生成不用数积分
为什么真实成本是尝试,不是订阅。一条完成的视频由 clip 组成,而 clip 的第一版几乎从不是能用的那版:总有地方不行。每次尝试和一次成功消耗的积分一模一样。所以一个项目的账不是「需要多少条 clip」,是「需要的 clip 加上所有错误的尝试」。我预算用的规则:需要十条 clip,按十六次生成算,也就是 clip 加百分之六十。真实数字几乎总在这个估计之下:宁可算宽,别做到一半没了积分。
信息图:AI 视频生产计划的月度成本条形图,从 Kling 到 Higgsfield
生产的入门计划,更新到 2026 年 8 月:真实的账是 clip 加尝试。

什么能做、什么不能(局限,诚实讲)

这里收的是真实的局限,试上几周才会发现的那种,每个旁边有对策。

今天做得非常好的:五到十秒的 clip,画质是电影摄影级别;以前需要一个剧组的光线和氛围;旗舰引擎上的同步音频;用了 sheet 之后保持一致的人物;社交和广告的格式。

还吃力的地方,以及怎么办:

  • 长场景。不久前没有模型能连着过十秒。Seedance 2.5 把上限推到连续三十秒,结果让我惊喜。但即使最好的三十秒也还要剪要接,因为长 clip 里总有一刻会垮。日常工作中我留在五秒的 clip 上;用 Seedance 我到十到十五秒,在那里质量和控制互相平衡。剪辑不是退而求其次:这些视频就是这么做出来的。
  • 唇形。模型的嘴唇在英文和中文里动得好;意大利语是脱节最明显的语言。不是巧合:这些模型很多诞生在中国,而全部主要用英文训练。需要意大利语人声时,我生成画面,声音后期放,和配音行业从来做的一样。
  • 视频里的文字。永远别向模型要:字出来是歪的或编的。文字永远在剪辑里合成。
  • 手和小细节。比一年前好得多,但仍是百分之百要检查的点:一枚换手的戒指,一只自己续满的杯子。发布前逐帧看。
  • 隐形水印。这个你看不见,但它在:即使一段视频显得干净,很多服务也在文件里写了一道隐形签名,声明它是 AI 生成的。TikTok 这类社交有能找到它的工具。如果你透明,这不是问题,而且你必须透明:但知道它存在能省掉意外。
信息图:两栏对比今天 AI 视频做得好的和还吃力的地方,每个限制旁是对策
今天能做什么、还在哪里吃力,每个限制旁边是对策。

版权、水印和商业使用

视频要从手机里出来、进到工作里时,要紧的是这一节。摘要,不替代官方条款,也不替代法律意见。

产出是你的,商业使用总体允许。主要工具的条款承认用户对生成内容的权利,允许商业使用,营销包括在内。例外存在,而且和某些免费计划绑定:永远核对你的计划,不是工具整体。

可见和不可见的水印。免费计划常打可见水印,付费计划里它消失。而正如局限里看到的,下面往往还有隐形签名:它叫来源(provenance),声明文件的 AI 来源,看不见也去不掉。透明不是障碍:是整个行业的方向。

责任在你。如果模型生成了像真人的脸或可辨认的品牌,使用的责任在你。而你发布的平台,从 YouTube 往下,都要求声明 AI 生成或修改的内容:勾那个框不贬低工作,保护你和大家。

我为品牌做工作时永远从许可干净的计划和组合出发:客户签字时,权利链条必须从头到尾可读。

实战案例:从提示词到发布的 reel

给你看一条真实的 reel,从头到尾,让方法落到实处。一条三十秒的竖屏 reel,我自己发的那种。

  1. 故事和颜色。我用三句话定故事,选这一集的色板。我系列的每一集有自己的颜色组合:一个简单的方式让人认出你,关注的人在读到账号名字之前就明白那条视频是我们的。
  2. 人物 sheet。我生成人物各视角的图:远景、脸部近景、侧面。它们用来让人物在 reel 的每条 clip 里保持一样:每次生成都从这里出发。
  3. clip。需要六到八条,每条五到八秒:故事一句话一条。一条接一条生成,永远声明运镜在做什么,撑不住的重生成。
  4. 剪辑。clip 上时间线,按节奏切:每个镜头留多久取决于你在做哪条视频。字幕按视频的颜色和口味选:唯一的固定规则是在任何屏幕上都可读。
  5. 签名。reel 最后我放 end card:两秒,写着 erikataranto.com。这是视频的签名,对应电影里的片尾字幕。它在每个版本上都在,社交的竖版和网站的横版:如果一个文件自己跑出去转,签名跟着它走。

总计:一晚生成,一晚剪辑。最终三十秒,八条 clip,全部从一张 sheet 和提示词里的五个要素诞生。

AI 来拍,你来导

在我的视频里 AI 不是作者:它是剧组。它决定水怎么动、光怎么落、人怎么走。哪些要紧由我决定,写进提示词:你没写的事,AI 才自己发挥。这条也有边界:细节放得越多,视频越有你的样子,但一条 clip 里塞太多指令就会出错。精确靠拆分:更多短 clip,每条更少的动作,而不是一条长 clip 装下一切。

这行的其余部分是导演活,而导演活从有电影那天就存在:决定观众看什么、看多久、什么顺序、声音什么时候进、沉默什么时候来。AI 没有改变这门手艺:它改变的是试一次的成本。从前要一个组和一笔预算;现在一个想法加一个晚上就够。「按下按钮看魔法」式的教程让人失望,原因就在这里:这不是魔法,是一门要学的手艺,而且学着学着就会了。今晚就可以从一条 clip 开始,免费。

而如果你需要视频是为你的品牌,而且更希望天天做这件事的人在你这边:这恰好就是我的工作,从 reel 到广告战役。看看我们怎么合作,或者写信给我:从一个想法开始,把它带到线上。

每个工具的专门指南

这篇指南是 AI 视频这条路的起点。每个工具都有专门的指南,用同一个方法写:真实使用加核实的数字。指南一篇篇出来,而这一页永远是你重新出发的起点:

如果你从图像的世界来:同一条路已经走过了,起点是免费 AI 图像生成

来源

Telegram

想第一时间看到更新和动态,可以加入我的 Telegram 频道

AI 视频工具的最新消息,我都会先发布在那里。

进入频道 →
喜欢吗?分享一下。
评论

发表评论

评论会经过审核后才会公开显示。

你的邮箱不会被公开。

FAQ

常见问题

最好的 AI 视频生成器是哪个? +
不存在唯一的赢家。Sora 2 最自然:你写下项目,它用 storyboard 模式组织成场景。Veo 3 跟随提示词最精确。Kling 在人的运动上最真实。Seedance 跟随长提示词最准,2.5 版到三十秒。Higgsfield 不是模型而是导演平台,托管多个引擎,Seedance 和 Kling 都在。正确的答案是组合:每个场景分给最会做它的工具。
怎么免费创建 AI 视频? +
用免费计划:Kling 每天刷新 66 积分,Sora 每天允许少量较低分辨率的生成,Veo 的 Fast 版本包含在 Gemini 免费计划里,每天约三条视频。一个账户加一句描述场景的话就够。免费教你写提示词;要产出完整视频需要各计划,或者免费 AI 视频指南里收拢的策略。
AI 生成的视频多长? +
单条 clip 一般五到十秒。Seedance 2.5 能一口气到三十秒,但即使最好的结果也要剪要接。完整视频靠多条 clip 剪出来,和电影从来一样。
AI 生成的视频有音频吗? +
旗舰引擎有:Sora 2 和 Veo 3 生成与场景同步的音频,对白包括在内。其他的音频在后期做,而且往往更划算:人声、音乐和混音在模型外面更好控。
用 AI 做视频多少钱? +
起步免费。日常使用每月大约 10 到 25 美元:Kling Standard 约 10 美元起,ChatGPT Plus 20 美元带 Sora,Google AI 计划带 Veo。Veo 走 API 每条视频 0.40 美元。而要算的真实成本是尝试:几乎每条 clip 都要生成不止一次,每次都吃积分。
AI 视频能用于工作和广告吗? +
总体上可以:主要工具都承认用户对生成内容的权利,并允许商业使用,条件以你的计划为准。注意水印:免费计划上的可见水印,以及很多服务写进文件的隐形水印,即使看不见也在,而 TikTok 这类社交平台能检测到。各平台要求声明 AI 生成的内容:永远声明。
做 AI 视频需要强力电脑吗? +
不需要:生成发生在服务的服务器上,电脑只用来开浏览器和剪辑。真正需要的是方法和眼光:会描述场景、会选镜头、会剪。这是导演活,不是算力。
继续阅读
免费 AI 视频生成:2026 年真正可行的路径 指南
2026年9月

免费 AI 视频生成:2026 年真正可行的路径

阅读
Higgsfield:是什么、怎么用、多少钱 指南
2026年9月

Higgsfield:是什么、怎么用、多少钱

阅读
Kling AI:是什么、怎么用、多少钱 指南
2026年9月

Kling AI:是什么、怎么用、多少钱

阅读