很多人订阅 Google AI Pro 以后,第一反应是三个入口来回点:Gemini 能生成视频,Flow 也能生成,Google Vids 里同样有 AI Video。看起来功能重复,真正用起来却很容易越试越乱,积分也在一次次“抽卡”里消耗掉。
我把这三个工具连续跑了一遍以后,逐渐形成了一套比较稳定的 Google AI 视频工作流:Gemini 负责快速验证想法,Flow 负责正式生产镜头,Google Vids 负责把多个片段拼成完整故事。
这套流程不是为了把事情弄复杂。恰恰相反,它解决的是一个常见问题:不要指望一个 Prompt、一个工具,一次完成从创意到成片的所有工作。
先记住三个工具的分工
Gemini 是试验台。它适合快速测试题材、主体、动作和镜头方向。第一轮只判断创意能不能成立,不必一上来就写很长的 Prompt,更不必把每次测试都当作最终镜头。
Google Flow 是镜头生产区。一个系列建一个 Project,把角色图、场景图、Prompt 和生成片段放在一起。这里适合选择模型、管理素材,并把已经验证过的方向做成正式镜头。
Google Vids 是时间线。它负责导入或生成多个片段,再做排序、裁切、字幕、声音和转场。它解决的不是“这一帧好不好看”,而是多个镜头能不能成为一条完整视频。
如果你只做一条简单的 4 至 10 秒概念视频,Gemini 或 Flow 选一个就够了。只有当项目涉及固定角色、多镜头、系列内容或持续生产时,完整工作流才真正有价值。
先拆镜头,再写 Prompt
生成前先回答四个问题:最终做横屏还是竖屏?成片是 10 秒,还是 30 至 60 秒?有没有必须保持不变的人物、产品或场景?整条视频需要几个主要动作?
例如“一个人深夜回家做咖喱饭”,不要直接要求模型在 10 秒里同时完成进门、洗菜、切菜、炒制、装盘和吃饭。更稳的办法是拆成四到五个镜头,每个镜头只解决一个主要动作。
拆镜头的意义,不只是让模型更容易理解。哪个片段失败,就只重做哪个片段,不必整条视频推倒重来。对企业内容团队来说,这也方便把镜头分配、审核意见和素材版本说清楚。
需要一致性,先把首帧锁住
如果项目很在意人物长相、服装、产品外观、场景构图或 IP 角色,先生成一张首帧图片。首帧至少要锁定角色与服装、场景布局、摄影机位置、光线方向和关键道具。
随后做图片转视频时,提示词重点写“怎么动”,不必重新描述整幅画面。例如:
使用上传图片作为准确首帧。人物立即开始切菜,锅内蒸汽持续上升,两名助手从后方经过,摄影机缓慢向前推进。保持人物外观、厨房布局和光线一致。
这不能保证每次都完全一致,但通常比每一轮都让模型重新猜角色更可控。Google Vids 的官方帮助也建议,动画化静态图片时应重点描述画面元素和摄影机如何运动,重复描述原画反而可能干扰结果。
让三个工具按顺序工作
第一步,在 Gemini 验证三件事:主体对不对、主要动作对不对、镜头运动方向对不对。如果主体都错了,继续补灯光、材质和电影感没有意义。先把最基本的动作关系跑通,再决定是否值得进入 Flow。
第二步,到 Flow 正式生产镜头。截至 2026 年 8 月 20 日,Flow 提供 Veo 3.1 Lite、Fast、Quality 和 Gemini Omni Flash 等模型,不同模型支持的片长、生成方式和积分不同。我的选择逻辑很简单:Lite 或 Fast 用来测试构图与动作;Omni Flash 用于 4、6、8、10 秒短片或视频编辑;Quality 留给最终关键镜头。
Google AI Pro 当前包含每月 1000 Flow credits。非 Ultra 用户当前每次 generation 的成本为:Lite 10、Fast 20、Quality 100;Omni Flash 的 4、6、8、10 秒分别为 15、20、25、30,视频编辑为 40。这里按 generation 计费,不一定等于一次点击;一个请求产生两个结果,可能扣两次。积分会调整,提交前仍要看生成按钮附近的当前模型和实际成本。
第三步,多镜头项目再进入 Google Vids。以一条 40 秒料理短片为例,可以拆成准备食材、切配、煎炒、装盘、坐下吃饭五段,每段生成后插入时间线,再调整顺序、裁切长度、字幕、音乐和转场。
Google Vids 当前生成规格为 720p、24fps,支持 16:9 和 9:16,生成时最多可加入 7 张参考图。多数用户每月可生成约 50 个片段;Google AI Pro 和 Ultra 的家庭共享方案会共用月度额度。因此我不会在 Vids 里大量试错,而是先在 Gemini 或 Flow 把首帧和 Prompt 定下来。
一套够用的 Prompt 骨架
下面这套结构适合多数 10 秒图片转视频:
FORMAT
10-second vertical cinematic video, 9:16.
REFERENCE
Use the uploaded image as the exact first frame.
SUBJECT ACTION
主体做什么,只写一个主要动作。
TIMELINE
0–3 seconds: 第一个动作。
3–6 seconds: 动作继续或发生变化。
6–8 seconds: 关键瞬间。
8–10 seconds: 收束动作。
CAMERA
摄影机如何运动。
ENVIRONMENT
背景中哪些元素运动。
CONSISTENCY
哪些人物、服装、道具和场景不能变化。
AVOID
No morphing. No duplicate characters.
No disappearing objects. No sudden camera cuts.
No costume changes.
这不是越长越好的“万能 Prompt”。简单镜头可以删掉不需要的模块。真正重要的只有三件事:主动作明确、时间顺序明确、不允许变化的内容明确。
最容易失败的四个地方
一个镜头塞太多剧情。动作越多,角色和道具越容易失控。
没有首帧,却要求角色长期一致。模型每次都要重新猜角色,自然容易漂移。
测试阶段直接用最高成本模型。方向还没确认,画质再高也只是昂贵的废片。
把生成当成剪辑。模型负责产出镜头,节奏、取舍、字幕和声音仍需要在时间线上完成。
开工前再确认六件事:成片比例和总时长已经确定;故事拆成了单一动作镜头;需要一致性的角色或产品已有首帧;Gemini 只验证主体、动作和镜头;Flow 提交前看过当前模型和积分;多镜头项目为 Vids 预留了额度。
我的核心判断没有变:AI 视频做得稳,不是因为找到了一个无所不能的模型,而是把创意验证、镜头生产和成片整理拆开了。
Gemini 负责试,Flow 负责做,Google Vids 负责拼。先跑通一条最小闭环,再慢慢增加镜头、角色和复杂动作,比一开始追求“一句话生成大片”更实际。
功能、模型、积分和额度核验时间为 2026 年 8 月 20 日。不同地区、账号、订阅方案和系统容量可能不同,请以生成界面和 Google 官方说明为准。
如需把选题、脚本、素材、审核和发布梳理成可重复执行的企业内容流程,可以联系煜企智能,从现有团队、常用工具和最耗时间的环节开始评估。


