
一个卖收纳柜的店主开了 Veo 3.1,第一件事是写了句"做一条收纳柜的带货视频,30 秒,有讲解有卖点"。出来的东西能看,但一条也用不上:柜门开合的方向和实物不一样,画面里凭空多了一盆植物,背景墙上还有一行看不懂的英文字。他的结论是"这玩意儿还不行"。
问题不在模型,在任务给错了。Veo 3.1 是 Google 的 AI 视频生成模型,能把一段文字或者一张图变成几秒到十几秒的短视频——它的强项是把一个确定的画面动起来,不是替你策划一条完整的带货片。一条 30 秒的带货视频是由若干段 5–10 秒的镜头剪出来的,Veo 3.1 负责的是其中那些"可以由静图长出来"的段落。
所以更有用的问法是:店里哪些位置要用视频,这些位置里哪几段镜头能交给它。下面按这个思路把活拆成 10 类,每类说清适合什么品类、你要准备什么素材、以及一段能直接抄的提示词。
这类值得优先补上。 淘宝、抖店、拼多多的主图位都支持一段几秒的视频,很多店是空着的,而这段恰好只需要商品自己动——不需要人、不需要剧情。
以这张图为唯一依据,让镜头围绕画面中的商品缓慢水平环绕约 30 度,商品保持静止不动,外形、颜色、按键和接口位置与原图完全一致,不新增任何物体,不出现任何文字,柔和室内光,真实摄影质感,时长 5 秒。
关键是那句"以这张图为唯一依据"和"不新增任何物体"。少了这两句,模型容易自己给你加道具。
这类的作用是把详情页里某个静态卖点变成一小段循环。 比如折叠、伸缩、开合、旋转这种"一句话说不清、一看就懂"的结构。
以这张图为准,画面中的折叠置物架从展开状态缓慢收拢至扁平,动作连续一次完成,结构与原图一致,层板数量不变,不出现人手以外的其他物体,固定机位,浅景深,时长 6 秒。
注意一条镜头只做一个动作。一句提示词里塞"先打开再旋转再放东西",出来基本是糊的。
这是 Veo 3.1 表现比较稳的一类。 镜头只往前推,画面变化小,模型发挥空间小,翻车概率也就低。
以这张针织面料图为准,镜头从中景极缓慢推近到纹理特写,织法、颜色和起球程度与原图完全一致,不改变纤维走向,自然侧光,微距质感,无文字,时长 5 秒。
能做,但要把"数量和包装文字"锁死。 开箱镜头最常见的翻车是盒子上的 logo 被重画、赠品数量变了。
以这两张图为准,第一张为起始画面,第二张为结束画面,一双手从画面下方入镜缓慢揭开礼盒上盖,盒内物品数量、摆放位置和包装上的图案文字与第二张图完全一致,不新增不减少任何物品,俯拍固定机位,暖色室内光,时长 8 秒。
能做小幅操作,别做复杂人机交互。 单手握持、按一下按钮、倒出内容物这类幅度小的动作可用;穿戴、组装、多步操作建议实拍。
以这张图为准,一只手握住画面中的手持吸尘器,拇指按下开关,机身保持原图外形与配色,手部结构正常手指数量正确,背景为浅色家居地面,自然光,中景固定机位,不出现文字,时长 6 秒。
手部是高风险区。出图后逐帧看手指,有问题就改成不露手的版本。
这类是 Veo 3.1 相对自由的一块,可以让它多发挥。 画面重点是环境和光线而不是产品结构,容错高。
一间清晨的日式客厅,窗外薄雾,阳光斜斜打在原木茶几上,茶几上放着一只素色陶瓷杯,热气缓慢上升,窗帘被微风吹动,固定机位,电影感冷暖对比,无文字,时长 6 秒。
氛围片段可以纯文生视频,不一定要底图——但如果画面里要出现你自家的具体商品,还是上图生视频。
能做"场景变化"的对比,不能做"效果承诺"的对比。 收纳前乱、收纳后整齐这种空间状态变化可以;护肤前后皮肤变好、清洁剂一擦就新这种涉及功效宣称的别做——既不真实,也容易踩合规线。
以这张图为准,镜头固定不动,画面中桌面上散落的线材与杂物被逐步收进桌下的收纳盒,最终呈现整洁桌面,桌子、收纳盒和显示器的外形与原图一致,不新增家具,室内自然光,时长 8 秒。
适合一个链接卖一整套的情况。 让镜头在几件商品之间平移,比把它们塞成一张静态图更容易看清各件。
以这张俯拍平铺图为准,镜头从画面左侧向右侧平缓横移,依次经过四件餐具,每件的器型、颜色和数量与原图完全一致,不新增餐具或食物,浅灰色背景,均匀柔光,俯拍视角,无文字,时长 7 秒。
这类对"独特性"要求不高,是性价比高的用法。 开播前和空档期需要几段能循环播的短素材,画面好看就够。
用视频的某一帧当封面,比单独出一张图更容易和内容对得上。 做法是先生成一段 5 秒的商品动态镜头,再从里面截一帧清晰的画面做封面底图,文字后期加。
以这张图为准,镜头缓慢从商品侧面移动到正面并停住,最后两秒保持静止构图居中,商品外形颜色与原图一致,不新增物体,不出现文字,画面比例 9:16,顶部和底部留出干净区域,时长 5 秒。
最后那句"留出干净区域"很实用——后期加标题时不用担心压到商品。
| 不要交给它 | 原因 | 替代做法 |
|---|---|---|
| 一键生成完整带货视频 | 一条片子是多段镜头剪出来的,整体叙事与文案它控不住 | 分镜头生成,后期剪,流程见《Veo 3.1 怎么做带货视频》 |
| 画面内的文字、价格、参数 | 生成环节的文字容易变形出错 | 让它留干净区域,文字后期加 |
| 人物口播讲解 | 文案不可控、口型和音色不稳 | 交数字人或真人录 |
| 没有实物原型的新品演示 | 结构靠模型想象=货不对板 | 等实物或实拍图 |
三句话定:
国内直接在 AI生成中文站的 Veo 工具页 中文在线使用,无需翻墙,按次计费,试错成本是可控的。但别一上来就批量跑——先拿一款商品把一类镜头跑通,确认提示词稳定了再复制到其他款。
Veo 3.1 必须上传图片才能生成吗?
不必须。它支持纯文字生成,也支持上传图片做图生视频。但电商用途里,凡是画面要出现你自己的商品,都建议上传实拍图走图生视频——文生视频生成的"类似商品"结构是模型想象的,用在商品页上属于货不对板。
一段视频最多能生成多久?
单段是秒级的短片,做长片靠多段拼接。具体时长和分辨率规格见《Veo 3.1 能生成多长视频》。实际做电商素材,单段 5–8 秒反而更好用——短段落动作简单,翻车率低,剪的时候也灵活。
同一段提示词能套到不同商品上吗?
能,而且建议这么做。把提示词里描述商品的那一句改成可替换的位置,其余约束句(以原图为准、不新增物体、不出现文字、机位、光线)保持不动,就是一个可复用的模板。注意同材质的商品放在一起跑,金属件和布艺件的光线要求不一样。
生成的视频上传平台会被判违规吗?
内容本身不会因为"由 AI 生成"而被判违规,但两条要注意:一是画面要和实物一致,不能让买家误解产品结构或功效;二是如果视频里出现看起来像真人的虚拟人物,按平台要求和现行标识规定做 AI 生成标注。
出来的视频商品变形、画面乱怎么办?
先别换模型。常见原因是提示词里缺约束句、底图本身不正、或者一条镜头塞了太多动作。按类型逐项排查的改法见《Veo 3.1 做的商品视频翻车了怎么救》。
把 Veo 3.1 当成一个"会让静图动起来"的镜头工,而不是导演,这 10 类活就都顺了。先从主图视频开始,一款一款跑通,比一上来要一条完整片子有用得多。