本文包含联盟链接:通过文中链接注册或购买,我们可能获得佣金,不影响你的价格,也不影响我们的结论。价格与规格信息以 2026年7月21日 实查为准。
用 AI 写亚马逊视频脚本,核心做法是把「讲什么、按什么顺序讲」交给提示词模板生成分镜表和口播文案,拍摄剪辑反而是次要环节。你的 listing 已经有主图、有五点描述、有 A+,唯独视频那一栏是空的。而在搜索结果里,带视频的竞品缩略图上多了个播放按钮——同样的曝光,点击这一步你就先输了半个身位。
先把结论摆前面:产品视频真正难的从来不是拍摄和剪辑,是"讲什么、按什么顺序讲",也就是脚本。而脚本恰好是 AI 最能替你干的一环。这篇把亚马逊三类视频(主图视频、A+ 视频、SBV 广告视频)的分镜脚本和口播文案,拆成能直接喂给 ChatGPT/Claude 的提示词模板——你填空就出稿,再丢进 AI 视频工具生成画面或配音,一条龙走完。跟这篇配套的是 用 AI 生成亚马逊产品图,图和视频是 listing 视觉的两条腿,建议一起看。
先分清三类视频:规格和目的完全不同
搞混规格是新手第一个坑。三类视频挂的位置不一样,能塞多长、给谁看、要达成什么,都不同:
| 视频类型 | 挂在哪 | 目的 | 时长取向 |
|---|---|---|---|
| 主图视频 | 商品详情页主图媒体区 | 让点进来的人一眼看懂"这是什么、怎么用" | 官方允许 1–12 分钟,实战建议整条 20 秒内、核心压前 15 秒 |
| A+ 视频 | A+ 内容模块内 | 已在页面往下看的人,深化品牌与卖点 | 中等,讲清一个模块的信息即可 |
| SBV 广告视频 | Sponsored Brands Video 广告位(搜索结果内) | 花钱买的曝光,几秒内勾住手指停下 | 短,普遍 6–45 秒,开头 3 秒定生死 |
记住这条分工,下面每类的脚本模板都是围着各自的"目的"写的,别拿广告脚本去当主图视频用。
亚马逊视频官方规格速查(2026年7月21日实查)
上传到 listing 的视频,硬性规格以 Amazon 官方页为准(Amazon 官方博客 Product video 页,页面标注 2025年5月12日):
| 项目 | 官方规格 |
|---|---|
| 文件格式 | .mov 或 .mp4 |
| 分辨率 | 最高 1080p(用你能拿到的最高画质) |
| 时长 | 1–12 分钟 |
| 单文件大小 | ≤5 GB |
| 每个 ASIN 视频数 | 最多 4 条 |
| 进主媒体区条件 | 商品图片少于 6 张时,视频才会显示在主图媒体区 |
| 审核时长 | 批准后通常 3 天内上线(旺季可能到 7 个工作日) |
| 上传资格 | 专业卖家账号 + 至少 3 个月销售历史 + 在售 listing(该页口径:不强制品牌注册) |
两点提醒,别读错:
- “1–12 分钟"是官方允许的范围,不是建议值。买家在主图区的注意力只有几秒,整条控制在 20 秒内、把核心卖点压在前 15 秒是转化角度的经验做法(属于第三方/实战经验,不是官方硬性规定),别真拍 12 分钟。
- SBV 广告视频走的是 Amazon Ads 广告规格,和上面这张 listing 视频规格是两套。广告的具体时长/尺寸以你上传时后台界面当时显示的为准;网上普遍说的 6–45 秒、建议横版,是第三方综述口径,投放前请以后台实时要求核对。
主图视频:AI 写"演示型"分镜脚本
主图视频的黄金结构是"钩子 → 是什么 → 怎么用 → 差异点 → 收尾”。用下面这个提示词,把你的产品信息填进去,AI 会吐出一份带时间轴的分镜表:
你是资深亚马逊产品视频编剧。为下面这款产品写一份「主图视频」分镜脚本,
用于商品详情页主图区,目标是让点进来的买家在前 15 秒看懂产品并产生购买意向。
产品名:{产品名}
品类:{品类,如 厨房不锈钢刨丝器}
核心卖点(按重要度排):{卖点1} / {卖点2} / {卖点3}
目标人群:{目标人群,如 常做饭的家庭主厨}
主要使用场景:{场景,如 厨房台面备菜}
要求:
1. 总时长控制在 20 秒内,输出一张分镜表,列:镜号 / 时间区间 / 画面内容(拍什么、怎么运镜)/ 屏幕文字。
2. 第一个镜头必须是"钩子"——用痛点或效果直接抓住注意力,不要 logo 开场。
3. 中间镜头演示"怎么用",一个镜头只讲一件事。
4. 结尾给一个清晰的产品全貌 + 一句购买理由。
5. 全程可无声看懂(很多买家静音),关键信息用屏幕文字承载。
拿到分镜后,再让它配套写口播(如果你要加旁白/字幕):
基于上面的分镜脚本,为每个镜号写一句口播文案,
口语、短句、每句不超过 15 个字,节奏跟得上画面切换,不要念参数堆砌,
突出"买家能得到什么"而不是"产品有什么功能"。
填好长什么样?拿一款"便携榨汁杯"举例,AI 按上面模板吐出的分镜大致是这样(示例,你替换成自己的产品即可):
| 镜号 | 时间 | 画面 | 屏幕文字 |
|---|---|---|---|
| 1 | 0–3s | 特写:健身包侧袋抽出榨汁杯,一按启动,果汁翻涌 | 3 秒,一杯现打果汁 |
| 2 | 3–8s | 俯拍:丢入水果块 + 倒水,盖盖,长按启动 | 水果+水,一键搞定 |
| 3 | 8–13s | 手持边走边喝,杯身充电口特写 | USB 充电,出门带着走 |
| 4 | 13–18s | 拆开刀头冲洗,水流冲净 | 刀头可拆,冲一下就干净 |
| 5 | 18–20s | 产品全貌 + 多色摆台 | 现打现喝,选你的颜色 |
看得出来,AI 出的不是成片,是一张"照着拍就行"的施工图——省掉的正是对着空白页纠结"先拍哪个、字幕写啥"的那半天。
A+ 视频:AI 写"卖点深化型"脚本
A+ 视频面对的是已经往下滑、有兴趣的人,可以讲得比主图视频细。它更适合"围绕一个卖点讲透",而不是面面俱到。提示词换个目标:
为下面产品写一段「A+ 内容视频」脚本,嵌在 A+ 模块中,
面向已对产品感兴趣、正在了解细节的买家,目标是打消一个具体顾虑。
产品名:{产品名}
本条视频要主打的单一卖点:{一个卖点,如 刀刃食品级不锈钢、洗碗机可洗}
买家最常见的顾虑:{顾虑,如 会不会生锈、好不好清洗}
要求:
1. 时长 30–60 秒,分镜表格式(镜号/时间/画面/屏幕文字)。
2. 结构:抛出顾虑 → 用画面证明卖点 → 给一个可信的细节(特写/对比/实测演示)。
3. 只讲这一个卖点,不发散。
4. 口吻与品牌调性一致:{品牌调性,如 专业、耐用、家用亲和}。
A+ 视频建议和 A+ 内容文案 用同一套卖点框架来写,视频讲的和图文讲的对得上,整个 A+ 才像一个整体,而不是各说各话。
SBV 广告视频:AI 写"3 秒钩子型"脚本
广告视频是花钱买的曝光,规则只有一条:前 3 秒留不住人,后面拍得再好也白搭。所以脚本要把最狠的钩子放最前面:
为下面产品写一段「Sponsored Brands Video」广告脚本,投放在亚马逊搜索结果广告位,
自动循环播放、默认静音,目标是让刷到的人停下并点进 listing。
产品名:{产品名}
一句话卖点(最强的那个):{一句话卖点}
目标搜索词场景:{买家在搜什么,如 便携榨汁杯}
要求:
1. 总时长 15 秒以内,分镜表(镜号/时间/画面/屏幕文字)。
2. 第 1 秒就出现"效果画面"或"痛点画面",不要品牌 logo 开场、不要缓慢铺垫。
3. 全程静音可懂,核心信息全部用大字幕承载。
4. 画面里不得出现价格、"最佳/第一"等绝对化用语、以及非本产品的品牌元素。
5. 结尾停在产品清晰全貌 + 一句行动号召。
第 4 条那几个限制不是我加的规矩,是广告审核的常见拒因,写进 prompt 让 AI 一开始就避开,能省一轮返工。
脚本写完,怎么变成真视频
脚本是骨架,接下来两条路:
- 有实拍素材:把产品的实拍片段、主图、场景图按分镜表剪辑。像 Vizard 这类 AI 视频工具,能把长素材按脚本自动切成带字幕的短视频、自动加口播字幕,省掉手动对轴的功夫——你把上面 AI 写好的口播文案贴进去当字幕脚本即可。
- 没有实拍、只想先出个草样:可以先用脚本配合 AI 生图/生视频做个演示 demo 自己看效果,但上主图区的正式视频必须基于真实产品拍摄——这条和主图的合规逻辑一样:纯 AI 凭空生成、和实物对不上的产品演示,有被判违规的风险,别拿去当正式 listing 视频。想深入这条合规边界,看 用 AI 生成亚马逊产品图 里"哪种能造、哪种只能修"那一节,视频同理。
配音环节同理:AI 可以生成口播语音,但产品的真实展示画面不能造假。
几个容易翻车的点
- 静音优先:三类视频的绝大多数观看都是静音的,所有关键信息必须用画面和字幕表达,别把卖点只放在旁白里。
- 别把参数当卖点念:AI 默认容易堆功能参数,prompt 里一定要写明"讲买家能得到什么",否则出来的脚本像说明书。
- 屏幕文字别踩绝对化用语:静音视频靠字幕承载信息,而"第一/最好/100%“这类词是广告和 listing 审核的高频拒因,写 prompt 时就让它避开。
- 一条视频只干一件事:主图视频讲"是什么怎么用”,A+ 视频讲透一个卖点,广告视频勾住停留——目标混在一起,哪个都讲不好。
把脚本这一环用 AI 拿下之后,产品视频的门槛就从"会不会做视频"降到"会不会填模板"了。先按上面的 prompt 各出一版,再挑最顺的那条去生成,比对着空白页发愁快得多。