你换了主图,接下来两周销量涨了 8%。这是新图的功劳,还是那两周竞品正好断货?没有对照分组,这个问题永远没有答案——亚马逊 A/B 测试要解决的就是这件事。
亚马逊官方的 AB 测试工具叫 Manage Your Experiments,卖家平台中文界面里的正式名字是「管理您的试验」,菜单项显示为「管理试验」,中文圈也常写成「管理实验」。三个说在前面的结论:
- 门槛是硬的:专业销售账户 + 品牌注册 + 品牌代表身份,缺一不可;商品还得「最近几周内获得了足够多的流量」——这是官方原话,具体数字亚马逊没有公开。
- 慢是它的成本:自选时长时官方建议跑 8 至 10 周,用「到显著为止」的预设设置有时 4 周能出结果。
- 它给的是判定,不是统计报告:你会看到哪个版本赢、样本量多少,但公开页面上没有 p 值、没有置信区间、没有判定阈值。
中文网上关于这个工具的内容,几乎全部停在「在哪点、填几步」。那部分本文压缩成一节讲完,剩下的篇幅给中文里基本没人写的三段:假设怎么定、跑多久算数、结果差多少才算真的赢。事实以 2026 年 8 月 15 日 sell.amazon.com 官方页(英文版与中文版对照)实查为准。
一、界面这一节,一次说完
谁能用(官方中文原文):「要访问"管理您的试验",您需要一个专业销售账户。您还需要成为已加入亚马逊品牌注册计划的品牌的品牌代表。」
哪些商品能测(官方中文原文):「如果某个商品属于您的注册品牌,并且最近几周内获得了足够多的流量,能够生成有效的试验结果,则该商品符合"管理您的试验"资格要求。您还必须发布品牌故事或其他 A+ 商品描述才能运行这些类型的试验。」
「足够多的流量」是多少,公开页上没有数字。官方页里「了解有关商品资格的更多信息」指向卖家平台帮助中心,那一页需要登录才看得到正文——本站没有卖家账号,2026-08-15 用普通网页请求取到的只是一个不含正文的外壳页面。结论:任何中文文章给你的具体流量门槛数字都没有公开来源,本文也不给。唯一可靠的确认方式,是打开工具看你的 ASIN 在不在可选列表里。
能测什么(官方原文):「商品图片、商品名称、要点、描述和 A+ 商品描述(包括品牌故事)」。
怎么建:卖家平台主菜单悬停「品牌」→ 选「管理试验」→「创建新试验」→ 选试验类型和主要商品 → 填试验详情(含试验名称和假设)→ 输入版本 B → 「安排试验」。版本 A 是当前已发布的内容,版本 B 是你要测的新版本。按官方说明,默认设置下试验在验证完成后立即开始、跑到有足够数据宣布获胜版本为止,获胜内容也会自动发布。
界面到此为止。下面才是决定这件事有没有价值的部分。
二、一个能测的假设长什么样
建实验时有一栏叫「假设」,多数人在那里填「换个更好的主图」。那不是假设,是愿望。
可测的假设有固定形状:
对 [谁],把 [哪个元素] 从 [现状] 改成 [变体],会提高 [哪个指标],因为 [一条来自证据的机制]。
| 写法 | 例子 | 能不能测 |
|---|---|---|
| 愿望式 | 换一张更专业的主图 | 不能,「更专业」无法落成具体改动 |
| 改动式 | 主图从纯白底换成手持场景图 | 能测,但赢了不知道为什么赢 |
| 假设式 | 对没用过这类工具的新手买家,主图从纯白底换成手持场景图,会提高转化率,因为差评里反复出现「收到才发现比想象中大」,尺寸感知是当前的购买障碍 | 能测,且可复用 |
关键在最后那句「因为」。没有机制的改动,赢了你不知道该把什么经验搬到下一个产品,输了也分不清是方向错还是执行错。一次实验真正的产出不是那几个百分点,是一条能搬去下一个 listing 的规律。
官方给的实验技巧里有一条正好压在这上面:「确保您用于试验的商品描述与当前的商品描述有显著的差异:差异越大,就越可能产生有意义的试验结果,而不是随机出现的结果。」说白了:版本 B 和版本 A 只差一点点,你就是在花八周时间买一堆噪声。
三、用 AI 把已有证据变成候选假设
假设不能靠拍脑袋,它得从你手上已经有的文本证据里长出来。而这些证据的共同特点是:量大、零散、读起来很累——正好是 AI 擅长的活。
| 证据来源 | 能长出哪类假设 | 对应改哪个元素 |
|---|---|---|
| 自家 listing 差评与问答 | 买家的困惑点、预期落差 | 主图、要点、A+ |
| 竞品差评 | 对手没解决、你能解决的痛点 | 要点、品牌故事 |
| 退货原因与客服邮件 | 尺寸/兼容/材质类误解 | 主图、描述 |
| 搜索查询效果报告 | 买家实际用什么词找你 | 标题、要点 |
| 竞品图片与 A+ 的共性 | 这个类目的表达惯例与空缺 | 图片、A+ |
给 AI 的提示词骨架,可以直接改用:
以下是我的 ASIN 近 6 个月的 1-3 星评论(原文附后)。
1. 按「买家实际抱怨的是什么」聚成不超过 8 类,每类给出现次数和 2 条原文引用;
2. 只保留能通过修改 listing 内容(图片/标题/要点/描述/A+)缓解的类别,
属于产品本身或物流的单列一组,不要混进来;
3. 对保留下来的每一类,按下面的格式各写一条假设:
对[谁],把[元素]从[现状]改成[变体],会提高[指标],因为[机制];
4. 每条假设后面必须附它依据的评论条数与序号,找不到出处的不要写。
AI 在这一步的价值不是「想创意」,是把几百条散乱文本压成十条带出处的机制陈述——你自己读 300 条差评,读到第 50 条就开始走神,它不会。站内两篇拆得更细的流程可以直接接上:用 AI 做自家 listing 的差评根因聚类、用 AI 读竞品差评挖产品改进点。
但有两件事必须你来做。
第一,逐条回查出处。模型很擅长把常识写得像是从你的数据里读出来的。每条假设都要能指回具体几条原文,指不回去的直接删掉。
第二,排序你自己定。八到十周一轮,一个 ASIN 一年认真跑不了几轮,排在第七位的假设今年就不会被测到。三个维度够用了:
| 维度 | 高分意味着 |
|---|---|
| 证据强度 | 支撑它的原文条数多、指向一致 |
| 改动幅度 | 版本 B 和版本 A 差得够开,不容易被噪声淹掉 |
| 实现成本 | 素材当天能出,还是要重新拍摄打样 |
变体素材这一环,现在也不是瓶颈了:图片方向可以先看怎么用 AI 生成主图与场景图,A+ 模块文案见用 AI 写 A+ 内容与品牌故事,扒竞品图当参照素材有 ASINCrate 这类批量下载扩展。要提醒一句时效性的:如果版本 B 用到 AI 生成的人物图,亚马逊有对应的元数据标注要求,站内单开过一篇AI 人物图元数据合规,打标工具可以用 DiscloseTag。
四、一次动一个变量,还是用多属性实验
官方是明确提供多属性实验的,原文:「执行多属性试验,以便您同时测试多个页面元素,如商品名称、图片和要点。」
但要清楚这么做换来了什么。多属性实验比的是版本 A 整体对版本 B 整体:赢了,你知道这一组改动合起来更好;你不知道是哪一处在起作用,也不知道其中是不是有一处在拖后腿、只是被另外两处的增益盖住了。
怎么选(这一段是判断,不是官方口径):
- 流量一般、一年跑不了几轮 → 多属性,先把整体转化拉上去,效率优先;
- 流量充足、想积累可复用的类目规律 → 单变量,慢但每轮都留下知识;
- 某一条假设的证据特别强 → 单独测它,别把它混进一堆改动里。
还有一个容易被忽略的组合方式:多属性实验赢了之后,如果这组改动里某一处代价明显更高(比如需要重新拍摄),下一轮可以只把那一处退回版本 A、其余保留,用一次实验反过来量它单独值不值。这样既拿到了整体增益,又把最贵的那处改动单独定了价。
五、跑多久,以及为什么中途不能看了就停
官方原文:「如果您选择自己的持续时间,建议试验运行 8 至 10 周,留出足够的时间来生成具有统计意义的试验结果。如果在试验期内使用预先选择的"具有统计意义"的设置(该设置可以保证试验在有足够的数据来宣布获胜版本后结束),有时只需要 4 周就可以获得试验结果。」
官方技巧里还有一条,比它看起来重要得多:「即使前期结果喜人,但有时也可能具有误导性。运行试验直至完成,帮助确保结果可靠。」
实验前两周的数据波动极大,你天天盯着看,一定会在某一天看到版本 B 领先 20%。这时候停掉、宣布胜利、把版本 B 全线铺开,是 A/B 测试里最经典的一种自欺。注意区分两件事:「到显著为止」是系统按它自己的规则决定何时停止,这不等于你自己盯盘提前收手也同样安全。
还有一个排期上的推论:8 到 10 周一轮,意味着单个 ASIN 一年最多认真跑五六轮。上一节那个排序不是走过场。
实验期间尽量别同时大改广告结构、大幅调价或者赶上大促。理论上这些变化对两个分组同时生效、会被随机分流抵消,但它们会把数据波动放大,直接后果是拉长跑到「足够数据」所需要的时间。
六、亚马逊说「赢了」,究竟说了什么
官方原文:「一旦我们收集到足够的数据来提供具有统计意义的结果,您就会看到每个版本的各项指标表现,例如销售量、销售额、转化率、每位独立访客的销售量和样本量。您还会看到获胜商品描述预计在一年内对您的销售的影响。」
拆开看:
| 亚马逊给了什么 | 亚马逊没给什么 |
|---|---|
| 一个判定结论:哪个版本获胜 | 显著性水平、p 值 |
| 各版本的销售量、销售额、转化率、每位独立访客销售量 | 差异的置信区间 |
| 样本量 | 判定阈值与「到显著为止」采用的具体停止规则 |
| 获胜内容预计一年内对销售的影响 | 原始分组数据,无法自行复核 |
所以正确读法是:你拿到的是平台的判定结论加一组描述性指标,不是一份能自己复核的统计报告。两个方向都别越线——把「亚马逊说 B 赢了」转写成「统计上显著」,是替它宣布了它没公开的东西;反过来说「所以不可信」也同样没有依据,它写明了是在收集到足够数据之后才判定的,只是判定过程没有对外公开。
落到实操,三条:
看样本量再看百分比。样本量本来就是官方列出的指标之一。几十单量级上跑出的一个「赢」,和几千单量级上跑出的「赢」,不是一回事。
「预计一年影响」是外推值。它把实验窗口内的表现按年放大,你的季节性、广告投放、库存状态一变,这个数就不成立。当排序参考可以,别写进预算表。
转化率和每位独立访客销售量要一起看。转化率涨、但每位独立访客销售量没动,通常意味着变化发生在「买不买」上、没发生在「买多少」上——这条区别会影响你下一轮改哪里。想把这些指标和整体转化率放到一起理解,可以看影响亚马逊转化率的因素。
七、赢了怎么固化,没赢怎么归因
赢了:先确认你的实验用的是不是默认设置——按官方说明,默认设置下获胜内容会自动发布,非默认的就得自己上。真正该做的动作在后面:把这条机制写进你自己的 listing 规范,然后横向搬到同系列其他 ASIN 上。注意这里搬的是假设,不是结论——别的 ASIN 受众和价位不同,值得各自再测一次。
没跑赢,或者两版没差别(这其实是最常见的结果),归因就三种:
- 版本 B 和版本 A 差异太小。对上了官方那条技巧,噪声盖过了信号;
- 假设指错了地方。图没问题,瓶颈在价格、评分或配送时效——那些是 listing 内容之外的事,再测多少轮都测不出来;
- 流量不够。实验没能跑到足以分辨差异的精度。
第 2 种和第 3 种在结果页上长得一模一样,都是「没有差别」。分辨办法是先看样本量:样本量本身就偏小,那是第 3 种,换个流量更大的 ASIN 或者延长时长再说;样本量不小还是没差别,那更可能是第 2 种,回到第三节重新排序,把假设换到别的元素上去。把这一轮的结论写进你的假设清单——没赢的实验只要归因写清楚,就不是白跑的。
八、上架前用投票,上架后用官方实验
这两件事经常被混着讨论,其实分工很清楚:上架前用消费者投票平台快速筛掉明显差的方向,上架后用官方实验验证真实成交。前者几小时出结果、按次付费、没有品牌注册门槛,买到的是陌生人看图后说出来的偏好;后者要等 4 到 10 周、需要品牌注册和足够流量,但量的是买家真金白银的行为。
具体到工具选择和价格,站内有一篇拆得很细的:PickFu 中文评测:花小钱让美国真人投票测主图,两者的能力对照表在那篇里,本文不重复。