WhatsApp A/B 测试:如何正确测试群发
AndySendy academy
← 全部文章

🧪 不会骗人的 WhatsApp A/B 测试

按文件上下半分——测试还没开始就废了。CRM 常按添加日期排序,「上半」往往比「下半」更新、更温。A 比 B 好十倍——不是文案赢了,是受众年龄不同。

多数 WhatsApp「A/B」不是测试:两个文案、两个受众、不同时间、多变量同时改。结果看起来可信,却答不了「哪个文案有效」。

2026 年代价更高:WABA 单独评估每个模板;差变体的投诉可能把账号打到 Low Quality;无随机化就是在烧号——见 WABA 与模板


什么是 A/B,什么是混乱

A/B = 两个可比细分上的两个版本,仅一个元素不同。同时改 offer、长度、CTA、发送时间——是猜,不是测。

WhatsApp Business Suite 无内置分流——无随机切分、无显著性计算器,全靠运营与外部 CRM。

第三种:一个号连发 5–10 个不同文案「找赢家更快」——Meta 会读成 spam 脚本——见 封号机制

测试是 controlled experiment,不是乱枪打鸟。


错误 1:名单对半切

前半 A、后半 B——听起来像随机,实为按时间切。

小案例。 2000 客户:前 1000 行(本月)A 得 35% 回复,后 1000(两年老库)B 得 2% 并连环封号。「A 文案完美」是错的——比的是温 vs 冷——见 温名单 vs 冷名单

做法 - 切分前先 shuffle(表格随机函数或 CRM 抽样),不要按位置切——见 名单分层


单变量规则

一次只改一个元素:仅首句、仅结尾提问、仅长度、仅 {{1}} 个性化。正文其余完全一致。

同时改 offer 与语气——有结果,无原因。


每变体 200 还是 500?

200/变体是运营实践参考,非统计标准。分流测试手册常提 500+ 更可靠。无万能数字——取决于基准转化与要捕捉的效应大小。

来源 样本
群发运营 200–500/变体 实践参考
分流手册 500+/变体 更严
30–50 一组 - 随机波动,无效

只有 200? 仍可做——当假设,非终局结论。下轮在大名单复核。


以什么指标定胜负

首触「不算点击算回复」需细化。

首触技术上没有点击指标:陌生号码发来的链接在对方保存联系人或回复前不可点。不是点击不重要——首触里它根本不能当 KPI。

Response Rate 与开启对话数——首触主指标——见 指标仪表盘。对话已开始、发目录/方案/链接——点击与转化再次有意义。

Read Rate——仪表盘最不可靠——见 已读不回。15–25% 关已读;许多人仅看推送不打开聊天——CRM 仍显示 delivered。

指标 首触可靠性
Response Rate
Read Rate
链接 CTR 首触无意义
举报 WABA 关键

投诉与模板质量:测试的隐形部分

WABA 每变体单独模板,Meta 分别计投诉。举报超送达 0.1–0.2% → Low Quality,测试中途模板被禁。

高 Response + 投诉上升 ≠ 赢家——是账号风险。 回复与投诉趋势一起看。


正确启动

A/B 同一天同一小时发,否则测的是周几/时段活跃度。周一早 A、周五晚 B——分析前结果已废。

发送速度与间隔两边一致。同一账号、等组等延迟但语义差极大,可能触发「试文案」安全标记。语气、结构、发送长度越接近,标记越少。


小案例:提问 vs 推介

商业地产:1000 冷零售联系人 → 两组各 500 随机。

A——带方案链接的推介。B——短情境问:「是否在 [城市] 扩店还是点位冻结?」A:Response 1.2%,两号因举报损失。B:29%,无封;完整推介仅给回复者第二步。

不等于提问永远好 10 倍——规模专属于该冷 B2B 案例。方向符合首触逻辑:邀对话优于立刻推销。

论坛案例——无公开方法学验证。


小测赢 ≠ 立刻全量

200–500 样本只确认对文案的初反应。扩到数万会触发限速、Meta 过滤、长期投诉累积。

小测赢家 = 扩量假设,非保证。分阶段放量,每步盯投诉——见 文案 vs 账号诊断


启动前清单

  1. 随机分,非列表位置(时间、字母、ID)
  2. 变体间仅差一个元素
  3. 每变体 200–500+——视结果重要性与能否复核
  4. 同天同时启动
  5. 相同速度与间隔
  6. 首触默认指标——Response Rate 与对话数,非 read/点击
  7. 分变体盯投诉,警报约 0.1–0.2% 送达
  8. 不早停——早停易选出随机「赢家」

🎯 下一步

下次群发前查当前 split:名单怎么分的?差几个变量?任一项「不确定」——重算旧结果,别扩量。

结论

实用规则:

无随机化的测试不是 A/B——是比较两个受众,碰巧看起来像比较两个文案。