按文件上下半分——测试还没开始就废了。CRM 常按添加日期排序,「上半」往往比「下半」更新、更温。A 比 B 好十倍——不是文案赢了,是受众年龄不同。
多数 WhatsApp「A/B」不是测试:两个文案、两个受众、不同时间、多变量同时改。结果看起来可信,却答不了「哪个文案有效」。
2026 年代价更高:WABA 单独评估每个模板;差变体的投诉可能把账号打到 Low Quality;无随机化就是在烧号——见 WABA 与模板。
A/B = 两个可比细分上的两个版本,仅一个元素不同。同时改 offer、长度、CTA、发送时间——是猜,不是测。
WhatsApp Business Suite 无内置分流——无随机切分、无显著性计算器,全靠运营与外部 CRM。
第三种:一个号连发 5–10 个不同文案「找赢家更快」——Meta 会读成 spam 脚本——见 封号机制。
测试是 controlled experiment,不是乱枪打鸟。
前半 A、后半 B——听起来像随机,实为按时间切。
小案例。 2000 客户:前 1000 行(本月)A 得 35% 回复,后 1000(两年老库)B 得 2% 并连环封号。「A 文案完美」是错的——比的是温 vs 冷——见 温名单 vs 冷名单。
做法 - 切分前先 shuffle(表格随机函数或 CRM 抽样),不要按位置切——见 名单分层。
一次只改一个元素:仅首句、仅结尾提问、仅长度、仅 {{1}} 个性化。正文其余完全一致。
同时改 offer 与语气——有结果,无原因。
200/变体是运营实践参考,非统计标准。分流测试手册常提 500+ 更可靠。无万能数字——取决于基准转化与要捕捉的效应大小。
| 来源 | 样本 | |
|---|---|---|
| 群发运营 | 200–500/变体 | 实践参考 |
| 分流手册 | 500+/变体 | 更严 |
| 30–50 一组 | - | 随机波动,无效 |
只有 200? 仍可做——当假设,非终局结论。下轮在大名单复核。
首触「不算点击算回复」需细化。
首触技术上没有点击指标:陌生号码发来的链接在对方保存联系人或回复前不可点。不是点击不重要——首触里它根本不能当 KPI。
Response Rate 与开启对话数——首触主指标——见 指标仪表盘。对话已开始、发目录/方案/链接——点击与转化再次有意义。
Read Rate——仪表盘最不可靠——见 已读不回。15–25% 关已读;许多人仅看推送不打开聊天——CRM 仍显示 delivered。
| 指标 | 首触可靠性 |
|---|---|
| Response Rate | 高 |
| Read Rate | 低 |
| 链接 CTR | 首触无意义 |
| 举报 | WABA 关键 |
WABA 每变体单独模板,Meta 分别计投诉。举报超送达 0.1–0.2% → Low Quality,测试中途模板被禁。
高 Response + 投诉上升 ≠ 赢家——是账号风险。 回复与投诉趋势一起看。
A/B 同一天同一小时发,否则测的是周几/时段活跃度。周一早 A、周五晚 B——分析前结果已废。
发送速度与间隔两边一致。同一账号、等组等延迟但语义差极大,可能触发「试文案」安全标记。语气、结构、发送长度越接近,标记越少。
商业地产:1000 冷零售联系人 → 两组各 500 随机。
A——带方案链接的推介。B——短情境问:「是否在 [城市] 扩店还是点位冻结?」A:Response 1.2%,两号因举报损失。B:29%,无封;完整推介仅给回复者第二步。
不等于提问永远好 10 倍——规模专属于该冷 B2B 案例。方向符合首触逻辑:邀对话优于立刻推销。
论坛案例——无公开方法学验证。
200–500 样本只确认对文案的初反应。扩到数万会触发限速、Meta 过滤、长期投诉累积。
小测赢家 = 扩量假设,非保证。分阶段放量,每步盯投诉——见 文案 vs 账号诊断。
下次群发前查当前 split:名单怎么分的?差几个变量?任一项「不确定」——重算旧结果,别扩量。
实用规则:
无随机化的测试不是 A/B——是比较两个受众,碰巧看起来像比较两个文案。