营销人争论多年——提问还是直推、要不要姓名、长短如何。靠自家名单 split test 定案,不靠直觉或别人的博客案例。如何公平分组、样本要多大才不把随机当规律、优先测什么。
WhatsApp Cloud API 没有内置「启动 A/B 测试」按钮。营销人注册独立模板,经 CRM 或群发平台手动分流——见 WABA 拆解。纪律:分组、发变体、记录、决策。
之前: 每变体至少 200 联系人才有可靠结果。
之后: 每变体 200–500——行业常见下限,略稳结果。无 Meta 官方标准。部分人用 500+ 更放心;每变体 50 号多为噪声。200 是速度与稳定性的折中——小样本 5–10 百分点差可能是随机。
| 指标 | 含义 | 限制 |
|---|---|---|
| Delivered | 到设备 | 不代表兴趣 |
| Read(蓝勾) | 已打开 | 约四分之一关已读回执——系统性偏低 |
| Response Rate | 用户回复 | 最佳成功标记 |
| 投诉/封锁 | 负面反应 | 转化好也可 kill 变体 |
最佳标记 = delivered + 用户 inbound 文字回复,非 read 本身——名单分段记录各段状态。
顺序:开聊前可见元素——在首条冷消息结构框架内:
规则: 一次只改一个参数。同时改长度+姓名+CTA = 猜谜,非测试。
分销商对冷名单供应商 A/B,每变体 300 号。A(陈述+附件):第 40 条测试号封禁——停用词、举报。B(问句):32% 回复率,0 封锁——见群发封禁机制。
表明: 300 样本差在号码存活,非仅回复率。未证明: 问句恒为 32%。
第二案:网校 2000 线索各 1000。长课程 pitch vs 短「[姓名],今晚 19:00 闭门复盘开始,链接发这里?」短版 webinar 点击 +180%——个案,仅示方向。
首条冷消息测链接无意义。 未存号/未回复前链接不可点——首触比「网站链 vs 频道链」是方法错误。
灰号同时多实验危险。 短时段一号码大量不同文本 = 脚本模式——行为反垃圾——与测试结果无关的风险。
小样本赢家不自动可 scale。 200–300 测文案 viability;5 万 blast 另有吞吐、速度、数小时累积投诉——小测反映不了。
「像 email 一次 10 个变体」 - 错。单号 mass 内容实验像 spam 模式。
「200 赢了立刻灌 5 万」 - 错。小测 ≠ scale 负载画像。
「蓝勾绝对准」 - 错。看回复转化或目标动作。
「整段换文案看谁好」 - 错。无法 isolate 哪个元素起作用。
拿现首条模板,定一条假设——如问句替陈述。下一批联系人 50/50 分流,比回复占比而非打开率。
实践规则:
测收件人愿意回复的,不是你喜欢的——唯一不骗人的指标。