为什么 MMM 需要因果验证
MMM 本质上是一个回归模型:它发现的是相关性,不是因果性。模型告诉你"TikTok 花费和销售额正相关",但无法证明"是 TikTok 广告导致了销售额增长"——也许只是因为 Q4 旺季,两者同时上升。
这个问题在以下场景中尤其危险:
- 预算转移决策:如果相关性是虚假的,把预算从 Google 转到 TikTok 可能导致收入下降而非增长
- 对 CFO/董事会汇报:财务团队天然质疑回归模型的因果有效性,没有实验验证很难获得信任
- 渠道效果变化:竞争加剧或受众饱和后,历史相关关系可能不再成立
核心矛盾:MMM 用 2-3 年历史数据建模,但你要做的是未来预算决策。历史相关性不能保证未来因果性。
Geo 实验设计方法
Geo Experimentation(地理实验)是解决因果性问题的金标准。核心思路:将地理区域(城市、州、DMA)随机分为对照组和处理组,对处理组施加额外的广告投放,然后比较两组的增量效果。
三种主流设计
- Matched Market Design:用聚类算法找到与目标市场在人口、消费行为、历史销售上相似的对照组。Meta 的 GeoLift 和 Google 的 GLO 支持。
- Randomized Geo Design:直接随机分配地理区域。当区域数量足够多(>20 个)时效果好,但可能产生不平衡的对照组。
- Switchback Design:在时间维度上交替开关广告。适合短期实验(1-2 周),但可能受季节性干扰。
样本量与统计功效
实验的可靠性取决于统计功效(Power),通常要求 ≥ 80%。影响样本量的因素:
其中 δ 是你期望能检测到的最小增量效果(通常设为广告花费的 5-10%),σ 是区域销售的自然波动。实际操作中,2-4 周实验需要覆盖至少 8-12 个匹配市场对。
实操建议:使用 Google 的 GeoexperimentsResearch 或 Meta 的 GeoLift 包自动计算所需样本量。SparkX 的 Geo Lift 校准模块正在集成这两个工具。
用 Geo 实验校准 MMM
实验结果不是用来替代 MMM,而是用来校准 MMM。校准流程:
第一步:确定校准目标
Geo 实验给出的是某个渠道在特定时间段、特定区域的增量 ROAS。你需要将它转化为 MMM 可用的校准信息:
- 如果实验 ROAS > MMM 估计的 ROAS:说明 MMM 低估了该渠道。可能原因:Adstock 参数偏高、Hill 饱和参数偏低、遗漏了交互效应
- 如果实验 ROAS < MMM 估计的 ROAS:说明 MMM 高估了该渠道。可能原因:未控制季节性、共线性导致系数膨胀、样本期有特殊事件
- 如果两者接近(差异 < 15%):模型在该渠道上可信度较高,无需校准
第二步:选择校准策略
有三种校准策略,按侵入性从低到高排列:
- 先验注入(推荐):在 Bayesian 引擎中,将实验 ROAS 作为先验分布的均值注入模型。例如 PyMC 引擎中设
channel_prior = Normal(mu=experiment_roas, sigma=0.05)。这种方法最温和,不会完全覆盖数据信号。 - 约束优化:在 Ridge 引擎中,对被校准渠道的系数施加不等式约束
coef ≥ experiment_roas * 0.8。保证模型不会偏离实验结果太远。 - 事后缩放:模型跑完后,对所有渠道的 ROI 按实验结果做线性缩放。最简单但最粗糙,只适合快速验证。
第三步:验证校准效果
校准后重新检查模型指标:
- NDE(Normalized Daily Error):校准前后对比,看预测准确度是否下降
- 分渠道 ROAS 稳定性:校准不应导致其他渠道的 ROAS 大幅跳变(> 20% 说明共线性严重)
- 预算优化一致性:校准前后跑一次预算优化,如果最优分配方案变化很大,需要检查校准是否引入了偏差
实操案例
以下是一个真实案例的简化版(DTC 美妆品牌,月广告花费 $150k):
初始 MMM 结果
| 渠道 | MMM ROAS | 月花费 |
|---|---|---|
| Meta (Facebook/IG) | 3.2x | $60k |
| Google Search | 5.1x | $45k |
| TikTok | 2.0x | $30k |
| YouTube | 1.5x | $15k |
Geo 实验结果
对 Meta 和 TikTok 各做了一组 4 周的 matched market 实验:
| 渠道 | 实验增量 ROAS | 与 MMM 差异 |
|---|---|---|
| Meta | 2.8x | -12.5%(接近) |
| TikTok | 4.5x | +125%(严重低估) |
校准后结果
TikTok 的 MMM ROAS 从 2.0x 调整到 3.8x(在实验 4.5x 的 80% 约束内),预算优化器随即建议将 TikTok 预算从 $30k 提升到 $55k,Meta 从 $60k 降到 $40k。校准后整体模型 NDE 仅上升 2%,可以接受。
TikTok 在 MMM 中被低估,原因是早期投放量小、数据信号弱。校准后,预算重新分配预计带来 18% 的增量收入。
常见陷阱
- 实验时间太短:少于 2 周的实验容易受随机波动影响,统计功效不足。建议至少 3-4 周。
- 对照组被污染:处理组的广告可能溢出到对照组(尤其是数字广告的跨区域投放)。确保对照组在投放平台上被排除。
- 一次性校准:渠道效果会随时间变化(竞品进入、受众饱和)。建议每 6 个月对核心渠道做一次 Geo 实验,持续校准。
- 过度依赖实验:Geo 实验也有局限——它测的是短期增量(2-4 周),可能低估品牌广告的长期效应。实验结果和 MMM 应该互相校准,而非一方完全覆盖另一方。
- 忽视交互效应:某渠道在实验中增量大,可能是因为它与其他渠道协同。单独调高该渠道预算可能不会复现实验效果。
总结
Geo Experimentation 是 MMM 因果验证的金标准。它不替代 MMM,而是为 MMM 提供"地面真相"(ground truth)。两者的关系是:MMM 提供全渠道的 ROI 全景图,Geo 实验为核心渠道提供因果锚点。
对于严重依赖 1-2 个渠道的品牌,建议至少做一次 Geo 实验校准。对于多渠道均衡投放的品牌,可以选择性校准变化最大的渠道。SparkX MMM 的 Geo Lift 校准模块正在开发中,规划支持自动匹配市场对、计算样本量、注入先验分布。