免费试用
方法论

Geo Lift Testing:用增量实验校准你的 MMM 模型

MMM 建模是相关性,不是因果性。Geo Lift Testing 通过地理 A/B 测试建立真正的因果证据,再将结果作为先验校准回 MMM。本文拆解实验设计、样本量计算、结果整合的完整流程。

12 分钟阅读2026-07-03方法论
本文目录
MMM 的因果性缺口 什么是 Geo Lift Testing 实验设计五步法 样本量与统计功效 校准回 MMM SparkX 集成路线 总结

MMM 的因果性缺口

Marketing Mix Modeling 本质上是一个观察性研究。它从历史数据中拟合"花了多少钱、回来了多少销售"的统计关系,但无法证明因果关系。

举个例子:你的 MMM 模型发现 TikTok 花费和销售额高度正相关,于是建议加预算。但有没有可能销量上涨是因为季节性,而 TikTok 花费碰巧也在同一个月增加?MMM 会努力用控制变量(季节性指数、趋势项、价格促销等)来排除这些混淆因素,但它永远无法 100% 确认"是 TikTok 花费导致了销量增长"。

核心问题:MMM 回答的是"花多少 -> 回多少"的统计关联,不是"如果多花一块钱,会多回来多少"的因果增量。

这就是为什么 Google、Meta、Amazon 等大厂都在 MMM 之外搭配增量实验 (Incrementality Testing)。实验提供因果证据,MMM 提供连续性测量,两者交叉校准。

什么是 Geo Lift Testing

Geo Lift Testing(地理增量测试)是最常用的增量实验方法之一。核心思路:

  1. 将全国(或全球市场)划分为可互换的地理区域,比如 DMA、城市、邮编区
  2. 从中选出两组:测试组 (Test)对照组 (Control),两组的历史销售模式尽可能相似
  3. 在测试组增加某个渠道的投放(或暂停),对照组保持不变
  4. 实验结束后,用合成对照法 (Synthetic Control) 或 CUPED 计算测试组的增量销售
  5. 增量销售 ÷ 增量花费 = 真实 iROAS
iROAS_real = ΔSales_test vs control / ΔSpend_test

这个 iROAS 是因果性的 — 因为它来自真正的对照实验,而非统计拟合。

实验设计五步法

第一步:选定测试渠道

不是所有渠道都值得做 Geo Lift Test。优先选择花费占比高、ROI 不确定的渠道。典型的优先级:

第二步:划分地理区域

使用 SparkX 内置的地理聚类工具,基于以下维度对区域做匹配:

目标是找到在实验前就高度同步的区域对。同步性越高,对照组的预测基线越准确。

第三步:确定实验参数

关键参数

实验时长:建议 4-8 周。短于 3 周统计功效不足,长于 12 周外部干扰因素增多。

投放变化幅度:测试组的花费变化建议不低于 50%(增加或减少),太小则增量信号会被噪声淹没。

洗脱期 (Cooldown):实验开始前 1-2 周和结束后 1-2 周作为缓冲,避免 Adstock 残留效应。

第四步:执行实验

在测试组的目标渠道上执行投放变化。其他渠道在所有区域保持不变。记录每日花费和销售数据。

第五步:分析结果

使用合成对照法 (Synthetic Control) 或差分中差分 (DiD) 计算增量:

  1. 用对照组的历史数据构建一个"合成版测试组"的预测基线
  2. 实验期间,实际测试组销售减去合成基线 = 增量销售
  3. 增量销售 ÷ 增量花费 = 真实 iROAS

样本量与统计功效

Geo Lift Test 的样本量不是"人数",而是地理区域数 × 实验天数。统计功效取决于:

经验法则

如果你要检测 10% 的增量销售变化,且历史变异系数 (CV) 为 0.15,通常需要至少 5 个测试 DMA + 5 个对照 DMA × 6 周才能达到 80% 统计功效。

SparkX 计划在 v1.2 中集成自动功效计算器:输入候选渠道和历史数据后,系统会推荐最优的区域分配方案和最短实验时长。

校准回 MMM

拿到实验结果后,关键一步是将因果性证据校准回 MMM 模型。主流做法有两种:

方法一:先验校准 (Prior Calibration)

在贝叶斯引擎(PyMC / Bayesian MCMC)中,将实验得到的 iROAS 作为该渠道的先验分布均值。例如实验测得 Meta 的 iROAS = 1.8,则在模型中设置:

meta_iROAS ~ Normal(mean=1.8, sd=0.3)

这样模型拟合的历史关系会被实验证据"锚定",避免过度拟合噪音。

方法二:后校准 (Post-hoc Calibration)

在频率学派引擎(Ridge / Robyn)中,先跑模型得到原始 iROAS 估计,再用实验结果做线性校准:

iROAS_calibrated = iROAS_model × (iROAS_experiment / iROAS_model_at_experiment_period)

Google Meridian 和 Facebook Robyn 都采用类似的后校准策略。

SparkX 集成路线

SparkX MMM 的 Geo Lift Testing 集成分三个阶段:

差异化:大多数 MMM 工具(包括 Robyn、Meridian)要么不做实验整合,要么只支持手动导入。SparkX 的目标是闭环 — 从实验设计到模型校准全自动,让因果证据持续改进模型精度。

总结

MMM 和增量实验不是替代关系,而是互补

如果你在做 MMM 但从未做过增量实验,你的模型可信度可能比你想的低。SparkX 的建议是:每年至少做 2-4 次关键渠道的 Geo Lift Test,持续校准模型。

下一步

想体验 SparkX MMM 的 AI 解读和校准对比功能?上传你的数据,2 分钟出结果。

免费试用 Instant Mode →

本站使用 Cookie 和类似技术以提升体验并分析流量。继续浏览即表示同意。详见隐私政策