MMM 的因果性缺口
Marketing Mix Modeling 本质上是一个观察性研究。它从历史数据中拟合"花了多少钱、回来了多少销售"的统计关系,但无法证明因果关系。
举个例子:你的 MMM 模型发现 TikTok 花费和销售额高度正相关,于是建议加预算。但有没有可能销量上涨是因为季节性,而 TikTok 花费碰巧也在同一个月增加?MMM 会努力用控制变量(季节性指数、趋势项、价格促销等)来排除这些混淆因素,但它永远无法 100% 确认"是 TikTok 花费导致了销量增长"。
核心问题:MMM 回答的是"花多少 -> 回多少"的统计关联,不是"如果多花一块钱,会多回来多少"的因果增量。
这就是为什么 Google、Meta、Amazon 等大厂都在 MMM 之外搭配增量实验 (Incrementality Testing)。实验提供因果证据,MMM 提供连续性测量,两者交叉校准。
什么是 Geo Lift Testing
Geo Lift Testing(地理增量测试)是最常用的增量实验方法之一。核心思路:
- 将全国(或全球市场)划分为可互换的地理区域,比如 DMA、城市、邮编区
- 从中选出两组:测试组 (Test) 和 对照组 (Control),两组的历史销售模式尽可能相似
- 在测试组增加某个渠道的投放(或暂停),对照组保持不变
- 实验结束后,用合成对照法 (Synthetic Control) 或 CUPED 计算测试组的增量销售
- 增量销售 ÷ 增量花费 = 真实 iROAS
这个 iROAS 是因果性的 — 因为它来自真正的对照实验,而非统计拟合。
实验设计五步法
第一步:选定测试渠道
不是所有渠道都值得做 Geo Lift Test。优先选择花费占比高、ROI 不确定的渠道。典型的优先级:
- Meta / Facebook Ads — 花费大,但 iOS 14.5 后追踪不完整,MMM 结果可信度存疑
- TikTok — 新渠道,历史数据少,MMM 拟合不稳定
- YouTube — 上层漏斗渠道,直接归因困难
- 线性电视 (Linear TV) — 花费巨大,但效果测量争议多
第二步:划分地理区域
使用 SparkX 内置的地理聚类工具,基于以下维度对区域做匹配:
- 历史销售额走势(至少 52 周数据)
- 渠道组合相似度
- 人口统计学特征
- 市场规模(避免大小悬殊的区域配对)
目标是找到在实验前就高度同步的区域对。同步性越高,对照组的预测基线越准确。
第三步:确定实验参数
实验时长:建议 4-8 周。短于 3 周统计功效不足,长于 12 周外部干扰因素增多。
投放变化幅度:测试组的花费变化建议不低于 50%(增加或减少),太小则增量信号会被噪声淹没。
洗脱期 (Cooldown):实验开始前 1-2 周和结束后 1-2 周作为缓冲,避免 Adstock 残留效应。
第四步:执行实验
在测试组的目标渠道上执行投放变化。其他渠道在所有区域保持不变。记录每日花费和销售数据。
第五步:分析结果
使用合成对照法 (Synthetic Control) 或差分中差分 (DiD) 计算增量:
- 用对照组的历史数据构建一个"合成版测试组"的预测基线
- 实验期间,实际测试组销售减去合成基线 = 增量销售
- 增量销售 ÷ 增量花费 = 真实 iROAS
样本量与统计功效
Geo Lift Test 的样本量不是"人数",而是地理区域数 × 实验天数。统计功效取决于:
- 增量效应大小(效应越大,需要的区域越少)
- 历史噪音水平(销售波动越大,需要的区域越多)
- 测试组区域数量(通常至少 5-10 个 DMA)
- 实验天数(至少 28 天)
如果你要检测 10% 的增量销售变化,且历史变异系数 (CV) 为 0.15,通常需要至少 5 个测试 DMA + 5 个对照 DMA × 6 周才能达到 80% 统计功效。
SparkX 计划在 v1.2 中集成自动功效计算器:输入候选渠道和历史数据后,系统会推荐最优的区域分配方案和最短实验时长。
校准回 MMM
拿到实验结果后,关键一步是将因果性证据校准回 MMM 模型。主流做法有两种:
方法一:先验校准 (Prior Calibration)
在贝叶斯引擎(PyMC / Bayesian MCMC)中,将实验得到的 iROAS 作为该渠道的先验分布均值。例如实验测得 Meta 的 iROAS = 1.8,则在模型中设置:
meta_iROAS ~ Normal(mean=1.8, sd=0.3)
这样模型拟合的历史关系会被实验证据"锚定",避免过度拟合噪音。
方法二:后校准 (Post-hoc Calibration)
在频率学派引擎(Ridge / Robyn)中,先跑模型得到原始 iROAS 估计,再用实验结果做线性校准:
Google Meridian 和 Facebook Robyn 都采用类似的后校准策略。
SparkX 集成路线
SparkX MMM 的 Geo Lift Testing 集成分三个阶段:
- v1.0(已发布):支持手动导入实验结果,在 AI 解读中展示校准前后的 iROAS 对比
- v1.2(Q3 2026):内置地理聚类工具 + 功效计算器 + 合成对照法分析
- v1.5(Q4 2026):一键实验管理 — 从设计到分析全流程自动化,支持 Conversion Lift 和 Geo Lift 两种模式
差异化:大多数 MMM 工具(包括 Robyn、Meridian)要么不做实验整合,要么只支持手动导入。SparkX 的目标是闭环 — 从实验设计到模型校准全自动,让因果证据持续改进模型精度。
总结
MMM 和增量实验不是替代关系,而是互补:
- MMM 提供连续性、全局性、渠道间可比的测量 — 但只有相关性
- Geo Lift Test 提供因果性证据 — 但只能测一个渠道、一个时段
- 两者结合:实验校准模型,模型指导下一次实验设计,形成飞轮
如果你在做 MMM 但从未做过增量实验,你的模型可信度可能比你想的低。SparkX 的建议是:每年至少做 2-4 次关键渠道的 Geo Lift Test,持续校准模型。