在分析“广告是否提升销量”这类问题时,最危险的做法往往不是模型太简单,而是尚未说明变量之间可能如何相互影响。因果图,即有向无环图(DAG),把变量表示为节点,把假定的因果方向表示为箭头,并要求图中不存在沿箭头回到原点的循环。它不是用数据自动证明因果的工具,而是把研究者的因果假设公开化,使控制哪些变量、忽略哪些变量都能被审查。

DAG 的核心价值在于区分几类容易混淆的变量。共同影响处理与结果的变量是混杂因素,例如促销季可能同时影响广告投放和销量;处理通向结果过程中的变量是中介;由处理或结果共同导致的变量,则可能成为碰撞点。分析中若漏掉关键混杂因素,估计会偏离;若把中介或碰撞点一并控制,也可能人为制造偏差。“把所有能拿到的变量都放进回归”因此并不是稳妥策略。
先明确处理变量、结果变量与目标效应:是要判断广告对销量的总影响,还是要研究广告通过某个环节产生影响?目标不同,图中应保留或阻断的路径也不同。随后按时间顺序列出可能的前因、过程变量和后果变量,再逐一判断箭头方向。方向应来自业务机制、研究设计与时间逻辑,而不是变量间相关性的强弱。
绘图时应优先画出可能造成替代解释的路径。若天气变化同时推动冰淇淋销量与游泳活动,就不能把两者的同步上升直接画成单向因果。对每一条箭头,都应能回答:这一影响为何可能存在?若无法说明,应标记为待验证假设,而非悄然写入模型。
一张好的 DAG 不追求变量越多越好,而追求假设边界清楚。它让分析者在建模前就发现反向因果、选择偏差和不当控制的风险,也让后续的随机分配、对照设计或回归调整有明确依据。图画得不完美并不可怕;真正的问题,是在没有因果结构意识时,把相关关系误作答案。
参与讨论
暂无评论,快来发表你的观点吧!