带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(4)

简介: 带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(4)

带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(3) https://developer.aliyun.com/article/1247906?groupCode=taobaotech



image.png


那么对于工具变量 Z ,它需要满足以下三个条件: (1) Z 和 A 相关;(2) Z 仅通过 A 影响Y,而不能直接影响Y;(3) Z 和 Y 没有共同诱因。对于图上这个双盲随机试验中, Z 就是一个工具变量。 我们逐个来看三个条件:Z (1) 被分配到治疗组的被试更可能接受治疗,满足Z 和 A 相关,(2) 这是一个双盲设计,满足Z 仅通过 A 影响Y,而不能直接影响Y,(3)治疗组的分配是随机的,不受任何其他因素影响,满足Z 和 Y 没有共同诱因。并且,在图 2.1 中,工具变量 Z 对实际治疗 A 有因果效应,我们将 Z 称作因果性工具变量。


在What if的前几章,作者用不同的方法在观察性数据中估计了戒烟对增重的因果效应。为了使用工具变量估计因果效应,我们需要一个工具变量 Z 。然而观察性研究并不像随机试验一样有一个表示随机分组的变量,所以我们需要使用其他变量作为我们的工具变量,其中一个可能选项是香烟的价格。香烟价格似乎能满足工具变量的三个条件:


(1)香烟价格能影响一个人是否戒烟;(2) 香烟价格只通过戒烟与否对体重产生影响;(3)香烟价格和增重之间没有共同诱因。


现在我们有了香烟价格Z这个变量,并把它用在我们接下来的讨论当中。假设Z =1表示研究参与人员所在州的香烟均价高于 1.5 美元, Z = 0 表示其他情况。不过,我们依然不能判定 Z 是否是一个工具变量。在工具变量的三个条件中,只有(1)是可验证的,此时我们只需证明 Z 和A相关,也即图片。Z =1时有25.8%的人戒烟;Z =0时有 19.5%的人戒烟。因而图片。在我们的例子中,Z 和A微弱相关,此时Z 被称为弱工具变量。


然而,我们不能验证条件(2)和(3)。为了验证条件(2),我们需要证明 Z 只通过 A 影响 Y。但如果存在Uz,就可能存在一条对撞路径 Z <- Uz -> A <- U ->Y,此时控制 A 就会使得 Z 和Y 相关,也就不能用这一方法验证条件(2)。同样,我们也不能验证条件(3),因为我们没有办法知道效应估计中是否存在混杂。我们只能假设(2)和(3)成立。因此,工具变量这一方法和其他方法一样,需要依赖于一些不可验证的假设。


(有些时候,我们能够利用数据证伪(2)和(3),然而,证伪只能通过验证假设中的一小部分不成立从而拒绝假设,并不具备效力说明假设中的大部分是否不成立。)


在观察性研究中,我们不能证明我们认为的工具变量 Z 是否是真正的工具变量,所以我们将 Z 称为候选工具变量。我们能做的,就是利用各专业知识说明候选变量 Z 为什么能满足条件 (2)和(3) 。这就如同前几章我们用专业知识为

我们的模型假设辩护一样。 ---先验知识/业务经验的重要性。




带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(5) https://developer.aliyun.com/article/1247903?groupCode=taobaotech

相关文章
|
JavaScript 算法 数据安全/隐私保护
原生JS实现:密码输入框显示隐藏密码效果
原生JS实现:密码输入框显示隐藏密码效果
618 4
|
机器学习/深度学习 人工智能 TensorFlow
人工智能与图像识别:基于卷积神经网络的猫狗分类器
人工智能与图像识别:基于卷积神经网络的猫狗分类器
|
分布式计算 资源调度 Hadoop
Flink安装部署{单机模式、会话模式(集群部署)、yarn模式(包含hadoop3.1.3部署)}
Flink安装部署{单机模式、会话模式(集群部署)、yarn模式(包含hadoop3.1.3部署)}
1152 0
|
机器学习/深度学习 测试技术
ChronosX: 可使用外生变量的时间序列预测基础模型
时间序列预测中,基础模型虽在单变量任务中表现出色,但引入协变量支持仍面临挑战。Chronos研究团队提出ChronosX架构,通过适配器层有效整合历史与未来协变量信息,适用于任何单变量模型。实验表明,ChronosX显著提升预测性能,尤其在复杂数据集上优势明显。消融研究进一步验证了协变量模块的重要性。尽管需要轻量训练,但其灵活性和通用性为时间序列建模提供了新思路,未来或可通过类似LLM提示机制实现更高效的协变量处理。
1175 16
ChronosX: 可使用外生变量的时间序列预测基础模型
|
机器学习/深度学习 算法 决策智能
北大领衔,多智能体强化学习研究登上Nature子刊
北京大学研究团队近日在《Nature》子刊上发布了一篇关于多智能体强化学习(MARL)的论文,提出了一种高效且可扩展的MARL框架,旨在解决大规模网络控制系统中的决策问题。该框架实现了智能体间的局部通信,减少了通信成本与计算复杂度,并在交通、电力及疫情防控等多个真实场景实验中,显著提升了决策性能。论文链接:https://www.nature.com/articles/s42256-024-00879-7。尽管该研究仍存局限,但为MARL的应用提供了新思路。
614 2
|
机器学习/深度学习 人工智能 分布式计算
因果推断:效应估计的常用方法及工具变量讨论
日常工作中很多的策略/产品的效果是无法设计完美的随机实验的,要求我们从观察性数据中去(拟合随机试验)发现因果关系、测算因果效应。
3286 0
因果推断:效应估计的常用方法及工具变量讨论
|
关系型数据库 MySQL Linux
Docker安装mysql详细教程, mysqld: Can‘t read dir of ‘/etc/mysql/conf.d/‘(报错已解决)
Docker安装mysql详细教程, mysqld: Can't read dir of '/etc/mysql/conf.d/' (Errcode: 2 - No such file or directory) 已解决
|
机器学习/深度学习 分布式计算 C++
带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(3)
带你读《2022技术人的百宝黑皮书》——因果推断:效应估计的常用方法及工具变量讨论(3)
602 1
|
缓存 算法 关系型数据库
深度思考:雪花算法snowflake分布式id生成原理详解
雪花算法snowflake是一种优秀的分布式ID生成方案,其优点突出:它能生成全局唯一且递增的ID,确保了数据的一致性和准确性;同时,该算法灵活性强,可自定义各部分bit位,满足不同业务场景的需求;此外,雪花算法生成ID的速度快,效率高,能有效应对高并发场景,是分布式系统中不可或缺的组件。
4609 2
深度思考:雪花算法snowflake分布式id生成原理详解
|
测试技术 Windows
基于SpringBoot+Vue企业oa管理系统(源码+部署说明+演示视频+源码介绍)(3)
基于SpringBoot+Vue企业oa管理系统(源码+部署说明+演示视频+源码介绍)
1034 0

热门文章

最新文章