你是否有过这样的困惑,在阅读一篇学术论文的时候,看到“基于实证分析”的字样,却不知道它到底是什么意思?或者,当你要完成自己的研究项目时,面对大量的数据,却不知道怎样从零开始建立一个可靠的实证分析框架?
实证分析就是用数据讲一个科学的故事,你提出问题(教育能提高收入吗?),然后收集数据、建立模型、检验假设,最后从数字中读出真相。它不同于纯理论推导,是用可观察的数据和统计方法为依据,经过严格的步骤来检验假设,从而得到可靠结论的研究过程。
1. 什么是实证分析?
实证分析(Empirical Analysis)是一种以可观察、可测量的数据为依据,用统计或者计量的方法来检验假设的研究范式。它重视的是“经验证据”而不是“纯逻辑推导”,其主要特点就是用数据来说话。
实证分析回答的是“是什么”、“怎么样”的问题,而不是“应该是什么”。理论分析可以得出提高最低工资会导致失业率上升的命题,但是实证分析需要用实际数据(某一地区提高最低工资前后的就业数据)来检验这个命题是否成立。
实证分析的本质就是三个要素:
- 可观测性:所有的结论都必须以可以测量、可以验证的数据为依据
- 可重复性:其他研究者使用同样的数据和方法应该得到相似的结果
- 可检验性:假设必须可以被证伪
2.实证分析的主要目的
实证分析的目的不单是跑回归、做统计。它有多种功能,即
2.1 验证因果关系或者相关性
实证分析的主要目的就是区分开因果关系和简单的相关关系。冰淇淋销量和溺水事件数量呈正相关,但这并不意味着冰淇淋导致溺水,背后的混杂因素是天气炎热。实证分析用控制变量、工具变量等方法来接近真实的因果关系。
2.2 给出可以量化的证据来支撑决策或者理论
无论是政策的制定者还是企业的管理者,都要依靠数据的证据来做出决策。实证分析可以给出具体的估计值(教育每增加一年,收入平均提高8%),这样的量化的信息比纯粹的理论判断更有说服力。
2.3 重复检验来提高结论的可靠性
实证分析的一个重要特点就是可重复性。同一个研究问题可以用不同的数据集、不同的方法或者不同的样本来进行验证。如果一个结论在多个独立的研究中都得到了支持,那么它的可靠性就会大大提高。
3. 实证分析的完整步骤
步骤1:明确研究问题与假设
实证分析的第一步就是确定研究问题,例如“房价受哪些因素影响?”,然后从UCI数据库中下载数据,清洗缺失值,再用Stata进行OLS回归。
在进行任何数据分析之前,首先要确定你想回答的问题。这一步需要你:
- 从理论或者实际现象中提炼出可以检验的、具体的研究问题
- 把问题转化为可以操作的研究假设
- 形成零假设(H₀)与备择假设(H₁)
典型案例:小王的研究起点
先看一个例子,小王是经济学研究生,他对于“教育能否提高收入”这个问题很感兴趣。他从人力资本理论出发,提出研究假设:教育水平对收入有正向影响。相应地,他设定:
- 零假设 H₀:教育水平对收入没有影响(β₁ = 0)
- 备择假设 H₁:教育水平对收入有正向影响(β₁ > 0)
这一步看似简单,但是非常重要。一个模糊的研究问题(教育对收入有什么影响?)会导致后面的分析失去方向,而一个清晰的问题(控制其他因素后,教育年限每增加一年,月收入变化多少?)可以指导整个分析框架。
步骤2:数据收集与整理
数据是实证分析的基础。该阶段的主要任务有:
确定数据来源:
- 实验数据:通过随机对照试验(RCT)获得
- 调查数据:如中国家庭追踪调查(CFPS)、中国健康与营养调查(CHNS)
- 公开数据库:UCI机器学习库、世界银行开放数据、国家统计局数据
- 二手数据:政府统计年鉴、企业年报、社交媒体数据
小王的数据来源:小王选择了中国家庭追踪调查(CFPS) 数据,该数据库包含全国代表性样本的家庭收入、教育水平、工作经历等信息。他下载了2018年个人的横截面数据,约有3万条记录。
数据清洗与预处理:
这是实证分析中最耗时但也最关键的环节。常见的数据清洗任务有:
- 处理缺失值:删除缺失严重的变量,或者用均值、中位数、回归插补等方法填补
- 处理异常值:识别并处理离群点(如极端高收入)
- 变量转换:对收入取对数(使分布更接近正态)、创建虚拟变量(如性别、地区)
- 数据合并与匹配:将不同来源的数据按匹配键合并
小王的清洗过程:删除收入为0或者负值的异常记录,对年龄在18-65岁之间的劳动年龄人口进行筛选,将收入取自然对数,把教育年限定义为受教育年数(小学6年、初中9年、高中12年、大学16年)。
步骤3:数据探索与可视化
在正式建模之前,通过描述性统计和可视化来了解数据的基本特征至关重要。
描述性统计:
- 计算均值、中位数、标准差、最小值、最大值
- 检查变量的分布形态(偏度、峰度)
- 生成相关性矩阵,初步了解变量间关系
数据可视化:
- 直方图:查看变量分布(如收入分布通常右偏)
- 散点图:初步判断两个变量之间的关系(如教育与收入是否呈线性关系)
- 箱线图:发现异常值,比较不同组别的差异(如不同学历的收入水平)
小王的数据探索:他发现收入的分布严重右偏,因此确认了对收入取对数的合理性。教育年限与对数收入的散点图呈正相关,但是有很多分散的点,说明还有工作经验、行业、性别等其他因素在起作用。
步骤4:模型选择与检验
这是实证分析的主要部分。根据研究问题以及数据类型来选择合适的统计模型。
常见模型选择原则:
小王的模型选择:因变量(对数收入)是连续变量,因此他选择普通最小二乘法(OLS)回归,模型设定为:
ln(收入) = β₀ + β₁ × 教育年限 + β₂ × 工作经验 + β₃ × 性别 + β₄ × 行业 + ε
模型假设检验:
任何统计模型都有假设条件,对这些假设进行检验是实证分析的一种专业表现。
关键假设与诊断方法(以OLS为例):
小王发现的问题:在他的初步回归中,Breusch-Pagan检验显示存在异方差(p<0.05),因此他使用了稳健标准误(Robust Standard Errors)来修正。
更严重的问题:内生性
小王在模型中只控制了性别和行业,但他意识到还有一个重要的因素——能力——被忽略了。能力强的人会同时得到更高的教育水平和更高的收入,这就是遗漏变量偏误,使得教育变量和误差项相关,即存在内生性。
内生性的处理:
- 工具变量法(IV):寻找一个与教育相关但与收入误差项不相关的变量(如“距离最近大学的距离”)
- 双重差分法(DID):利用政策冲击的外生性
- 固定效应模型:控制个体不随时间变化的特征
小王的解决方案他用距离最近大学的距离作为教育的工具变量,用两阶段最小二乘法(2SLS)进行估计。结果发现OLS估计会低估教育的影响,IV估计显示教育每增加一年,收入提高大约8%。
步骤5:结果解释与结论
实证分析就是用数据讲科学故事的过程,即提出问题(教育能提高收入吗?),收集数据、建立模型、检验假设,最后从数字中读出真相。
结果解释属于实证分析中最为困难的部分,要兼顾统计显著性以及实际意义。
统计显著性解读:
- p值:p < 0.05 表示在5%的显著性水平下拒绝零假设
- 置信区间:95%置信区间不包含0,表示系数显著
- 系数大小:教育年限的系数为0.08,表示教育每增加一年,收入预期增加8%
实际意义解读:
- 效应量:8%的收入提升有实际意义吗?(对政策制定者来说,这意味着每年数万亿的收入增加)
- 经济显著性:虽然统计显著,但是系数很小(0.01%),没有实际意义
- 局限性讨论:研究设计有无偏差?结果能否推广到其他人群或者时期?
小王的结论:
教育年限对收入有显著正向影响(p < 0.001)
使用工具变量之后,估计值更加可靠,教育每增加一年,收入提高大约8%
但是仍然存在局限性,工具变量的排他性假设(距离大学是否只通过教育影响收入)可能不成立
4. 实证分析的应用场景
实证分析的价值体现在多个领域:
4.1 社会科学研究
- 经济学:分析政策效果(如最低工资对就业的影响)、市场行为研究
- 心理学:实验设计验证认知理论、行为实验
- 社会学:社会分层与流动、教育回报率分析
4.2 商业分析
- 市场调研:消费者偏好分析、定价策略评估
- 用户行为分析:转化率影响因素、用户留存预测
- 运营管理:供应链效率、员工绩效评价
4.3 自然科学实验验证
- 医学研究:临床试验效果评价、药物副作用分析
- 环境科学:污染与健康的关系、气候变化影响
5. 常见误区与注意事项
特别提醒:稳健性检验
实证分析中,稳健性检验(Robustness Checks)是评价结论可靠性的重要环节。常见的稳健性检验有:
- 更换变量定义:用不同的指标来衡量同一个概念(例如用最高学历代替教育年限)
- 更换样本:剔除极端值、使用不同的子样本
- 更换方法:用倾向得分匹配代替OLS,或用Logit模型代替线性概率模型
- 加入额外控制变量:检验主要结论是否受到遗漏变量的影响
常见问题
常见问题
共 3 个问题,点击展开查看答案
-
实证分析是以可观察的数据、事实为依据,用统计或者计量的方法来检验假设,重视客观证据的;而理论研究更多的是依靠逻辑推理以及已有的理论体系,并不直接依靠数据来检验。实证分析回答的是“是什么”,理论研究回答的是“应该是什么”。两者不是对立的,而是互相补充的——理论给实证分析提供假设的来源,实证分析给理论提供经验的检验。
-
常用的有回归分析(线性回归、逻辑回归)、相关性分析、方差分析(ANOVA)、因子分析、主成分分析、时间序列分析、聚类分析、结构方程模型等。根据研究问题以及数据类型来选择合适的方法,连续因变量用线性回归,分类因变量用逻辑回归,探索变量结构用因子分析,预测未来趋势用时间序列分析。
-
第一步就是确定研究问题和假设。需要清楚地界定要研究的现象或者关系,根据理论提出可以被检验的假设。这一步骤为,从文献综述中找到研究空白,把抽象的问题变成可以执行的研究问题,设置零假设和备择假设。没有明确的研究问题,后面的数据收集、模型选择就会失去方向。