实证分析是什么?从数据到结论的核心步骤解析

数据分析实务:问卷设计与统计方法 约 7 分钟
本文目录
你是否有过这样的困惑,在阅读一篇学术论文的时候,看到“基于实证分析”的字样,却不知道它到底是什么意思?或者,当你要完成自己的研究项目时,面对大量的数据,却不知道怎样从零开始建立一个可靠的实证分析框架?

实证分析就是用数据讲一个科学的故事,你提出问题(教育能提高收入吗?),然后收集数据、建立模型、检验假设,最后从数字中读出真相。它不同于纯理论推导,是用可观察的数据和统计方法为依据,经过严格的步骤来检验假设,从而得到可靠结论的研究过程。

对比维度实证分析理论分析
依据类型可观察的数据、观察、实验已有理论、逻辑推理、公理
核心方法统计检验、计量模型、假设检验演绎推理、逻辑推导、概念分析
检验方式假设检验(t检验、p值等)逻辑一致性、推导过程
结论可靠性可重复验证、可量化可辩论、依赖前提假设
输出形式回归系数、显著性、置信区间理论命题、概念框架

1. 什么是实证分析?

实证分析(Empirical Analysis)是一种以可观察、可测量的数据为依据,用统计或者计量的方法来检验假设的研究范式。它重视的是“经验证据”而不是“纯逻辑推导”,其主要特点就是用数据来说话。

实证分析回答的是“是什么”、“怎么样”的问题,而不是“应该是什么”。理论分析可以得出提高最低工资会导致失业率上升的命题,但是实证分析需要用实际数据(某一地区提高最低工资前后的就业数据)来检验这个命题是否成立。

实证分析的本质就是三个要素:

  • 可观测性:所有的结论都必须以可以测量、可以验证的数据为依据
  • 可重复性:其他研究者使用同样的数据和方法应该得到相似的结果
  • 可检验性:假设必须可以被证伪

2.实证分析的主要目的

实证分析的目的不单是跑回归、做统计。它有多种功能,即

2.1 验证因果关系或者相关性

实证分析的主要目的就是区分开因果关系和简单的相关关系。冰淇淋销量和溺水事件数量呈正相关,但这并不意味着冰淇淋导致溺水,背后的混杂因素是天气炎热。实证分析用控制变量、工具变量等方法来接近真实的因果关系。

2.2 给出可以量化的证据来支撑决策或者理论

无论是政策的制定者还是企业的管理者,都要依靠数据的证据来做出决策。实证分析可以给出具体的估计值(教育每增加一年,收入平均提高8%),这样的量化的信息比纯粹的理论判断更有说服力。

2.3 重复检验来提高结论的可靠性

实证分析的一个重要特点就是可重复性。同一个研究问题可以用不同的数据集、不同的方法或者不同的样本来进行验证。如果一个结论在多个独立的研究中都得到了支持,那么它的可靠性就会大大提高。

3. 实证分析的完整步骤

步骤核心任务关键输出常见工具/方法
1. 明确问题与假设从理论或现象中提炼可检验的问题研究问题、零假设与备择假设文献综述、理论推导
2. 数据收集与整理确定数据来源,清洗数据干净的数据集、变量定义表数据库查询、数据清洗脚本
3. 数据探索与可视化描述性统计,发现数据特征统计摘要、图表(直方图、散点图等)Python(Pandas、Matplotlib)、Stata
4. 模型选择与检验根据问题选择统计模型,检验假设模型参数、显著性检验结果(p值)回归分析、t检验、卡方检验
5. 结果解释与结论解读统计显著性,讨论实际意义结论报告、局限性说明系数解读、效应量计算

步骤1:明确研究问题与假设

实证分析的第一步就是确定研究问题,例如“房价受哪些因素影响?”,然后从UCI数据库中下载数据,清洗缺失值,再用Stata进行OLS回归。

在进行任何数据分析之前,首先要确定你想回答的问题。这一步需要你:

  • 从理论或者实际现象中提炼出可以检验的、具体的研究问题
  • 把问题转化为可以操作的研究假设
  • 形成零假设(H₀)与备择假设(H₁)

典型案例:小王的研究起点

先看一个例子,小王是经济学研究生,他对于“教育能否提高收入”这个问题很感兴趣。他从人力资本理论出发,提出研究假设:教育水平对收入有正向影响。相应地,他设定:

  • 零假设 H₀:教育水平对收入没有影响(β₁ = 0)
  • 备择假设 H₁:教育水平对收入有正向影响(β₁ > 0)

这一步看似简单,但是非常重要。一个模糊的研究问题(教育对收入有什么影响?)会导致后面的分析失去方向,而一个清晰的问题(控制其他因素后,教育年限每增加一年,月收入变化多少?)可以指导整个分析框架。

步骤2:数据收集与整理

数据是实证分析的基础。该阶段的主要任务有:

确定数据来源

  • 实验数据:通过随机对照试验(RCT)获得
  • 调查数据:如中国家庭追踪调查(CFPS)、中国健康与营养调查(CHNS)
  • 公开数据库:UCI机器学习库、世界银行开放数据、国家统计局数据
  • 二手数据:政府统计年鉴、企业年报、社交媒体数据

小王的数据来源:小王选择了中国家庭追踪调查(CFPS) 数据,该数据库包含全国代表性样本的家庭收入、教育水平、工作经历等信息。他下载了2018年个人的横截面数据,约有3万条记录。

数据清洗与预处理

这是实证分析中最耗时但也最关键的环节。常见的数据清洗任务有:

  • 处理缺失值:删除缺失严重的变量,或者用均值、中位数、回归插补等方法填补
  • 处理异常值:识别并处理离群点(如极端高收入)
  • 变量转换:对收入取对数(使分布更接近正态)、创建虚拟变量(如性别、地区)
  • 数据合并与匹配:将不同来源的数据按匹配键合并

小王的清洗过程:删除收入为0或者负值的异常记录,对年龄在18-65岁之间的劳动年龄人口进行筛选,将收入取自然对数,把教育年限定义为受教育年数(小学6年、初中9年、高中12年、大学16年)。

步骤3:数据探索与可视化

在正式建模之前,通过描述性统计和可视化来了解数据的基本特征至关重要。

描述性统计

  • 计算均值、中位数、标准差、最小值、最大值
  • 检查变量的分布形态(偏度、峰度)
  • 生成相关性矩阵,初步了解变量间关系

数据可视化

  • 直方图:查看变量分布(如收入分布通常右偏)
  • 散点图:初步判断两个变量之间的关系(如教育与收入是否呈线性关系)
  • 箱线图:发现异常值,比较不同组别的差异(如不同学历的收入水平)

小王的数据探索:他发现收入的分布严重右偏,因此确认了对收入取对数的合理性。教育年限与对数收入的散点图呈正相关,但是有很多分散的点,说明还有工作经验、行业、性别等其他因素在起作用。

步骤4:模型选择与检验

这是实证分析的主要部分。根据研究问题以及数据类型来选择合适的统计模型。

常见模型选择原则

因变量类型常用模型适用场景
连续变量(如收入、房价)线性回归(OLS)分析连续变量的影响因素
二分类变量(如是否上大学、是否购买)逻辑回归(Logit)分析事件发生概率
多分类变量(如职业类型)多项逻辑回归(Multinomial Logit)分析分类选择
计数变量(如专利数量、就诊次数)泊松回归、负二项回归分析计数数据

小王的模型选择:因变量(对数收入)是连续变量,因此他选择普通最小二乘法(OLS)回归,模型设定为:

ln(收入) = β₀ + β₁ × 教育年限 + β₂ × 工作经验 + β₃ × 性别 + β₄ × 行业 + ε

模型假设检验

任何统计模型都有假设条件,对这些假设进行检验是实证分析的一种专业表现。

关键假设与诊断方法(以OLS为例):

假设含义诊断方法违反后果
线性关系自变量与因变量关系线性残差图、Box-Tidwell检验模型设定错误
独立性观测值之间相互独立Durbin-Watson检验(时间序列)标准误偏误
同方差性残差方差恒定Breusch-Pagan检验、White检验标准误偏差,影响显著性判断
正态性残差服从正态分布正态概率图、Shapiro-Wilk检验小样本时影响推断
无多重共线性自变量之间不高度相关VIF检验(VIF>10表示严重)系数估计不稳定

小王发现的问题:在他的初步回归中,Breusch-Pagan检验显示存在异方差(p<0.05),因此他使用了稳健标准误(Robust Standard Errors)来修正。

更严重的问题:内生性

小王在模型中只控制了性别和行业,但他意识到还有一个重要的因素——能力——被忽略了。能力强的人会同时得到更高的教育水平和更高的收入,这就是遗漏变量偏误,使得教育变量和误差项相关,即存在内生性。

内生性的处理

  • 工具变量法(IV):寻找一个与教育相关但与收入误差项不相关的变量(如“距离最近大学的距离”)
  • 双重差分法(DID):利用政策冲击的外生性
  • 固定效应模型:控制个体不随时间变化的特征

小王的解决方案他用距离最近大学的距离作为教育的工具变量,用两阶段最小二乘法(2SLS)进行估计。结果发现OLS估计会低估教育的影响,IV估计显示教育每增加一年,收入提高大约8%。

步骤5:结果解释与结论

实证分析就是用数据讲科学故事的过程,即提出问题(教育能提高收入吗?),收集数据、建立模型、检验假设,最后从数字中读出真相。

结果解释属于实证分析中最为困难的部分,要兼顾统计显著性以及实际意义。

统计显著性解读

  • p值:p < 0.05 表示在5%的显著性水平下拒绝零假设
  • 置信区间:95%置信区间不包含0,表示系数显著
  • 系数大小:教育年限的系数为0.08,表示教育每增加一年,收入预期增加8%

实际意义解读

  • 效应量:8%的收入提升有实际意义吗?(对政策制定者来说,这意味着每年数万亿的收入增加)
  • 经济显著性:虽然统计显著,但是系数很小(0.01%),没有实际意义
  • 局限性讨论:研究设计有无偏差?结果能否推广到其他人群或者时期?

小王的结论

教育年限对收入有显著正向影响(p < 0.001)

使用工具变量之后,估计值更加可靠,教育每增加一年,收入提高大约8%

但是仍然存在局限性,工具变量的排他性假设(距离大学是否只通过教育影响收入)可能不成立

4. 实证分析的应用场景

实证分析的价值体现在多个领域:

4.1 社会科学研究

  • 经济学:分析政策效果(如最低工资对就业的影响)、市场行为研究
  • 心理学:实验设计验证认知理论、行为实验
  • 社会学:社会分层与流动、教育回报率分析

4.2 商业分析

  • 市场调研:消费者偏好分析、定价策略评估
  • 用户行为分析:转化率影响因素、用户留存预测
  • 运营管理:供应链效率、员工绩效评价

4.3 自然科学实验验证

  • 医学研究:临床试验效果评价、药物副作用分析
  • 环境科学:污染与健康的关系、气候变化影响

5. 常见误区与注意事项

常见误区问题描述对应的建议
混淆相关性与因果性将相关关系直接解释为因果关系使用因果推断方法(IV、DID、RDD),进行敏感性分析
过度拟合模型过于复杂,对训练数据的噪音也进行拟合使用交叉验证,控制模型复杂度,避免加入过多变量
数据挖掘偏差反复尝试不同模型直到找到显著结果预先设定分析计划,使用Bonferroni校正调整多重比较
忽略样本代表性结论基于非代表性样本,无法推广使用概率抽样,报告样本特征与总体特征的对比
数据泄露使用了未来信息预测当前结果严格区分训练集和测试集,避免使用未来数据
忽略稳健性检验只报告一种模型的结果进行多种稳健性检验(更换变量定义、使用不同方法、样本分割)
选择性报告只报告显著的结果,忽略不显著的结果预先注册研究计划,报告所有分析结果,包括不显著的

特别提醒:稳健性检验

实证分析中,稳健性检验(Robustness Checks)是评价结论可靠性的重要环节。常见的稳健性检验有:

  • 更换变量定义:用不同的指标来衡量同一个概念(例如用最高学历代替教育年限)
  • 更换样本:剔除极端值、使用不同的子样本
  • 更换方法:用倾向得分匹配代替OLS,或用Logit模型代替线性概率模型
  • 加入额外控制变量:检验主要结论是否受到遗漏变量的影响

常见问题

常见问题

共 3 个问题,点击展开查看答案

  • 实证分析是以可观察的数据、事实为依据,用统计或者计量的方法来检验假设,重视客观证据的;而理论研究更多的是依靠逻辑推理以及已有的理论体系,并不直接依靠数据来检验。实证分析回答的是“是什么”,理论研究回答的是“应该是什么”。两者不是对立的,而是互相补充的——理论给实证分析提供假设的来源,实证分析给理论提供经验的检验。

  • 常用的有回归分析(线性回归、逻辑回归)、相关性分析、方差分析(ANOVA)、因子分析、主成分分析、时间序列分析、聚类分析、结构方程模型等。根据研究问题以及数据类型来选择合适的方法,连续因变量用线性回归,分类因变量用逻辑回归,探索变量结构用因子分析,预测未来趋势用时间序列分析。

  • 第一步就是确定研究问题和假设。需要清楚地界定要研究的现象或者关系,根据理论提出可以被检验的假设。这一步骤为,从文献综述中找到研究空白,把抽象的问题变成可以执行的研究问题,设置零假设和备择假设。没有明确的研究问题,后面的数据收集、模型选择就会失去方向。