实证研究是什么?从定义、类型到方法的入门指南

数据分析实务:问卷设计与统计方法 约 12 分钟
本文目录
你正在为毕业论文选题而烦恼,对于“实证研究”这个词既熟悉又陌生?或者你正在阅读文献,发现很多研究都标有“实证研究”,但不确定它和其它研究方法有什么区别?本文从定义、类型、步骤、质量标准四个方面,为读者提供实证研究的完整指南,帮助读者快速掌握实证研究的核心研究范式,并用它来开展规范的学术研究。

1. 什么是实证研究?

实证研究就是以可观察、可测量的数据为基础,用系统化的方法来检验或者建立理论的一种研究范式。它不是思辨研究依靠逻辑推演,也不是规范研究依靠价值判断,而是用数据来说话。你问线上教学能不能提高学生的学习成绩,实证研究会收集一组学生线上学习和另一组线下学习前后成绩的数据,进行对比分析之后得出结论。

实证研究的核心特点

  • 数据驱动:所有的结论都是以可观察、可测量的数据为依据,而不是依靠理论推演或者个人经验得出的。
  • 可重复性:其他研究者按照同样的方法、步骤、条件,应该可以得到相同的或者相似的结果。
  • 可验证性:研究假设可以被检验,研究结果可以被证实或者证伪。
  • 客观性:研究者尽量排除主观偏见,用标准化的程序和统计工具来保证结论的客观中立。
  • 系统性:从问题的提出到结论的撰写,都依照一定的、规范化的研究程序。

实证研究与其他研究范式的本质区别

为了使你一目了然,用一张对比表来展示实证研究、思辨研究和规范研究的不同之处。

维度实证研究思辨研究规范研究
数据源实验数据、调查数据、观察数据、档案数据逻辑推理、概念分析、文献分析价值判断、伦理准则、政策目标
推理方式归纳+演绎,从数据到理论,再从理论到检验主要是演绎,从公理或概念出发逻辑推导价值取向,判断“应该是什么”
核心问题“是什么”“为什么”“怎么样”“是什么”的本质或逻辑关系“应该是什么”“应该怎么做”
适用场景验证假设、评估效果、揭示规律理论建构、概念辨析、逻辑论证政策制定、伦理评价、规范建议
结论特征可验证、可推广、可修正逻辑自洽、概念清晰价值导向、规范明确
典型领域社会科学、自然科学、医学、教育哲学、逻辑学、理论经济学法学、伦理学、政策研究

实证研究关注事实层面的问题,思辨研究关注逻辑层面的问题,规范研究关注价值层面的问题。实证研究给思辨研究和规范研究赋予事实支撑,思辨研究给实证研究赋予理论架构,规范研究给实证研究赋予应用走向。

常见应用场景

实证研究几乎涉及到所有的学科领域,但是以社会科学、自然科学、医学健康、教育学、经济学、管理学、心理学等学科领域的应用最为常见。

  • 社会科学:调查社会态度、公共政策效果评价、组织行为分析
  • 自然科学:物理实验、化学分析、生物实验
  • 医学健康:随机对照试验(RCT)、队列研究、病例对照研究
  • 教育学:教学干预效果评价、学习行为分析
  • 经济学:企业绩效影响因素、消费者行为分析
  • 管理学:组织创新、领导力效能、市场营销策略
  • 心理学:实验法研究认知过程、调查法研究人格特质

2. 实证研究的主要类型

实证研究不是单一的模式,它包含着多种类型,每一种类型都有其适用的场景以及方法论逻辑。按照研究范式的不同,实证研究可以分为量化研究、质性研究和混合研究这三大类。

量化实证研究

量化研究是以数值数据为基础,用统计分析来检验假设或者发现变量之间的关系。它重视可测量性、可推广性和客观性,适合于检验理论、评价效果和发现群体层面的规律。

实验研究

实验研究是量化研究中最权威的因果推断方法,其主要要素有:

  • 随机分配:将被试随机分配到实验组和对照组,保证两组除自变量外其他条件相同
  • 对照组:不接受实验处理,作为比较基准
  • 操纵自变量:研究者主动改变自变量,观察其对因变量的影响
  • 测量因变量:准确记录实验后的结果指标

实验研究的主要优点就是可以建立因果关系。 研究者将学生随机分成两组,实验组用新教学法,对照组用传统教学法,经过一段时间后比较两组成绩的差异。若实验组比对照组有明显优势,并且排除了其他干扰因素,则可以认为新教学法是有效的。

调查研究

调查研究用问卷或者结构化访谈的方式获取大量的样本数据,适合于描述群体特征、测量态度观点、探究变量之间的关系。完整的调查研究设计包含:

  • 问卷设计:量表开发、题项设计、防答偏机制
  • 抽样方法:概率抽样(随机抽样、分层抽样)或者非概率抽样(便利抽样、配额抽样)
  • 信效度控制:通过预测试、因子分析、信度系数检验等保证测量工具的质量

常见的分析数据的方法有描述性统计(平均值、标准差、频率分布)、推断性统计(t检验、方差分析、卡方检验)、回归分析(线性回归、逻辑回归、多元回归)、方差分析等。

准实验设计和相关研究

  • 准实验设计:当不能进行随机分配的时候,用非随机分组(现有的班级、组织)做实验,用统计控制(协方差分析)来减少组间差异,适合实地研究。
  • 相关研究:通过测量两个或者多个变量之间的相关关系来探究变量之间的关联程度,但是不能直接建立因果关系。研究学习时间和考试成绩的相关性。

质性实证研究

质性研究是以文本、图像、音频等非数值数据为依据,用解释性分析来理解现象的意义、过程和语境。它重视深度、情境性以及整体性,适合于探索性研究、理解复杂的现象以及建构理论。

案例研究

案例研究对单个或者多个案例进行详细的分析,适合于探究“为什么”以及“怎么样”的问题。单案例研究适合于对独特或者典型的现象进行深入挖掘,多案例研究则是通过跨案例比较来提高结论的稳健性以及可推广性。数据三角验证(访谈、观察、文档等各方面的资料)是保证案例研究质量的重要手段。

扎根理论

扎根理论是通过系统的编码过程,从数据中自下而上地建构理论。其主要步骤有:

  • 开放编码:把数据分成概念和类别
  • 主轴编码:建立类别之间的联系,形成轴心范畴
  • 选择性编码:整合范畴,形成核心理论和故事线

扎根理论认为理论来自于数据,而不是由已有的理论推导出来的。 研究者对多家创业企业进行深入访谈之后,渐渐形成起“创业失败后学习机制”的理论模型。

现象学

现象学试图把握生活体验的本质,研究者通过深入访谈、反思性分析,去除先入为主的假设,展现被研究对象真实的体验。其目的就是得到对某一现象(焦虑、疼痛、幸福感等)的普遍性描述。

混合研究

混合研究是把量化和质性结合起来的一种研究方法,它可以弥补单一方法的不足,使研究结论更加深入、全面。常见的混合研究设计有:

  • 顺序解释型:先收集量化数据,然后用质性数据来解释量化结果中异常或者深层次的原因
  • 顺序探索型:先进行质性研究来探索现象,再根据质性研究的发现来设计量化研究进行验证
  • 并行三角验证型:同时收集量化和质性数据,互相验证、补充
  • 嵌入式设计:在一种主要方法中嵌入另一种方法,例如实验中嵌入质性访谈

量化研究 vs 质性研究 vs 混合研究对比表

维度量化研究质性研究混合研究
核心目标验证假设、测量变量、推广结论理解意义、探索过程、建构理论互补验证、增强解释力
数据形式数值数据(分数、计数、等级)文本、图像、音频、视频数值+文本等多种数据
常用工具问卷、实验、量表、统计软件访谈、观察、文档分析问卷调查+深度访谈
样本规模大样本(通常100+)小样本(通常10-50)可大可小,视设计而定
优缺点可推广但缺乏深度深度但难以推广全面但复杂耗时
适用场景验证理论、评估效果探索新现象、理解过程复杂问题、多维度研究

选择哪种类型,取决于你的研究问题。 如果研究问题是“是什么”、“有多少”,那么量化研究更合适;如果研究问题是“为什么”、“怎么样”,那么质性研究更合适;如果研究问题需要从多个角度去理解,那么混合研究就是最好的选择。

3.实证研究的基本步骤

实证研究有一套明确的、系统化的操作流程。从问题的提出到论文的撰写,每一步都要认真对待。以下是实证研究的标准八步流程:

步骤1:确定研究问题与假设

研究问题要具体、可操作、可检验,不能是模糊的“是什么”或者“怎么办”。“怎样提高学生成绩”范围太大,“智能手机使用时长对大学生学业成绩的影响”比较具体,也具有可操作性。

假设是研究问题可以检验的版本,一般有零假设(H₀)和备择假设(H₁)。例如:

  • H₀:智能手机使用时长与大学生学业成绩无显著相关
  • H₁:智能手机使用时长与大学生学业成绩存在显著负相关

步骤2:文献综述

文献综述不是简单的文献列表,是整理已有的研究、找到研究的空白、建立理论框架的过程。你需要:

  • 搜索关键词:使用学术数据库(CNKI、Web of Science、Google Scholar)
  • 识别核心文献:高被引论文、最新综述
  • 分析研究空白:已有研究没有回答的问题、方法上的不足、争议的问题
  • 构建理论框架:根据已有的理论提出自己的研究模型和变量关系

步骤3:研究设计

这是实证研究的关键部分,它决定着研究的好坏。你需要决定:

  • 研究方法:实验/调查/案例/混合?
  • 样本选择:目标人群、样本量、抽样方法
  • 测量工具:问卷、量表、实验装置、访谈提纲
  • 变量操作化:将抽象概念转化为可测量的指标(如“学习动机”用“学习动机量表”测量)

步骤4:数据收集

开展调查、实验、访谈等数据收集工作,保证数据质量以及伦理合规。关键注意事项如下:

  • 预测试:先对测量工具进行小范围的测试,发现并改正问题
  • 标准化:保证所有的被试都接受同样的数据收集程序
  • 伦理审查:获得知情同意,保护被试隐私
  • 数据记录:保存原始数据,方便以后核查

步骤5:数据清洗与整理

原始数据中常常有缺失值、异常值、输入错误等问题,必须认真清洗:

  • 处理缺失值:删除缺失率高的样本或者变量,或者用均值、中位数、回归插补
  • 识别异常值:使用箱线图、Z分数或者IQR方法来识别和处理异常值
  • 数据编码:把文本答案转换成数值,例如“男=1,女=2”
  • 数据转换:反向计分、标准化处理

小王是心理学研究生,他所经历的就是数据清洗的一个典型案例。 他用问卷星收集了200份关于大学生社交媒体使用与自尊的数据,信度α=0.65,小于0.7的可接受标准。经过仔细检查之后,他发现其中有3道题目的表述不清楚,例如“我经常觉得社交媒体使我更好”这样的表述会引起被试的理解偏差。于是他删掉这3道题,重新调整了措辞,再次收集数据后α提高到0.82。这说明问卷设计的前期测试比后期分析更重要。

步骤6:数据分析与统计检验

根据研究问题选择合适的数据分析方法。小王完成数据清洗之后,就进行了独立样本t检验,来分析性别差异对于社交媒体使用的影响。他得出男生和女生在社交媒体使用时长上存在显著差异(t=2.34,p<0.05),男生平均每天使用时间更长。

常见数据分析方法选择参考:

  • 比较两组均值:独立样本t检验(如男vs女)
  • 比较多组均值:单因素方差分析(如低/中/高使用组)
  • 探索变量关系:皮尔逊相关、回归分析
  • 检验分类变量关系:卡方检验
  • 因子分析:探索或验证量表结构

步骤7:结果解释与讨论

数据分析得出结果之后,就要回到理论框架中去解释发现,即

  • 结果是否支持假设? 如果支持,说明理论得到了验证;如果不支持,分析可能的原因(理论不足、方法局限、样本特征等)
  • 结果与已有研究是否一致? 一致则加强理论的稳健性;不一致则探究深层次的原因
  • 研究局限:样本代表性、测量误差、实验设计、外部效度等
  • 实践意义:研究结果对实践领域的启示

步骤8:撰写研究报告

实证研究报告一般包含以下几个部分:

  • 引言:研究背景、问题、假设、研究意义
  • 文献综述:理论基础、已有研究、研究空白
  • 方法:被试、工具、程序、分析策略
  • 结果:数据分析的结果,即表格、图表、统计检验
  • 讨论:结果的解释、理论贡献、实践意义、局限与未来方向
  • 结论:主要发现的总结

实证研究实施的完整流程:从问题提出到报告撰写,形成闭环逻辑。每一步都要小心,但是数据清洗、数据分析是很多初学者容易忽略的环节,也是决定研究质量的重要环节。

4. 实证研究的关键质量标准

实证研究的质量依靠信度、效度以及伦理规范来保证。理解了这些标准之后,既可以评价已有的研究质量,也可以指导自己的研究设计更加严谨。

信度:测量工具的稳定性、一致性

信度是指测量工具或者结果的稳定性、一致性,也就是多次测量结果是否一致。高质量的信度是得出研究结论的前提。

常见信度类型:

  • 重测信度:用同一个测量工具在不同的时间对同一个群体进行测量,结果的相关性越高,重测信度就越好
  • 分半信度:把测量工具分成两半,两半得分的相关性越高,分半信度就越好
  • 内部一致性信度(Cronbach's α):用来衡量量表题项之间的一致性,α>0.7可以接受,α>0.8良好,α>0.9优秀。小王的数据由α=0.65提高到0.82,是因为删除了一些质量不高的题项从而提高了内部一致性

效度:测量工具是否测量到了它应该测量的概念

信度是效度的必要条件,但是高效度还要求测量工具真正地抓住目标概念。

常见效度类型:

  • 内容效度:测量工具是否包含了目标概念的全部重要方面,一般用专家评审来检验
  • 结构效度:测量工具是否体现了理论结构,用探索性因子分析(EFA)或者验证性因子分析(CFA)来检验
  • 效标关联效度:测量结果是否与外部效标(已有的标准测量)一致
  • 内部效度:研究设计能否有效地建立因果关系,排除混淆变量
  • 外部效度:研究结果是否可以推广到其他人群、情境、时间

信度与效度的关系:高信度不一定高效度,但是高效度一般需要高信度。例如一个时钟每天都准时快5分钟(信度很高),但是它所显示的时间是不准确的(效度很低)。同样,一个量表内部一致性很高(α=0.95),但是如果所有的题项测量的都是社交焦虑的另一面(社交自信),那么结构效度就存在疑问。

研究伦理:保护被试、尊重数据

实证研究涉及人类被试的时候,必须遵守严格的伦理规范,即:

  • 知情同意:被试充分了解研究目的、程序、风险和收益之后自愿参与
  • 隐私保护:对数据进行匿名化处理,不泄露个人身份信息
  • 利益冲突声明:研究者应当披露可能会影响研究客观性的利益关系

可重复性危机与预注册

近些年来,心理学、医学等领域出现的“可重复性危机”引起了人们的广泛关注,很多经典的研究不能被其他的团队所复现。为了克服上述困难,现代实证研究提出了以下方法

  • 预注册(Pre-registration):在研究开始之前,在研究平台(Open Science Framework)上注册研究设计、假设以及数据分析计划,防止事后进行数据挖掘或者选择性报告
  • 开放数据:公开原始数据以及代码,方便其他研究者进行核查和复现
  • 稳健性检验:用不同的方法交叉验证,改变样本选择、测量方式、统计模型等来检验结果是否稳定

5. 实证研究的应用场景与案例

实证研究在各个学科领域中都有其特有的方法和案例。以下用表格、案例来说明各个领域的应用范式。

社会科学:调查法与社会态度研究

典型方法:问卷调查、抽样调查、面板数据分析

经典案例:中国综合社会调查(CGSS)每年都会对全国居民进行抽样调查,收集有关社会态度、价值观、幸福感、政治参与等各方面的数据,研究者用回归分析来研究“收入水平与幸福感的关系”。

医学健康:随机对照试验(RCT)

典型方法:RCT、队列研究、病例对照研究

经典案例:一项关于新药A对高血压患者的效果的RCT,将患者随机分为实验组和对照组,实验组服用新药A,对照组服用安慰剂,6个月后实验组血压下降幅度明显大于对照组,说明新药A有效。

教育学:教学干预效果评价

典型方法:准实验设计、调查法、混合研究

经典案例:研究者想要评价游戏化学习对小学生数学成绩的影响,但是由于不能随机分班,所以采用准实验设计,选择两个平行班级,实验班用游戏化教学,对照班用传统教学,学期末比较两班数学成绩,用协方差分析控制前测成绩差异。

经济学:面板数据分析

典型方法:面板数据回归、倍差法(DID)、工具变量法

经典案例:研究“最低工资上调对就业的影响”,利用各省份年度面板数据,采用倍差法比较上调省份与未上调省份就业率的变化,控制时间趋势和地区固定效应,识别因果效应。

心理学:实验法研究认知过程

典型方法:实验室实验、调查法、脑成像实验

经典案例:一项关于“多任务处理对注意力的影响”的实验,被试在安静环境和干扰环境下分别完成注意力测试,结果发现干扰环境下反应时显著更长,错误率更高,证明多任务处理损害注意力。

6. 实证研究的常见误区与挑战

实证研究虽然严谨,但是初学者常常会犯一些典型的错误。知道这些误区之后就不会再犯同样的错误了。

常见误区与应对策略

误区表现应对策略
混淆相关与因果根据相关关系直接推断因果关系使用实验设计、工具变量法、自然实验等因果推断方法
过度依赖p值认为p<0.05即“显著”,忽视效应量和实际意义报告效应量(Cohen's d、η²)和置信区间
忽视样本代表性使用便利样本,结论推广到总体采用概率抽样,报告样本特征并与总体比较
多重比较不校正进行大量统计检验,随机出现显著结果使用Bonferroni校正、FDR校正等
数据挖掘过度拟合不断试错,直到找到“显著”结果预先注册分析计划,采用交叉验证

数据收集挑战

  • 抽样偏差:样本不能代表总体,如只在校园招募被试,结论不能推广到全社会
  • 测量误差:问卷题项模糊、实验设备不准、被试理解偏差
  • 无应答偏差:拒绝回答或者退出研究的被试群体可能具有某些特征,从而造成结果的偏倚

数据分析挑战

  • 多重比较问题:做大量的统计检验,随机出现虚假显著的结果
  • 多重共线性:自变量之间高度相关,使回归系数估计变得不稳定
  • 数据挖掘过度拟合:在数据里不断试错,找到“最好”的模型,但是模型在外部数据上表现很差

方法学挑战

  • 内部效度威胁:历史事件(实验期间发生的外部事件)、成熟效应(被试自然成长)、选择偏差(两组被试本来就不同)、测验效应(前测影响后测)等
  • 外部效度局限:实验室环境与真实世界相差很大,结果很难推广

如何规避误区

  • 预先注册:在研究开始之前,在研究平台上注册研究设计、假设和分析计划
  • 样本量计算:根据效应量和统计功效来确定最低样本量
  • 稳健性检验:改变样本选择、测量方式、分析方法来检验结果是否稳定
  • 敏感性分析:检验结果对关键假设的敏感性,即缺失值处理方式、样本筛选标准等

常见问题

共 4 个问题,点击展开查看答案

  • 实证研究是以可观察的数据和事实为基础,重视通过实验、调查、观察等方式获取一手或者二手数据,并且依靠数据分析和统计检验来验证或者提出理论。理论研究更多地依靠逻辑推理、概念辨析以及文献综述,而不需要依靠原始数据。实证研究重视可重复性、可验证性,理论研究重视逻辑自洽、创新性。实证研究用数据来检验理论,理论研究用逻辑来构建理论。

  • 实证研究一般包含以下几个步骤,即确定研究问题与假设、进行文献综述以明确理论基础、设计研究方案(选择研究方法、样本选取、数据收集工具)、收集数据、清洗和整理数据、数据分析与统计检验、解释结果并得出结论、撰写研究报告,讨论研究局限与未来方向。每一步都要小心,但是数据清洗、数据分析是很多初学者容易忽略的环节,也是决定研究质量的关键。

  • 信度(Reliability)是指研究测量工具或者结果的稳定性、一致性,也就是多次测量结果是否一致。常用的信度指标有重测信度、分半信度、内部一致性信度(Cronbach's α)等。效度(Validity)指的是研究测量工具或者方法是否真正地测量到了它想要测量的概念。效度有内容效度、结构效度、效标关联效度等。高信度是高效度的必要条件,但不是充分条件——一个工具可以稳定地测量错误的东西(高信度低效度),但是不能想象一个不稳定的工具能准确测量(低信度高效度)。

  • 实证研究分为量化研究、质性研究和混合研究三大类。量化研究有实验研究(随机对照实验、准实验)、调查研究(问卷、抽样调查)、相关性研究等,质性研究有案例研究、扎根理论、现象学、民族志等,混合研究就是将量化和质性方法结合起来,比如顺序解释型设计、并行三角验证型设计等。选择哪一种类型取决于你的研究问题是验证假设、理解意义还是两者都有。


实证研究自查清单(供读者自查)

  • [ ] 研究问题是否具体、可操作、可检验?
  • [ ] 是否进行了充分的文献综述,明确了研究空白?
  • [ ] 是否选择了合适的研究方法(量化、质性、混合)?
  • [ ] 样本是否具有代表性,样本量是否足够?
  • [ ] 测量工具是否经过信效度检验(α>0.7)?
  • [ ] 是否进行了数据清洗(处理缺失值、异常值)?
  • [ ] 数据分析方法是否与研究问题相匹配?
  • [ ] 是否报告了效应量和置信区间,而不仅仅是p值?
  • [ ] 是否讨论了研究的局限性以及外部效度?
  • [ ] 是否遵守了研究伦理(知情同意、隐私保护)?

参考文献

Creswell,J.W.(2014)。研究设计:定性、定量和混合方法研究(第4版)。Sage Publications。

American Psychological Association. (2020). Publication manual of the American Psychological Association (7th ed.). APA.

Bryman,A.(2016)。社会研究方法(第五版)。牛津大学出版社。

Shadish,W.R.,Cook,T.D.,& Campbell,D.T.(2002)。实验和准实验设计的广义因果推断。Houghton Mifflin。