回归分析结果的写作可以分为前置校验、框架搭建、场景适配、避坑优化四个步骤,在模型诊断的基础上进行校验,然后按照模型说明、表格呈现、分层解读、指标补充的结构来撰写,最后根据学术期刊、学位论文、商业报告三种不同的场景来调整内容,就可以得到符合要求、没有常识错误的回归分析结果内容。
1. 回归分析结果撰写前的前置准备工作
正式动笔之前,3项核心准备工作直接影响到后面回归结果的严谨性,按照高校社科统计教研室通用的教学要求,缺少任何一项都会导致后面审稿阶段出现返修问题。
1.1 完成模型诊断全维度校验
在整理结果之前必须保证多元线性回归模型已经通过了基础统计检验,按照伍德里奇《计量经济学导论》的权威判定标准:
多重共线性检验:所有变量的VIF值都小于10,没有变量间相关系数大于0.8的情况。
异方差检验:使用怀特检验或者BP检验,如果存在异方差,则必须用异方差稳健标准误重新回归,之后的结果需要明确标注。
序列相关检验:对于面板数据要检验残差序列相关性,存在序列相关时需要调整聚类标准误参数。
某985高校应用统计硕士真实投稿案例中,作者第一次投稿时没有做异方差检验,直接把Stata默认输出的普通标准误回归结果粘贴上去,收到外审意见要求补充稳健标准误结果后重新提交,导致投稿周期延长了2个月。
1.2 分层筛选核心展示维度
避免把所有的回归参数不加筛选地全部放在正文里,根据研究价值的优先级把变量分成三个层次。
第一层次为核心解释变量,是研究假设重点验证的因果关系变量,必须完整地展示出系数、标准误、显著性标记。
第二层次为控制变量,只保留影响核心结论的关键控制变量,非核心控制变量可以简化展示。
第三层次为固定效应、聚类维度等识别策略参数,只需要在表格脚注中统一说明,不需要占用表格主空间。
1.3 对齐对应场景的呈现标准
动笔之前要确定成果的使用场景,核心期刊投稿要符合目标期刊的格式要求,学位论文实证部分要完整地呈现识别逻辑,商业分析报告要突出业务价值,不能用统一的学术模板来适应所有的场景,造成内容冗余或者信息不足的问题。
2. 回归分析结果的标准撰写框架结构
所有的合规回归分析结果都按照统一的分层呈现逻辑,按照经济研究、管理世界官方投稿指南的要求,对模型说明、结论输出等各个环节进行了全面的覆盖。
回归结果内容构成层级示意图
2.1 开篇明确模型设定与识别逻辑
结果解读的第一段不能直接跳到系数解读上,应该先补充两个基础说明:
1. 回归模型具体的函数形式,即明确说明本章使用的是基准多元线性回归模型,被解释变量是企业创新投入,核心解释变量是数字化转型程度,控制变量有企业层面、行业层面、地区层面三类。
2. 样本选择范围,即剔除异常值的标准,删除ST类企业、剔除连续经营不足3年的样本、对所有连续变量在1%水平上做缩尾处理,最后得到多少组有效观测值,从源头上说明回归结果的样本代表性。
2.2 结构化呈现Stata回归输出表
新手最容易犯的错误就是直接复制Stata默认的输出结果页面,没有按照学术规范进行排版,下面列出高校教研室总结的Stata默认输出表与CSSCI期刊要求格式的3类主要差异调整细节。
2.3 分层解读回归结论的双重维度
文字解读部分不能只是重复表格中数字的叙述,还要包含统计显著性和经济意义的阐释两个方面的要求,具体如下:
1. 统计显著性方面:明确核心解释变量的回归系数方向是否符合研究假设,对应的显著性水平是1%、5%还是10%,检验核心变量因果关系是否成立;
2. 经济意义方面:把系数转化为可以理解的业务或研究意义,例如核心解释变量数字化转型的回归系数为0.237,那么企业数字化转型程度每提高1个单位,企业创新投入平均提高23.7%,给统计数字赋予实际的业务/研究内涵。
对新手经常犯的5个显著性标记误用问题进行一一说明,并给出正确的做法。
1. 错误写法:、、分别对应1%、5%、10%显著水平,星号越多代表显著性越低;修正规则:统一采用国内学术通用标准,<0.1,<0.05,<0.01,星号越多代表显著性水平越高;
2. 错误写法:系数不显著时不标注任何星号,也不在表格里体现p值范围;修正规则:如实展示系数和标准误,在脚注中明确说明不显著的变量未带星号,对应p值大于0.1;
3. 错误写法:不同列的回归结果混用不同的显著性标记规则,部分列用10%、5%、1%,部分列用5%、1%、0.1%;修正规则:整个回归表格的显著性规则完全统一,在脚注中一次性说明,避免读者混淆;
4.
错误写法:将标准误的显著性也打上星号标注,多余标注非核心参数的显著性;修正规则:只对回归系数标注显著性,标准误、t值等参数不需要额外加星号;
5.错误写法:自创自定义显著性标记,例如用+表示15%的显著水平;修正规则:除非目标期刊明确允许,否则不能使用通用三线星号以外的自定义标记,以免审稿人产生误解。
2.4 补充说明模型整体拟合指标
这里需要特别注意拟合优度R²的分场景解读标准,不同的数据类型R²的判定逻辑是不一样的
- 横截面数据场景:R²一般要达到0.3以上才算是正常的拟合区间,表示模型可以解释30%以上的被解释变量变异;
- 面板数据场景:控制固定效应之后R²小于0.1是完全正常的,不需要刻意强行提高指标数值,伍德里奇教材中明确指出,微观面板回归的R²普遍较低,不能说明模型拟合效果差。
除了R²之外,还要补充报告F检验值的显著性结果,说明整个回归方程的系数联合显著性是否通过检验,避免只看单个变量系数忽略模型整体有效性。
3. 不同场景下回归分析结果的差异化撰写技巧
同样的基准回归结果,在不同的使用场景下内容取舍的逻辑是不一样的,并不是所有的场景都需要套用同样的学术规范。
3.1 学术期刊论文回归结果撰写
对于CSSCI、SSCI等期刊投稿场景,除了要遵守期刊排版规范之外,还要对稳健性检验结果做专项说明,这里给出三种可以直接套用的学术规范表述话术。
1. 替换核心变量度量方式的稳健性检验:「为了检验基准回归结果是否可靠,本文用数字化转型的词频占比指标代替原来的专利度量指标重新进行回归,结果表明核心解释变量的系数符号和显著性水平没有发生实质性变化,基准回归结论是稳健的。」
2. 子样本回归的稳健性检验:「本文剔除一线城市的企业样本之后,对剩下的子样本重新进行回归分析,核心解释变量的回归系数仍然在1%的水平上显著为正,排除了特殊样本对整个回归结论的影响。」
3. 工具变量法内生性处理稳健性检验:「本文用各城市互联网宽带接入用户数作为数字化转型的工具变量做两阶段最小二乘回归,第一阶段工具变量F值远大于10的临界值,没有弱工具变量问题,第二阶段回归结果和基准回归一致,核心因果关系识别有效。」
异方差稳健标准误说明也需要放在表格脚注中明确标注,如果使用聚类到企业层面的稳健标准误,也需要单独说明聚类维度,符合《经济研究》投稿指南的要求。
3.2 商业数据分析报告回归结果撰写
对于互联网、咨询等商业分析场景,应该弱化统计术语,完全以业务价值为导向。
- 不需要显示标准误、p值等过于专业的统计参数,直接用“显著影响”、“无明显相关性”等通俗的说法来代替;
- 重点解释回归结果的业务落地价值,用回归结论清楚地说明“提高用户A功能的使用时长,可以使用户留存率提高18%,是目前优先级最高的运营优化方向”,不需要详细解释识别策略、内生性处理等学术细节。
3.3 毕业论文实证部分回归结果撰写
本科及硕士学位论文的实证部分要呈现完整的分析链条,除了基准回归之外还要加上机制说明和异质性分析结果。
- 固定效应回归结果和混合回归结果要放在同一张表格里并排比较,清楚地标明哪些列控制了个体固定效应、哪些列同时控制了个体和时间双向固定效应;
- 补充异质性分析结果,即分不同的产权性质企业分组回归结果,说明数字化转型对民营企业创新的促进作用比国有企业强,丰富整体研究结论的层次。
4. 回归分析结果撰写的常见避坑指南
根据国内多所高校统计教研室的教学总结,新手写回归结果时最容易犯的3类错误是:
回归分析结果常见错误类型占比分布
4.1 避免数字与结论脱节
很多新手的回归解读只是机械地重复系数的数字大小,没有提炼出相应的研究结论,例如只写“X的系数为0.237,在1%水平上显著”,而没有说明这个结果是否符合提出的假设,也没有解释背后的经济逻辑,属于典型的无效解读。
4.2 杜绝选择性报告结果
绝对不能刻意隐瞒不显著的变量和检验结果,部分新手只报告显著的核心解释变量结果,故意删除不显著的关键控制变量回归结果,一旦被审稿人发现就会被认定为学术不端,正确的做法是如实报告所有的结果,对不显著的部分补充合理的解释即可。
4.3 规范统一显著性标注规则
全文所有的回归表格的显著性标记规则要完全一致,不能出现前表用10%、5%、1%的星号对应规则,后表又换成其他规则的混乱情况,脚注中必须一次性说明所有的星号对应的显著性水平,防止读者产生误解。
多元线性OLS回归结果的撰写示例参考
以下为符合CSSCI期刊规范的标准回归分析结果呈现模板表,附带文字解读样例,可直接参照修改使用。
注:括号内为异方差稳健标准误,、、分别对应p<0.1、p<0.05、p<0.01的显著性水平,第(3)列回归同时控制了个体固定效应与年份固定效应。
对应的文字解读片段参考:
「表1给出了企业数字化转型对创新投入影响的基准回归结果,第(1)列只把核心解释变量放进去回归,数字化转型的系数在1%水平上显著为正;第(2)列加入企业层面所有的控制变量之后,核心解释变量系数仍然保持1%水平显著,系数大小为0.237,即数字化转型程度每增加1个标准差,企业创新投入平均增加23.7%,经济影响效应明显;第(3)列进一步控制双向固定效应之后,核心变量的显著性没有发生变化,说明数字化转型对企业创新的促进作用是稳定的,符合本文提出的核心研究假设。整体回归F检验值在1%水平显著,模型整体联合显著性通过检验。」
常见问题
常见问题
共 4 个问题,点击展开查看答案
-
不需要全部列示,一般核心解释变量要完整报告系数、标准误、显著性水平,控制变量可以只标注显著性方向或者合并在脚注里简要说明,不能让表格过于繁杂影响核心结论的传达。如果学位论文需要展示完整的实证过程,那么可以在附录中放置全部的控制变量回归结果,正文表格中只保留核心变量。
-
不能直接隐瞒不显著的结果,要如实标注p值区间,结合理论逻辑分析不显著的原因,如样本量不足、机制存在调节效应、变量测量偏差等,补充说明后续改进方向即可。只要逻辑合理,不显著的结果也可以成为研究的重要发现,不会被判定为研究质量不合格。
-
表格里包含所有的量化回归统计值,文字部分主要对核心结论进行解释,即核心变量的经济含义、显著性水平、与理论假设的契合程度、重要的统计指标(R²、F值)的参考价值,不需要重复表格中已经有的数字。正常情况下,回归结果解读的文字部分控制在300-500字左右就可以了,不需要大段堆砌数字来描述。
-
基础框架一致,特殊之处单独说明:Logit回归需要补充OR值或者边际效应的结果解读,不能直接用普通回归系数的经济含义来解释;固定效应回归要注明控制的个体、时间效应维度,明确说明模型识别策略的严谨性;泊松回归、负二项回归等计数模型,要另外说明被解释变量的分布特点,对应解读系数的半弹性含义。