Skip to content

基于 Bhattacherjee《社会科学研究方法》单元 13-15 设计


课程信息

项目内容
课程名称农村金融业务及监管
学期2026 年秋季学期
学生姓名______________
学号______________
项目编号______________
数据集版本______________
更新日期______________

1 变量清单

💡 提示:变量清单是代码本的核心。每个变量都要有清晰的定义,确保其他研究者能理解你的数据。

1.1 变量定义表

序号变量名变量标签类型测量层级操作定义数据源单位取值范围备注
1id受访者编号字符串标识唯一标识符自编INT-001~
2gender性别数值名义受访者生理性别问卷1=男,2=女
3age年龄数值比率受访者周岁年龄问卷18-80
4edu教育程度数值顺序最高学历问卷1=小学及以下,2=初中,3=高中/中专,4=大专,5=本科及以上
5income家庭年收入数值比率家庭全年总收入问卷万元0-100取区间中值
6loan_exp贷款经历数值名义过去12个月是否有贷款问卷0=否,1=是
7fin_lit金融素养得分数值间隔Lusardi 三题正确数问卷0-3
8fin_excl金融排斥感数值间隔Kempson 量表总分问卷6-306题×5点
9satisfaction贷款满意度数值间隔自编4题量表总分问卷4-20
10npl_rate不良贷款率数值比率不良贷款/贷款余额银行报表%0-100机构层面

💡 提示:测量层级分为四类——名义(Nominal)、顺序(Ordinal)、间隔(Interval)、比率(Ratio)。测量层级决定了你可以使用哪些统计方法。

1.2 编码规则

编码类型规则说明示例
名义变量使用连续整数,从 1 开始1=男,2=女
顺序变量按逻辑顺序编码1=小学 → 5=本科及以上
量表变量保持原始 Likert 编码1=非常不同意 → 5=非常同意
缺失值统一使用特定数值标记-999 或 .(Stata 默认)
反向题在数据清洗时统一反向计分5→1, 4→2, 3→3, 2→4, 1→5

1.3 变量命名规范

  • 使用英文小写字母和下划线(如 loan_amount
  • 长度不超过 32 个字符(Stata 变量名限制)
  • 避免使用 Stata 保留字(如 ifinby
  • 同一构念的变量使用共同前缀(如 risk_01risk_02risk_03

2 描述统计计划

💡 提示:描述统计是数据分析的第一步,帮助你了解数据的基本特征,为后续推断统计做准备。

2.1 基本描述统计

变量类型统计量呈现方式
连续变量均值、中位数、标准差、最小值、最大值、偏度、峰度表格
分类变量频次、百分比、累积百分比表格 + 条形图
顺序变量中位数、四分位数、频次分布表格

2.2 分布检验

检验项目方法判断标准
正态性Shapiro-Wilk 检验、K-S 检验、Q-Q 图p > 0.05 为正态
偏度偏度系数绝对值 < 1 为可接受
峰度峰度系数绝对值 < 3 为可接受
异方差Breusch-Pagan 检验p > 0.05 为同方差
多重共线性VIF(方差膨胀因子)VIF < 10 为可接受

2.3 缺失值分析

检查项目方法处理策略
缺失模式Little's MCAR 检验判断缺失是否完全随机
缺失比例每个变量的缺失率< 5% 可忽略;5-15% 需插补;> 15% 考虑删除变量
插补方法多重插补(MI)或均值填补优先使用多重插补

2.4 描述统计输出模板

变量N均值标准差最小值中位数最大值偏度峰度

3 推断统计计划

💡 提示:推断统计用于检验你的研究假设。在开始分析之前,明确每个假设对应的统计方法。

3.1 假设-方法对照表

假设编号假设内容自变量因变量控制变量统计方法选择理由
H1金融素养正向影响贷款参与度fin_litloan_expage, edu, incomeLogistic 回归因变量为二分类
H2金融排斥感负向影响贷款满意度fin_exclsatisfactiongender, ageOLS 回归因变量为连续变量
H3教育程度调节金融素养与贷款参与的关系fin_lit × eduloan_exp交互项回归检验调节效应

3.2 统计方法选择指南

研究场景因变量类型推荐方法前提条件
两组均值比较连续独立样本 t 检验正态性、方差齐性
多组均值比较连续单因素方差分析(ANOVA)正态性、方差齐性
相关关系连续×连续Pearson 相关 / Spearman 相关正态/非正态
预测连续因变量连续OLS 多元回归线性、独立、正态、同方差
预测二分类因变量二分类Logistic 回归无多重共线性
预测有序因变量有序有序 Logistic 回归平行线假设
面板数据连续固定效应/随机效应模型Hausman 检验
政策效果评估连续双重差分法(DID)平行趋势假设
内生性问题连续工具变量法(IV/2SLS)工具变量外生性
中介效应连续Baron-Kenny 法 / Bootstrap样本量充足

3.3 稳健性检验计划

检验方法目的适用场景
替换因变量测量检验结论对测量方式的敏感性有多个可用指标时
替换估计方法检验结论对模型的敏感性如 OLS → Tobit
子样本分析检验结论在不同群体中的一致性按地区/性别/规模分组
剔除极端值检验结论是否受异常值驱动缩尾处理(1%/99%)
增加控制变量检验遗漏变量偏误逐步加入新变量

4 定性编码方案

💡 提示:定性编码是将访谈文本等非结构化数据转化为可分析范畴的过程。

4.1 一级编码(开放编码)

逐行阅读文本,为有意义的片段分配初始代码:

文本片段初始代码编码类型
"我们不看重抵押物,更看重这个人在这边的口碑"软信息替代in vivo
"村里推荐来的人,我们一般都比较放心"社区推荐机制研究者编码
"利率太高了,我们这种小本生意根本承受不起"利率敏感in vivo

4.2 二级编码(主轴编码)

将开放编码归类为更高层次的范畴:

范畴名称包含的初始代码范畴定义范畴关系
社区嵌入风控软信息替代、社区推荐、口碑评估利用社区社会网络进行风险评估条件→策略
融资约束感知利率敏感、额度不足、期限不匹配农户对金融服务的不满和限制现象→结果

4.3 三级编码(选择编码)

提炼核心范畴,构建理论框架:

核心范畴子范畴关系类型理论故事线

4.4 编码员一致性

  • 编码人数:至少 2 名独立编码员
  • 一致性指标:Cohen's Kappa(κ)≥ 0.7 为可接受
  • 不一致处理:讨论协商,必要时引入第三名编码员裁决
  • 编码迭代:每轮编码后召开校准会议,统一编码标准

💡 提示:Kappa 计算公式:κ = (P₀ - Pₑ) / (1 - Pₑ),其中 P₀ 为观察一致性,Pₑ 为期望一致性。


5 stata-mcp 命令清单

💡 提示:以下命令可通过课程配置的 stata-mcp 工具直接调用。分为描述统计、回归分析和结果输出三类。

5.1 描述统计命令

stata
* 基本描述统计
summarize fin_lit fin_excl satisfaction loan_amount

* 分类变量频次表
tabulate gender
tabulate edu

* 分组描述统计
tabstat fin_lit, statistics(mean sd min max n) by(gender)

* 相关矩阵
pwcorr fin_lit fin_excl satisfaction, star(0.05) sig

* 正态性检验
sktest fin_lit
swilk fin_excl

* 多重共线性检查
reg satisfaction fin_lit fin_excl age edu income
vif

5.2 回归分析命令

stata
* OLS 回归
reg satisfaction fin_excl fin_lit age edu income

* Logistic 回归(二分类因变量)
logistic loan_exp fin_lit age edu income, or

* 有序 Logistic 回归
ologit satisfaction_level fin_excl fin_lit age edu

* 交互项(调节效应)
gen fin_lit_edu = fin_lit * edu
reg loan_amount fin_lit edu fin_lit_edu age income

* 面板数据:固定效应模型
xtset panel_id time_id
xtreg npl_rate digitalization size leverage, fe

* 面板数据:Hausman 检验
xtreg y x1 x2, fe
est store fe
xtreg y x1 x2, re
est store re
hausman fe re

* 双重差分(DID)
gen treat_post = treat * post
reg outcome treat post treat_post age edu income

* 工具变量回归(2SLS)
ivregress 2sls loan_amount (fin_lit = fin_edu_policy) age income

* 中介效应(Bootstrap)
bootstrap r(ind_eff) r(dir_eff), reps(1000): sgmediation satisfaction, mv(fin_excl) iv(fin_lit)

5.3 结果输出命令

stata
* 回归结果输出为表格
esttab model1 model2 model3 using results.rtf, ///
    star(* 0.1 ** 0.05 *** 0.01) ///
    se r2 N replace

* 系数可视化
coefplot, vertical yline(0) ///
    xtitle("变量") ytitle("系数") ///
    title("回归系数及95%置信区间")

* 描述统计表输出
estpost summarize fin_lit fin_excl satisfaction
esttab using desc_stats.rtf, ///
    cells("count mean sd min max") replace

* 相关矩阵输出
estpost correlate fin_lit fin_excl satisfaction age edu income, matrix
esttab using corr_matrix.rtf, ///
    unstack compress nokey replace

* 边际效应图(Logistic 回归后)
margins, at(fin_lit=(0 1 2 3))
marginsplot, title("金融素养对贷款参与概率的边际效应")

* 预测概率图
margins, dydx(*) atmeans
marginsplot

5.4 数据管理常用命令

stata
* 数据导入
import excel "data.xlsx", sheet("Sheet1") firstrow

* 变量标签
label variable fin_lit "金融素养得分(0-3分)"
label variable gender "性别"
label define gender_lb 1 "男" 2 "女"
label values gender gender_lb

* 生成新变量
gen ln_income = ln(income)
gen age_sq = age^2
egen fin_lit_mean = mean(fin_lit), by(region)

* 缺失值处理
misstable summarize
mi set wide
mi register imputed fin_excl
mi impute chained (regress) fin_excl = age edu income, add(5)

* 数据合并
merge 1:1 id using "bank_data.dta"

附录:分析检查清单

在提交数据分析结果前,逐项确认:

  • [ ] 变量清单完整,每个变量都有定义
  • [ ] 描述统计已覆盖所有核心变量
  • [ ] 缺失值已检查并处理
  • [ ] 分布检验已完成(正态性、异方差、多重共线性)
  • [ ] 每个假设都有对应的统计方法
  • [ ] 稳健性检验至少做了 2 种
  • [ ] 定性编码有至少 2 名编码员
  • [ ] Kappa 系数已计算且 ≥ 0.7
  • [ ] 所有输出表格已保存为 RTF/LaTeX 格式
  • [ ] 代码和日志已归档备份

附件:AI 工具使用声明

AI 工具名称版本/平台使用环节使用方式是否人工验证
(例)Stata MCPstata-mcp回归分析通过 MCP 调用 Stata 执行回归是,核对输出

学生签名:______________ 日期:______________


本站教学资源仅供四川农业大学选课学生学习使用,版权归原作者所有,未经授权不得转载、转发或用于商业用途