对标教材:单元 9(调查研究)
阶段定位:收集——"拿数据"
学习目标
完成本章后,你将能够:
- 问卷设计全流程——从操作化表出发,经题项撰写、组卷、预调研到正式定稿(承接第 5 章测量计划)
- 预调研与认知访谈——用小样本 (n = 30–50) 发现歧义与偏差,迭代修订问卷
- 调查偏差三类控制——识别并设计应对措施:抽样偏差 / 无回答偏差 / 回答偏差(社会期望偏误)
- 信效度检验实操——用 Stata 完成 Cronbach's α + 探索性因子分析 + KMO 检验
本章路线图
第 5 章(操作化表)
↓
§7.1 问卷设计工作流 → §7.2 题项撰写与排布 → §7.3 访谈调查
↓
§7.4 调查偏差三类控制 → §7.5 调查伦理(S7.1)
↓
§7.6 信效度检验实操(Stata)→ §7.7 数据入库
↓
产出物 + 自检§7.1 问卷设计工作流
参见教材单元 9"问卷调查法";本节将其转化为五步可操作流程。
五步流程
问卷设计不是一个"坐下来从头写到尾"的线性过程,而是一个迭代闭环。承接第 5 章你已经完成的测量计划(操作化表),现在进入"执行层":
| 步骤 | 名称 | 核心任务 | 产出物 |
|---|---|---|---|
| 1 | 操作化表确认 | 每个构念→确定题项数量与类型(量表/分类/连续) | operationalization.xlsx |
| 2 | 题项库 | 为每个构念生成候选题项(含正向/反向),比正式用量多 50% | item_pool.docx |
| 3 | 组卷 | 排列顺序(先易后难 / 先一般后敏感)+ 人口统计放末尾 | questionnaire_v1.docx |
| 4 | 预调研 | 小样本 (n = 30–50) 测试 + 认知访谈 + 修订 | questionnaire_v2.docx |
| 5 | 定稿 | 正式发放,锁定版本号与日期 | questionnaire_final.docx |
问卷结构模板
一份标准学术问卷的骨架如下:
┌─────────────────────────────────────┐
│ 封面信(知情同意) │ ← 200 字以内
│ ·研究目的·匿名承诺·预计时长·联系方式 │
├─────────────────────────────────────┤
│ 筛选题(如适用) │ ← "您是否在过去一年使用过…?"
├─────────────────────────────────────┤
│ 主体题项(按构念分组) │ ← 每个构念 3–7 题
│ ·构念 A → 构念 B → 构念 C │
├─────────────────────────────────────┤
│ 人口统计学信息 │ ← 性别/年龄/学历/收入(区间化)
├─────────────────────────────────────┤
│ 致谢 + 结果反馈承诺 │
└─────────────────────────────────────┘电子问卷 vs 纸质问卷
| 维度 | 电子问卷(问卷星/腾讯问卷) | 纸质问卷 |
|---|---|---|
| 适用场景 | 远程大样本 / 城市群体 / 年轻群体 | 农村地区 / 入户调查 / 文化程度低 |
| 成本 | 几乎为零 | 印刷+差旅+人工录入 |
| 逻辑跳转 | 自动 | 人工指引 |
| 必答控制 | 可设置 | 靠访员监督 |
| 实时进度 | 后台监控 | 手动统计 |
| 偏差风险 | 抽样偏差(排斥无网络群体) | 录入错误 |
| 金融调查建议 | 银行客户/城镇居民 | 农户调查(建议电子+纸质双轨) |
实操提示:对农户调查,推荐"访员平板填写"模式——既保留电子问卷的逻辑控制,又避免农户自行操作的障碍。问卷星支持"访问员模式"。
§7.2 题项撰写与排布
参见教材单元 9"问题内容与措辞"。
语言规范六原则
| 原则 | 说明 | 正例 |
|---|---|---|
| 简短 | 单题 ≤ 20 字 | "您去年家庭总收入约为?" |
| 清晰 | 不用模糊限定词 | "过去 12 个月"代替"最近" |
| 一题一意 | 禁止双重问题 | 拆分为两题 |
| 避免术语 | 用被访者语言 | "贷款利息"代替"资金成本" |
| 避免否定 | 尤其双重否定 | 正面陈述 |
| 避免诱导 | 中立措辞 | 不引用权威观点 |
常见错误与改写示范
错误 1:双重问题(Double-barreled)
✘ "您对银行服务和手机 APP 满意吗?"
→ 如果被访者对银行满意但对 APP 不满意,无法作答。
✔ 改写为两题:
Q1 "您对银行网点服务整体满意吗?" 1=非常不满意 … 5=非常满意
Q2 "您对手机银行 APP 整体满意吗?" 1=非常不满意 … 5=非常满意错误 2:诱导性问题(Leading)
✘ "大多数学者认为数字金融有益于农民增收,您同意吗?"
→ 引用权威形成压力,被访者倾向附和。
✔ 改写:
"您认为数字金融对农民收入的影响是?"
1=非常不利 2=不太有利 3=说不清 4=比较有利 5=非常有利错误 3:多重否定(Double/Triple Negation)
✘ "您是否不认为农业保险没有必要?"
→ 三重否定,认知负荷极高。
✔ 改写:
"您认为农业保险对您的生产经营有帮助吗?"
1=完全没有帮助 … 5=帮助非常大错误 4:模糊限定(Vague Reference)
✘ "您经常使用移动支付吗?"
→ "经常"因人而异(有人觉得一周一次就算经常)。
✔ 改写:
"过去一个月,您使用移动支付(微信/支付宝等)的频率是?"
1=从未 2=1–3 次 3=4–10 次 4=11–20 次 5=20 次以上排布顺序原则
- 漏斗式:从宽泛到具体(先问"是否使用金融服务",再问"使用哪种")
- 先易后难:开头放事实性/行为性问题,降低心理门槛
- 先一般后敏感:收入、负债等敏感题放后半段
- 收入区间化:不要求精确数字,给区间选项(减少拒答与少报)
您的家庭年收入约为: □ 2 万以下 □ 2–5 万 □ 5–10 万 □ 10–20 万 □ 20 万以上 - 人口统计放末尾:避免一开头就触碰隐私感
- 话题转换加过渡语:
"下面将询问您对农业保险的看法"
电子问卷的技术优势
- 逻辑跳转:根据前一题答案自动显示/隐藏后续题目
- 必答控制:未填写时不允许进入下一页
- 实时进度:后台查看回收量、完成率、平均答题时长
- 防重复提交:IP/微信 OpenID 限制
- 随机化:题项或选项随机排列,减少顺序效应
§7.3 访谈调查
参见教材单元 9"访谈调查"。
访谈类型对比
| 类型 | 结构程度 | 适用场景 | 样本量 | 金融/农金举例 |
|---|---|---|---|---|
| 结构化访谈 | 高(固定问题+选项) | 大样本标准化比较 | 100+ | 农户信贷行为调查(与问卷等效) |
| 半结构化访谈 | 中(提纲+追问自由) | 深入理解机制与过程 | 15–40 | 银行客户经理访谈 / 村干部座谈 |
| 无结构化访谈 | 低(开放式对话) | 探索性研究 | 5–15 | 民族志 / 参与式观察 |
半结构化访谈 = 第 10 章案例研究的预演
在你的研究中,半结构化访谈最常见的用途是为案例研究收集深度数据。提纲通常包含:
半结构化访谈提纲模板
─────────────────────
一、暖场(2–3 min)
·自我介绍·研究简述·知情同意·录音许可
二、背景信息(5 min)
·您的岗位职责?·在这个岗位多久了?
三、核心问题(20–30 min)
·开放式问题 1:您如何看待…?
·开放式问题 2:能否举一个具体的例子…?
·追问:您刚才提到…,能否再详细说说?
四、补充(5 min)
·还有什么我没问到但您觉得重要的?
·您推荐我还可以和谁聊聊?
五、致谢(1 min)
·感谢·后续反馈承诺
─────────────────────访谈提纲设计要点
- 开放式问题为主——"您如何看待…"而非"您是否同意…"
- 避免引导——不暗示"正确"答案
- 追问技巧(参见教材单元 9):
- 沉默试探:暂停等待,暗示期待更多细节
- 公开鼓励:"嗯""好的"——但绝不表态赞同/反对
- 寻求详述:"您能否再具体说说?"
- 重述:"我听您说…,是这个意思吗?"
- 控制时长:单次访谈 30–60 分钟为宜
- 录音+笔记:征得同意后录音,同时做关键笔记(设备故障时的备份)
焦点小组(Focus Group)
| 要素 | 说明 |
|---|---|
| 人数 | 6–10 人 |
| 时长 | 60–90 分钟 |
| 主持人角色 | 引导讨论、确保每人发言、控制强势个体 |
| 适用 | 探索性阶段(发现新构念/新维度) |
| 金融举例 | 农户对新型保险产品的看法讨论 |
| 风险 | 从众效应——个别人可能不愿在同行面前表达真实看法 |
§7.4 调查偏差三类控制
参见教材单元 9"调查研究中的偏差"。教材列举五类偏差,本章聚焦最核心的三类。
三类偏差总览
| 偏差类型 | 含义 | 金融调查举例 | 控制措施 |
|---|---|---|---|
| 抽样偏差 | 样本系统性不代表总体 | 只在交通便利的村入户→遗漏偏远村农户 | 多阶段分层抽样 + 事后权重调整 |
| 无回答偏差 | 拒绝回答者与回答者特征系统性不同 | 高收入农户拒答率更高→收入均值被低估 | 追踪 / 替代 / 加权 / 提高回收率策略 |
| 回答偏差 | 回答不真实或不准确 | "您有多少存款?"→普遍少报 | 间接提问 / 区间化 / 匿名 / 行为题替代 |
抽样偏差深入
承接第 5 章的抽样设计,这里强调执行层面的常见陷阱:
- 覆盖不足:抽样框(如村委会名单)遗漏了新迁入户
- 便利抽样伪装随机:只在集镇赶集日调查→系统性排除不赶集的农户
- 补救:使用多阶段分层随机抽样(PSU→村→户),事后用
svyset设定权重
无回答偏差深入
教材指出邮件调查回收率通常仅 15–20%。提高回收率的策略(参见教材单元 9):
- 提前告知——先发通知信说明研究目的
- 内容相关性——让被访者感到调查与自己有关
- 简短友好——问卷不超过 15 分钟
- 权威背书——附村委会/银行的推荐信
- 多次追踪——对未回应者发 2–3 次提醒
- 激励——小额红包/话费/实物赠品
回答偏差:社会期望偏误
这是金融调查中最隐蔽也最严重的偏差之一:
直接提问:"您家有多少存款?"
→ 社会期望:少报(怕露富)或多报(面子)
改进策略:
(1) 区间化:"您家存款大约在哪个区间?"
(2) 行为替代:"过去一年您是否向银行存过钱?大约几次?"
(3) 第三方视角:"您觉得村里和您情况差不多的家庭,一般存款多少?"
(4) 匿名强调:封面信明确"本调查完全匿名,数据仅用于学术研究"共同方法偏误(补充)
当自变量与因变量在同一份问卷、同一时间点测量时,相关系数会虚高。
应对:
- 时间分离:自变量和因变量分两次收集
- 方法分离:问卷测态度 + 档案数据测行为
- 统计检验:Harman 单因子检验(
factor后看第一因子解释方差比例)
§7.5 调查伦理
对应诚信检查点 S7.1(涉人研究的伦理底线)。
为什么伦理如此重要?
调查涉及真人——他们的时间、隐私、情感。学术伦理不仅是规范,更是法律要求(《个人信息保护法》2021 年施行)。一旦违反,后果可能包括:论文撤稿、学位撤销、法律责任。
知情同意书要素
一份合格的知情同意书必须包含:
| 要素 | 内容 | 示例措辞 |
|---|---|---|
| 研究目的 | 简明说明做什么 | "本研究旨在了解农户数字金融服务使用情况" |
| 研究者身份 | 姓名、单位、导师 | "XX 大学经济学院研究生 XXX(导师:XXX 教授)" |
| 自愿参与 | 可随时退出 | "您的参与完全自愿,可在任何时刻中止" |
| 风险说明 | 可能的不适 | "不涉及任何身体或经济风险" |
| 收益说明 | 对参与者的回报 | "您将获得 XX 元话费/礼品作为感谢" |
| 保密承诺 | 数据如何使用 | "所有数据仅用于学术研究,以匿名方式报告" |
| 联系方式 | 有问题找谁 | "如有疑问请联系:xxx@xxx.edu.cn" |
| 签名/确认 | 同意参与 | "我已阅读并同意参与本研究 签名____" |
知情同意书模板(简化版,适用于农户调查)
───────────────────────────────────────────────
知情同意书
尊敬的朋友:
您好!我是四川农业大学经济学院的研究生,正在进行
一项关于农村金融服务的学术研究。本调查大约需要 15 分
钟,所有回答仅用于学术研究,完全匿名,不会泄露您的个
人信息。您的参与完全自愿,可以在任何时候停止。
如有任何问题,请联系:XXX(电话/微信:XXXXX)
感谢您的参与和支持!
□ 我已阅读以上内容,同意参与本调查。
签名(或按手印):________
日期:____年____月____日
───────────────────────────────────────────────数据脱敏与匿名化
| 阶段 | 操作 |
|---|---|
| 收集时 | 不记录姓名/身份证号;使用编号(如 Village01_Household023) |
| 存储时 | 原始数据加密存储;纸质问卷锁柜保管 |
| 分析时 | 使用脱敏数据集(不含任何可识别信息) |
| 发表时 | 不报告可定位的小样本统计(如"某村仅 3 户,其中 2 户…") |
| 访谈时 | 录音转写后替换真名为代号("受访者 A"/"某银行支行行长") |
伦理审查
- 何时需要:涉及人类被试的研究原则上都应通过伦理审查
- 国内现状:部分高校已设立 IRB(伦理审查委员会),部分尚未强制
- 最低标准:即使学校无正式 IRB,也应做到——知情同意 + 匿名 + 无害 + 导师签字确认
- 发表论文:国际期刊通常要求在稿件中注明"本研究已通过 XX 大学伦理审查(批号:XXXX)"
§7.6 信效度检验实操
问卷设计完成后、正式分析之前,必须验证量表质量。本节用 Stata 完成三项核心检验。
前置准备:数据格式
信效度检验要求数据为宽格式(每行一个被访者,每列一个题项)。假设你的量表有:
- 构念"数字金融使用"(DF):
df1–df5(5 个题项,Likert 1–5) - 构念"信贷可得性"(CA):
ca1–ca4(4 个题项,Likert 1–5)
第一步:Cronbach's α(信度)
* ── 信度检验:Cronbach's α ──
* 对"数字金融使用"量表的 5 个题项做 α 检验
alpha df1 df2 df3 df4 df5
* 输出解读:
* Cronbach's alpha = 0.XXXX
* 判断标准:α ≥ 0.7 可接受;α ≥ 0.8 良好;α ≥ 0.9 优秀
* 若 α < 0.7:查看 "alpha if deleted" 列,删除该题后 α 是否显著提升
* 对"信贷可得性"量表同理
alpha ca1 ca2 ca3 ca4判断规则:
| α 值 | 判断 | 行动 |
|---|---|---|
| ≥ 0.9 | 优秀(但可能冗余) | 检查是否有题目高度重复 |
| 0.8–0.9 | 良好 | 可接受 |
| 0.7–0.8 | 可接受 | 可接受,但建议优化 |
| < 0.7 | 不可接受 | 删题/改题后重新检验 |
第二步:KMO 检验 + Bartlett 球形检验(因子分析前提)
* ── KMO 检验(取样适切性量数)──
* 需要安装:ssc install relife(或 ssc install kmo)
estat kmo // 如果刚跑完 factor,可直接用
* 或独立命令:
kmo df1 df2 df3 df4 df5 ca1 ca2 ca3 ca4
* 输出解读:
* KMO 值判断:≥ 0.9 极好;0.8–0.9 良好;0.7–0.8 中等;
* 0.6–0.7 勉强;< 0.6 不适合做因子分析
* ── Bartlett 球形检验 ──
* H0:相关矩阵为单位矩阵(变量间无相关)
* 期望 p < 0.05 拒绝 H0 → 适合做因子分析
factor df1 df2 df3 df4 df5 ca1 ca2 ca3 ca4, pcf
estat bartlett // Stata 16+ 支持第三步:探索性因子分析(EFA)
* ── 探索性因子分析(主成分法 + 方差最大旋转)──
factor df1 df2 df3 df4 df5 ca1 ca2 ca3 ca4, pc varimax
* pc = 主成分提取;varimax = 方差最大正交旋转
* 输出解读:
* (1) 看旋转后因子载荷矩阵:
* - 每个题项应在其对应构念上载荷 ≥ 0.5
* - 交叉载荷(在两个因子上都 > 0.4)→ 考虑删除该题
* (2) 看特征值 > 1 的因子数量(Kaiser 准则)
* (3) 看累积解释方差:建议 ≥ 60%
* 如果特征值准则提取的因子数 ≠ 预期构念数,可手动指定:
factor df1 df2 df3 df4 df5 ca1 ca2 ca3 ca4, pc varimax f(2)
* f(2) = 强制提取 2 个因子第四步:聚合信度与判别效度(进阶)
* ── AVE(平均方差萃取)与 CR(组合信度)──
* 需要从因子载荷矩阵手工计算,或使用社区命令:
* ssc install avevar(如有)
* AVE = Σ(标准化载荷²) / 题项数
* CR = (Σ标准化载荷)² / [(Σ标准化载荷)² + Σ(1-载荷²)]
* 判断标准:AVE ≥ 0.5;CR ≥ 0.7
* 判别效度(Fornell-Larcker 准则):
* 每个构念的 √AVE 应大于该构念与其他构念的相关系数完整示例代码(可直接运行)
* ═══════════════════════════════════════════════════
* 信效度检验完整流程
* 数据:survey_data.dta(含 df1-df5, ca1-ca4)
* ═══════════════════════════════════════════════════
clear all
set more off
* 1. 导入数据
use "survey_data.dta", clear
* 2. 信度检验
di _n "====== 信度检验:数字金融使用(DF)======"
alpha df1 df2 df3 df4 df5, item
di _n "====== 信度检验:信贷可得性(CA)======"
alpha ca1 ca2 ca3 ca4, item
* 3. KMO + Bartlett
di _n "====== KMO 检验 ======"
estat kmo
* 4. 因子分析
di _n "====== 探索性因子分析(Varimax 旋转)======"
factor df1 df2 df3 df4 df5 ca1 ca2 ca3 ca4, pc varimax f(2)
rotate, varimax
* 5. 因子得分(可选,用于后续分析)
predict f_df f_ca, scores
label var f_df "数字金融使用(因子得分)"
label var f_ca "信贷可得性(因子得分)"
* 6. 保存
save "survey_factor_scores.dta", replace
di "信效度检验完成!"AI 辅助提示:你可以将 α 检验输出贴给 AI,让它帮你判断哪些题项应删除,并解释原因。但最终决策必须由你做出——AI 不了解你的理论框架。
§7.7 数据入库
问卷回收后的第一步不是分析,而是把数据"干净地"装进 Stata。
电子问卷导出(以问卷星为例)
问卷星后台操作路径:
我的问卷 → 选择问卷 → 统计&下载 → 下载原始数据
可选格式:Excel (.xlsx) / CSV / SPSS (.sav)
推荐:下载 Excel 格式(保留变量名和选项文本)导出后的典型列名:
| 原始列名(问卷星自动生成) | 你需要做的 |
|---|---|
| "序号" | 保留为 ID |
| "提交答卷时间" | 提取日期/时间 |
| "所用时间(秒)" | 用于筛除过快答卷 |
| "1.您的性别" | 重命名为 gender |
| "2.您的年龄" | 重命名为 age |
| "3_1.您对银行服务满意" | 重命名为 satis1 |
Stata 读入与重命名
* ── 数据入库流程 ──
clear all
set more off
* 1. 导入 Excel
import excel "raw_survey_data.xlsx", sheet("Sheet1") firstrow
* 2. 查看当前变量名(通常很长且含中文)
describe
* 3. 批量重命名(建立变量名映射)
rename 序号 id
rename 您的性别 gender
rename 您的年龄 age
rename 您的学历 education
rename 您的家庭年收入 income
rename 您对银行服务满意度 satis1
rename 您对手机银行满意度 satis2
* ... 逐一重命名
* 4. 保存为 Stata 格式
save "survey_raw.dta", replace
* 5. 添加变量标签(方便后续分析识别)
label var id "受访者编号"
label var gender "性别(1=男 2=女)"
label var age "年龄(岁)"
label var satis1 "银行服务满意度(1-5)"编码簿(Codebook)建立
编码簿是你的"数据说明书",记录每个变量的含义、取值范围和来源题项。
编码簿模板(建议用 Excel 维护):
| 变量名 | 变量标签 | 题项编号 | 取值说明 | 类型 | 备注 |
|---|---|---|---|---|---|
| id | 受访者编号 | — | 1–N | int | 系统自动生成 |
| gender | 性别 | Q1 | 1=男, 2=女 | byte | — |
| age | 年龄 | Q2 | 18–80 | int | — |
| income | 家庭年收入 | Q3 | 1=<2万, 2=2-5万, 3=5-10万, 4=10-20万, 5=>20万 | byte | 区间化 |
| df1 | 数字金融使用1 | Q10_1 | 1=完全不同意 … 5=完全同意 | byte | Likert-5 |
数据清洗初步:删除无效问卷
在正式分析前,需剔除无效问卷。常用标准:
* ── 无效问卷筛除 ──
* 标准 1:答题时间过短(< 总题数 × 3 秒)
* 假设问卷有 30 题,阈值 = 90 秒
gen valid_time = (duration >= 90)
tab valid_time
* 记录删除数量
* 标准 2:全部选同一选项(直线作答)
egen row_max = rowmax(df1 df2 df3 df4 df5)
egen row_min = rowmin(df1 df2 df3 df4 df5)
gen valid_var = (row_max != row_min)
tab valid_var
* 标准 3:关键筛选题不符合(如非目标人群)
* gen valid_screen = (screen_q == 1)
* 综合判断
gen valid = valid_time & valid_var
tab valid
* 保留有效问卷
keep if valid == 1
drop valid_time row_max row_min valid_var valid
* 保存清洗后数据
save "survey_clean.dta", replace
di "有效样本量:" _NS7.2 诚信要求:问卷原始数据一经录入,不得事后修改。清洗操作必须有 do 文件记录(留痕),确保可复现。如果后续发现录入错误,应标注更正日志,而非直接覆盖。
AI 辅助研究栏 · 第 7 章
AI 在问卷调查中的合法应用
| 应用场景 | 具体做法 | 注意事项 |
|---|---|---|
| 问卷评审 | 将题项贴给 AI,问"这些问题是否存在双重提问、诱导性、模糊限定?" | AI 的建议仅供参考,最终措辞你来决定 |
| 编码簿生成 | 贴入变量列表,让 AI 生成 codebook 模板 | 生成后必须逐条核对 |
| 认知访谈辅助 | 预调研后,将受访者反馈贴给 AI,让它归纳常见问题 | 不要将受访者个人信息贴入 |
| 信效度解读 | 将 α 输出贴给 AI,让它帮你判断是否达标 | 删题决策必须基于理论,不能纯看数字 |
| 翻译 | 中英文问卷互译(跨文化研究) | 翻译后需回译验证(back-translation) |
AI 不能做的事
- ❌ 替你设计问卷的理论框架(那是第 2–5 章的工作)
- ❌ 伪造调查数据或编造不存在的受访者回答
- ❌ 替代伦理审查
- ❌ 在未经你确认的情况下自动修改题项
AI 诚信栏 · 第 7 章
S7.1 调查伦理(知情同意 + 数据脱敏)
┌─────────────────────────────────────────────────────┐
│ ✦ 诚信检查点 S7.1 │
│ │
│ 自查问题: │
│ □ 是否获得受访者的知情同意(书面或口头记录)? │
│ □ 数据是否已脱敏(不含姓名/身份证/精确地址)? │
│ □ 涉人研究是否通过学校伦理审查(或导师书面确认)? │
│ □ 访谈录音是否在转写后替换了真名? │
│ │
│ 违规后果:论文撤稿 / 学位撤销 / 法律责任 │
└─────────────────────────────────────────────────────┘S7.2 问卷数据不得事后修改
┌─────────────────────────────────────────────────────┐
│ ✦ 诚信检查点 S7.2 │
│ │
│ 核心原则: │
│ · 原始数据只读——录入后不覆盖、不篡改 │
│ · 清洗必须有 do 文件留痕——每一步操作可复现 │
│ · 更正日志——若发现录入错误,另建更正文件,标注: │
│ "ID=xxx,变量=age,原值=25,更正为=35, │
│ 原因:与纸质问卷核对不一致,日期:2026-10-15" │
│ · 绝不"美化"数据——不能因为某受访者回答"不合理" │
│ 就擅自修改为"合理"值 │
│ │
│ 留痕标准: │
│ · survey_raw.dta → 原始数据(只读,永不覆盖) │
│ · survey_clean.dta → 清洗后数据 │
│ · clean_log.do → 清洗操作脚本 │
└─────────────────────────────────────────────────────┘本章产出物
完成第 7 章学习后,你应产出以下文件:
| 序号 | 产出物 | 文件名建议 | 说明 |
|---|---|---|---|
| 1 | 预调研迭代版问卷 | my_questionnaire_v2.docx | 经预调研修订后的定稿 |
| 2 | 信效度检验输出 | reliability_validity.log | Stata α + EFA 完整日志 |
| 3 | 编码簿 | codebook.xlsx | 变量名/标签/取值/来源 |
| 4 | 知情同意书 | informed_consent.docx | 适用于你的调查对象 |
| 5 | 数据清洗脚本 | clean_log.do | 从原始到分析数据的全过程 |
自检题
请合上教材,独立完成以下 4 题:
1. 诊断题
"您对银行服务和手机 APP 满意吗?"——这题犯了什么错误?请改写为两道合格的题目。
参考答案
错误类型:双重问题(Double-barreled)——一题问了两件事,被访者无法分别评价。
改写:
- Q1:"您对银行网点的柜台服务整体满意吗?"(1=非常不满意 … 5=非常满意)
- Q2:"您对手机银行 APP 的使用体验整体满意吗?"(1=非常不满意 … 5=非常满意)
2. 简答题
无回答偏差的两种补救措施是什么?分别适用于什么情况?
参考答案
(1) 追踪+多次提醒:对未回应者发送 2–3 次提醒(适用于邮件/网络调查)
(2) 加权调整:根据已回答样本的人口统计特征,对样本施加权重使其逼近总体分布(适用于回收率确实无法提高时)
其他措施:替代样本(从同一层中随机替换)、提高激励、缩短问卷等。
3. 伦理判断题
访谈录音的转写稿算不算"需要知情同意的数据"?为什么?
参考答案
算。转写稿是访谈的完整记录,包含受访者的原话、观点、甚至可能泄露身份信息的内容。在开始录音前必须获得受访者的知情同意(最好书面),转写后需替换真名为代号进行脱敏处理。未经同意录音可能违反《个人信息保护法》。
4. 方向题(结合你的研究方向)
为你自己的研究构念设计 3 个 Likert-5 题项,并说明你将如何通过预调研验证其质量。
参考答案框架
示例(构念:农户数字金融信任):
- DF_T1:"我相信通过手机银行转账是安全的"
- DF_T2:"我担心数字金融平台会泄露我的个人信息"(反向题)
- DF_T3:"如果银行推荐数字金融产品,我愿意尝试"
预调研验证步骤:
- 找 5–8 名目标人群做认知访谈(逐题询问"你理解这题在问什么?")
- 小样本 (n=30–50) 施测
- 跑 Cronbach's α,若 < 0.7 则根据"α if deleted"删题或改写
- 跑 EFA 检查因子载荷,删除交叉载荷 > 0.4 的题项
- 修订后形成 v2 版本
下一章预告:第 8 章将从"数据已入库"出发,完成描述统计与数据体检——你的数据分析正式从这里开始。
农村金融业务及监管 2026 秋季 | AI 辅助金融研究学生自学手册