对应 Bhattacherjee 单元 8 | 概率抽样与非概率抽样全覆盖
📋 正面:核心框架
为什么抽样如此重要?
你不可能调查全国每一个农户。抽样决定了你的结论能推广到多大范围——抽得好,300 份问卷能代表几百万人;抽得差,3000 份问卷也只能代表你自己。
8 种抽样方法对比表
| 方法 | 类型 | 适用场景 | 建议样本量 | 关键要点 | stata-mcp 命令 |
|---|---|---|---|---|---|
| 简单随机 | 概率 | 总体同质、名单可获取 | ≥ 30 | 每个个体等概率被选中,最基础的方法 | sample 10, count |
| 分层随机 | 概率 | 总体异质(东中西部、大中小规模) | 每层 ≥ 30 | 先分层、再在各层内随机抽,保证各组代表性 | sample + strata() 选项 |
| 整群随机 | 概率 | 总体地理分散(村、县、学校) | 群数 ≥ 30 | 随机选"群"(如村),群内全部调查,节省成本 | sample + cluster() 选项 |
| 系统抽样 | 概率 | 有序名单(如学号、门牌号) | ≥ 50 | 每隔 k 个抽一个,简单高效 | sample 10 |
| 多阶段 PPS | 概率 | 大规模调查(全国/全省) | ≥ 500 | 逐级抽取(省→县→村→户),概率与规模成比例 | 需 svyset 复杂设计 |
| 便利抽样 | 非概率 | 探索性研究、预测试 | 不限 | 谁方便找谁,成本低但代表性差 | ❌ 不推荐推断 |
| 判断抽样 | 非概率 | 案例研究(理论化抽样) | 5-10 个案例 | 研究者凭理论判断选择"最有信息量"的案例 | ❌ 不推荐推断 |
| 滚雪球 | 非概率 | 罕见群体(如违约农户、地下经济) | 持续到信息饱和 | 通过受访者推荐找到下一个受访者 | ❌ 不推荐推断 |
| 配额抽样 | 非概率 | 快速市场调查 | ≥ 200 | 按预设配额(性别、年龄)填充,类似分层但不随机 | 需事后加权校正 |
概率 vs 非概率:核心区别
概率抽样 非概率抽样
─────────── ───────────
✅ 每个个体有已知的入选概率 ❌ 入选概率未知
✅ 可以做统计推断(置信区间) ❌ 不能做统计推断
✅ 结论可推广到总体 ⚠️ 结论仅适用于样本
📌 适用于:定量实证研究 📌 适用于:案例研究、探索性研究样本量速算参考
| 研究类型 | 最低样本量 | 理想样本量 | 计算依据 |
|---|---|---|---|
| 描述性调查 | 30 | 100+ | 中心极限定理 |
| 回归分析 | 变量数 × 10 | 变量数 × 20 | 经验法则 |
| SEM 结构方程 | 200 | 300+ | Kline (2015) 推荐 |
| 案例研究 | 4 个案例 | 6-10 个 | Eisenhardt (1989) |
| 深度访谈 | 12 人 | 20-30 人 | 信息饱和原则 |
🔄 反面:自查与示例
农村金融研究抽样建议(三大场景)
场景 1:大样本调查(如"四川省农户信贷需求调查")
推荐方案:分层 + 多阶段 PPS 抽样
Step 1 按经济发展水平分层
├─ 高:成都平原(抽 3 县)
├─ 中:丘陵地区(抽 3 县)
└─ 低:盆周山区(抽 3 县)
Step 2 每层内 PPS 抽乡镇(规模大的乡镇入选概率高)
Step 3 每乡镇内随机抽 2-3 个村
Step 4 每村随机抽 20-30 户农户
→ 总样本:9 县 × 2 乡镇 × 2.5 村 × 25 户 ≈ 1125 户- Stata 中用
svyset声明复杂抽样设计后再跑回归,标准误才正确 - 记得报告:抽样框、分层依据、应答率、设计效应(deff)
场景 2:案例研究(如"蒙牛供应链金融模式")
推荐方案:理论化抽样(不是随机!)
选择标准:
├─ 极端案例:做得最好 / 最差的(信息量最大)
├─ 启示性案例:代表了某种新趋势
├─ 反常案例:与现有理论矛盾(最有理论贡献)
└─ 复制逻辑:多案例之间形成"实验复制"
→ 建议选 3-6 个案例,太少缺乏广义性,太多分析不过来关键提醒:案例研究的目的不是"代表总体",而是"深入理解机制"。不要用"样本量太小"来批评案例研究——这不是同一个研究范式。
场景 3:农户深度访谈(如"农户为什么不愿买农业保险")
推荐方案:分层 + 滚雪球
Step 1 按种植规模分层(大户/中户/散户)
Step 2 每层先找 2-3 个"种子受访者"(通过村委会)
Step 3 请种子受访者推荐同类农户(滚雪球)
Step 4 持续访谈直到"信息饱和"(新信息不再出现)
→ 通常 15-30 人即可达到饱和
→ 每层至少 5 人,确保异质性覆盖抽样方法选择自查清单
- [ ] 我的研究是定量还是定性?(定量→概率抽样;定性→非概率抽样)
- [ ] 我的总体是什么?能否获取总体名单(抽样框)?
- [ ] 总体是否异质?(异质→分层;分散→整群)
- [ ] 我的样本量是否满足统计方法的最低要求?
- [ ] 如果用非概率抽样,我是否在论文中说明了局限性?
- [ ] 复杂抽样设计是否在 Stata 中用
svyset声明?
常见错误
- 错误 1:在毕业论文里用便利抽样(只问自己班同学)→ 样本完全不代表农村群体
- 错误 2:用非概率抽样的数据做回归还报告 p 值 → 非概率抽样的 p 值没有统计意义
- 错误 3:案例研究用"随机抽样"选案例 → 案例研究应该用理论化抽样,选信息量最大的案例
- 错误 4:样本量太小还说"结果显著" → 样本量不足时,即使有真实效应也可能检验不出来(统计效力低)
农村金融业务及监管 2026 秋季 | 科研入门 V3 速通卡系列