Skip to content

对应 Bhattacherjee 单元 8 | 概率抽样与非概率抽样全覆盖


📋 正面:核心框架

为什么抽样如此重要?

你不可能调查全国每一个农户。抽样决定了你的结论能推广到多大范围——抽得好,300 份问卷能代表几百万人;抽得差,3000 份问卷也只能代表你自己。

8 种抽样方法对比表

方法类型适用场景建议样本量关键要点stata-mcp 命令
简单随机概率总体同质、名单可获取≥ 30每个个体等概率被选中,最基础的方法sample 10, count
分层随机概率总体异质(东中西部、大中小规模)每层 ≥ 30先分层、再在各层内随机抽,保证各组代表性sample + strata() 选项
整群随机概率总体地理分散(村、县、学校)群数 ≥ 30随机选"群"(如村),群内全部调查,节省成本sample + cluster() 选项
系统抽样概率有序名单(如学号、门牌号)≥ 50每隔 k 个抽一个,简单高效sample 10
多阶段 PPS概率大规模调查(全国/全省)≥ 500逐级抽取(省→县→村→户),概率与规模成比例svyset 复杂设计
便利抽样非概率探索性研究、预测试不限谁方便找谁,成本低但代表性差❌ 不推荐推断
判断抽样非概率案例研究(理论化抽样)5-10 个案例研究者凭理论判断选择"最有信息量"的案例❌ 不推荐推断
滚雪球非概率罕见群体(如违约农户、地下经济)持续到信息饱和通过受访者推荐找到下一个受访者❌ 不推荐推断
配额抽样非概率快速市场调查≥ 200按预设配额(性别、年龄)填充,类似分层但不随机需事后加权校正

概率 vs 非概率:核心区别

概率抽样                          非概率抽样
───────────                      ───────────
✅ 每个个体有已知的入选概率        ❌ 入选概率未知
✅ 可以做统计推断(置信区间)      ❌ 不能做统计推断
✅ 结论可推广到总体                ⚠️ 结论仅适用于样本
📌 适用于:定量实证研究            📌 适用于:案例研究、探索性研究

样本量速算参考

研究类型最低样本量理想样本量计算依据
描述性调查30100+中心极限定理
回归分析变量数 × 10变量数 × 20经验法则
SEM 结构方程200300+Kline (2015) 推荐
案例研究4 个案例6-10 个Eisenhardt (1989)
深度访谈12 人20-30 人信息饱和原则

🔄 反面:自查与示例

农村金融研究抽样建议(三大场景)

场景 1:大样本调查(如"四川省农户信贷需求调查")

推荐方案:分层 + 多阶段 PPS 抽样

Step 1  按经济发展水平分层
        ├─ 高:成都平原(抽 3 县)
        ├─ 中:丘陵地区(抽 3 县)
        └─ 低:盆周山区(抽 3 县)

Step 2  每层内 PPS 抽乡镇(规模大的乡镇入选概率高)

Step 3  每乡镇内随机抽 2-3 个村

Step 4  每村随机抽 20-30 户农户

→ 总样本:9 县 × 2 乡镇 × 2.5 村 × 25 户 ≈ 1125 户
  • Stata 中用 svyset 声明复杂抽样设计后再跑回归,标准误才正确
  • 记得报告:抽样框、分层依据、应答率、设计效应(deff)

场景 2:案例研究(如"蒙牛供应链金融模式")

推荐方案:理论化抽样(不是随机!)

选择标准:
├─ 极端案例:做得最好 / 最差的(信息量最大)
├─ 启示性案例:代表了某种新趋势
├─ 反常案例:与现有理论矛盾(最有理论贡献)
└─ 复制逻辑:多案例之间形成"实验复制"

→ 建议选 3-6 个案例,太少缺乏广义性,太多分析不过来

关键提醒:案例研究的目的不是"代表总体",而是"深入理解机制"。不要用"样本量太小"来批评案例研究——这不是同一个研究范式。

场景 3:农户深度访谈(如"农户为什么不愿买农业保险")

推荐方案:分层 + 滚雪球

Step 1  按种植规模分层(大户/中户/散户)
Step 2  每层先找 2-3 个"种子受访者"(通过村委会)
Step 3  请种子受访者推荐同类农户(滚雪球)
Step 4  持续访谈直到"信息饱和"(新信息不再出现)

→ 通常 15-30 人即可达到饱和
→ 每层至少 5 人,确保异质性覆盖

抽样方法选择自查清单

  • [ ] 我的研究是定量还是定性?(定量→概率抽样;定性→非概率抽样)
  • [ ] 我的总体是什么?能否获取总体名单(抽样框)?
  • [ ] 总体是否异质?(异质→分层;分散→整群)
  • [ ] 我的样本量是否满足统计方法的最低要求?
  • [ ] 如果用非概率抽样,我是否在论文中说明了局限性?
  • [ ] 复杂抽样设计是否在 Stata 中用 svyset 声明?

常见错误

  • 错误 1:在毕业论文里用便利抽样(只问自己班同学)→ 样本完全不代表农村群体
  • 错误 2:用非概率抽样的数据做回归还报告 p 值 → 非概率抽样的 p 值没有统计意义
  • 错误 3:案例研究用"随机抽样"选案例 → 案例研究应该用理论化抽样,选信息量最大的案例
  • 错误 4:样本量太小还说"结果显著" → 样本量不足时,即使有真实效应也可能检验不出来(统计效力低)

农村金融业务及监管 2026 秋季 | 科研入门 V3 速通卡系列


本站教学资源仅供四川农业大学选课学生学习使用,版权归原作者所有,未经授权不得转载、转发或用于商业用途