技术文章
Technical articles
更新时间:2026-09-14
点击次数:8

NIH于2015 年发布 NOT-OD-15-103 通告,明确要求资助申请中的动物研究必须设计严谨,其中包括对样本量的科学论证。
也就是说,样本量不再只是投稿时会被问的问题,而是申请经费时就要交代的问题。
1.3R原则与 ARRIVE 2.0在两头夹击
1959 年,Russell & Burch s次提出 3R 原则:
Replacement 替代:能用细胞、类器官、计算模型,就不用动物;
Reduction 减少:用最少的动物获得可信结论;
Refinement 优化:减轻动物痛苦。
英国NC3Rs反复强调:Reduction绝不是“单纯少用动物",而是“设计得当、统计有效"。每组动物少到算不出可信结论,
实验等于白做,反而需要更多重复实验,最终用掉更多动物。
ARRIVE 2.0有一句g方表述被广泛引用:“样本量过小产生无结论结果,样本量过大则引发不必要使用动物的伦理问题。"
这句话把样本量从“技术问题"升格为“伦理问题":两端都是红线,中间才是合规区间。
ARRIVE Essential 10 之 Item 2(Sample size):论文必须报告每组确切n值,以及样本量是如何确定的——功效分析、资源方程,
还是基于既往经验,都要交代;②IACUC 普遍要求:伦理申请阶段就提交事前功效分析(a priori power analysis),
而不是事后补一句“样本量与既往研究一致"。
2.算n的第一条路:功效分析 Power Analysis
功效分析是 SCI 审稿人最认可的“金标准"算法,也是 IACUC 审查时最想看到的内容。它的逻辑很朴素:
如果真实效应存在,我这个实验有多大把握能检测到它?把握不够,就加动物;把握绰绰有余,就减动物。四个要素:
α(显著性水平):犯假阳性错误的容忍度,常规取 0.05;
Power(统计功效,1-β):检出真实效应的把握,常规取 80%,重要实验可到 95%;
δ(效应量):你希望检出的、有生物学意义的最小差异——注意是“生物学意义",不是“统计上能检出的最小值";
σ(标准差):指标的离散程度,来自预实验数据或已发表文献,是决定n大小最关键、也最依赖经验的参数。
两组独立样本 t检验的每组样本量公式为:
n = 2σ²(zα/2 + zβ)² / δ²
当 α=0.05、power=80% 时化简为:n ≈ 15.7σ²/δ² = 15.7/d²(d 为标准化效应量)
把σ与δ的比值换成标准化效应量 d,可以得到一张速查表:
标准化效应量 d | 效应大小 | 每组所需 n |
0.5 | 中等 | 约 64 只 |
0.8 | 较大 | 约 26 只 |
1.0 | 大 | 约 17 只 |
1.5 | 很大 | 约 7 只 |
2.5 | 极大 | 约 3 只 |
规律一目了然:效应越小,或噪声越大,所需动物越多。这也解释了为什么行为学实验往往比分子机制实验需要更多动物——不是行为学家“奢侈",而是他们的数据天生更“吵"。
工具推荐:不想手算,可以用免费软件G*Power,输入α、power、效应量三个参数即可出结果;NC3RsG方的EDA(Experimental Design Assistant)
在线工具也能辅助完成从分组设计到样本量估算的全流程,特别适合写伦理申请时使用。
3.算 n 的第二条路:Mead 资源方程
没有预实验数据、文献也查不到σ怎么办?可以用统计学家 Mead 提出的资源方程做快速估算。该方法出自 Mead 1988 年
《The Design of Experiments》,由 Arifin & Zahiruddin 2017 年公式化推广。
核心思想是看误差自由度 E:
E = N −组数(N 为动物总数),E 应在 10-20 之间
•两组比较:E = 2n − 2 落在 10-20,解得每组约 6-11 只;
•三组比较:E = 3n − 3 落在 10-20,解得每组约 5-7 只。
如何解读E? E < 10:自由度不足,此时增加动物能显著提升统计功效,值得加;E > 20:再增加动物,统计收益递减,
属于不必要的浪费,伦理上反而站不住脚。
现在回头看“每组 6 只":在两组比较场景下,它恰好踩在资源方程的下限(E=10)——不算离谱,但绝非放之四海而皆准。
组数一变、实验类型一变,它就可能失灵。把下限当标准答案,正是“惯例思维"最大的陷阱。
4CNS 顶刊实战:每组到底用了几只?
梳理 Nature/Cell/ Science系列论文图注原文中的真实n值,可以清晰分为四档:
标准化效应量 d | 效应大小 | 每组所需 n |
0.5 | 中等 | 约 64 只 |
0.8 | 较大 | 约 26 只 |
1.0 | 大 | 约 17 只 |
1.5 | 很大 | 约 7 只 |
2.5 | 极大 | 约 3 只 |
计算过程直接写进 Methods,让审稿人无从质疑。
规律总结:每组n随实验类型的变异度递增——机制 < 表型 < 行为 < 生存。这与功效分析速查表的预测W全吻合:
数据越“吵",需要的动物越多。选n之前,先想清楚你的实验在哪一档,再用公式验证,比背任何“惯例数字"都靠谱。
写在最后:最省动物的设计,不是“n 最小",而是“一次做对"
回到最初的问题:每组动物到底用几只?答案不是一个数字,而是一套逻辑:先定实验类型,再估效应与变异,
然后用公式算、用顶刊校准、用规范报告。
动物福利与科学严谨,是同一枚硬币的两面。用得太少,数据不可信,动物白白牺牲,还制造了不可重复的“学术噪声";
用得太多,超出统计所需,同样违背伦理。ARRIVE 2.0 把两者绑定在一起,正是这个时代科学共同体的共识:对动物最大的尊重,
是让每一只动物产生的数据都有意义。
最省动物的设计,不是“n最小",而是“一次做对"。一个功效不足的实验被迫重复三轮,消耗的动物和经费,
远超一开始就按n=11做足。所谓 Reduction,减的是“无效消耗",不是“必要投入"。
给实验室两个可立即执行的建议:其一,重视预实验。哪怕每组只做 3-5 只的小规模预实验,
也能积累本实验室自己的σ数据——别人的文献σ反映的是别人的动物、别人的仪器、别人的手,
只有自己的σ才是功效分析最宝贵的输入。其二,建立样本量计算SOP。
把“算 n—留存计算记录—写进伦理申请—写进 Methods—图注标注确切 n"固化成标准流程,让每一届学生照着做就行。