你的研究结果是否足够显著?最小效应量(SESOI)的作用

最小效应量(Smallest Effect Size of Interest,SESOI)逐渐成为开放科学(Open Science)、医学研究、心理学研究以及循证实践领域的重要概念。与传统统计学关注“效应是否存在”不同,SESOI关注的是另一个更重要的问题:这个效应是否足够大,值得我们认真对待?

更新于2026年6月29日

你的研究结果是否足够显著?最小效应量(SESOI)的作用

在科研训练中,几乎所有研究者都会被反复强调一个数字——P = 0.05。当实验结束、统计分析完成后,很多人最先关注的问题往往是:“结果显著了吗?”

如果P值小于0.05,研究似乎就成功了;如果P值大于0.05,研究似乎就失败了。

然而近年来,越来越多统计学家开始质疑这种二元化思维。一个结果即使达到了统计学显著性,也未必具有理论价值、临床价值或实际应用价值。特别是在大样本研究越来越普遍的今天,研究者甚至可以轻易获得统计学显著但几乎毫无实际意义的结果。

正是在这样的背景下,最小效应量(Smallest Effect Size of Interest,SESOI)逐渐成为开放科学(Open Science)、医学研究、心理学研究以及循证实践领域的重要概念。与传统统计学关注“效应是否存在”不同,SESOI关注的是另一个更重要的问题:这个效应是否足够大,值得我们认真对待?

对于科研人员而言,理解SESOI不仅有助于更合理地解释研究结果,还会影响研究设计、样本量计算、统计分析以及论文写作的整个过程。

为什么审稿人不满意一个P=0.03的结果?

假设你开发了一种新的降压药,并开展了一项大型随机对照试验。研究共纳入5000名高血压患者。结果显示,对照组平均收缩压为140 mmHg,实验组平均收缩压为139 mmHg,两组差异为1 mmHg。由于样本量巨大,统计分析得到:P = 0.002

按照传统标准,这显然是一项成功的研究。论文作者很可能会在摘要中写道:The treatment significantly reduced systolic blood pressure.

然而当论文进入同行评审阶段时,审稿人可能会提出一个非常关键的问题:“降低1 mmHg真的具有临床意义吗?”

事实上,对于高血压治疗而言,许多临床专家认为至少降低5 mmHg以上才可能带来明显的心血管获益。换句话说,虽然研究发现了统计学显著差异,但这种差异可能小到不足以改变临床决策。这正是SESOI试图解决的问题。SESOI的出现提醒研究者,仅仅证明效应存在是不够的,我们还需要证明这种效应足够重要。

什么是SESOI?它为什么越来越重要?

SESOI全称为 Smallest Effect Size of Interest,通常被翻译为“最小效应量”“最小关注效应量”或“最小有意义效应量”。简单来说,它指的是:一个效应至少要达到多大,研究者才认为它具有理论意义、实践意义或临床意义。

例如,一项教育学研究发现新的教学方法能够让学生平均成绩提高1分。虽然这一差异可能达到统计学显著,但对于学校管理者而言,1分的提升或许根本不足以支持课程改革。如果学校认为成绩至少提高5分才值得推广,那么5分就可以被视为该研究中的SESOI。

需要注意的是,SESOI并不是统计分析后计算出来的结果,而是在研究开始之前就应该被明确界定的标准。它类似于一条“价值分界线”,帮助研究者区分哪些效应值得关注,哪些效应虽然存在但并不重要。

SESOI之所以在近年来受到广泛关注,与学术界持续讨论的“可重复性危机(Replication Crisis)”密切相关。许多研究发现,大量发表论文虽然报告了显著结果,但实际效应极其微弱,难以复制,也缺乏现实意义。研究者逐渐意识到,单纯追求P值显著并不能保证研究具有科学价值。

因此,现代统计学开始强调:不仅要问“是否存在效应”,更要问“效应是否足够重要”。

SESOI如何改变研究结论?

SESOI最直观的价值体现在研究结果的解释上。同样的数据,在引入SESOI之后,结论往往会发生明显变化。

首先来看降压药案例。如果研究开始前预先规定:SESOI = 收缩压下降5 mmHg

最终结果显示平均下降1 mmHg,虽然P值小于0.01,但由于1 mmHg远低于5 mmHg,因此更合理的结论应当是:该药物能够产生统计学显著的降压作用,但尚未达到具有临床意义的效果。

再看教育学研究。某高校比较两种教学模式后发现,新教学法使学生考试成绩平均提高2分,统计分析显示P=0.01。然而学校管理层认为,只有提高5分以上才值得投入额外经费推广。此时研究虽然成功证明了差异存在,但从实践角度看并未达到预期价值。

心理学研究中也经常出现类似情况。假设研究者根据理论预先规定:Cohen's d = 0.30 为SESOI

实验结束后得到:Cohen's d = 0.18,P < 0.05

此时结果说明理论预测方向正确,但效应强度明显低于研究者预期。因此讨论部分不能简单宣称理论获得支持,而应当指出效应虽然存在,但其大小可能不足以支持重要理论推论。

这些例子共同说明,SESOI能够帮助研究者避免把所有显著结果都视为“成功发现”。

SESOI、效应量和P值到底是什么关系?

许多研究人员第一次接触SESOI时,容易将它与效应量(Effect Size)混为一谈。实际上,两者扮演着完全不同的角色。P值回答的问题是:效应是否能够与随机误差区分开来?效应量回答的问题是:效应究竟有多大?而SESOI回答的问题则是:多大的效应才值得关注?可以把三者理解为一个完整的决策体系。假设研究发现:

  • Cohen's d = 0.20
  • P = 0.001

如果研究者事先设定:

  • SESOI = 0.30

那么最终结论应当是:

效应存在(P值显著),效应大小为0.20(效应量),但尚未达到预先定义的重要程度(SESOI)。

从这个角度看,P值、效应量和SESOI并不是彼此替代的关系,而是共同构成结果解释的三个维度。

未来高质量研究的标准将不再是简单报告:

P < 0.05

而是同时报告:

P值、效应量及其相对于SESOI的位置。

SESOI与MCID有什么区别?

对于医学研究者而言,经常会接触另一个类似概念——MCID(Minimum Clinically Important Difference),即最小临床重要差异。事实上,MCID可以被看作SESOI在临床医学中的具体应用。

以慢性疼痛研究为例。研究人员常使用视觉模拟量表(Visual Analog Scale,VAS)评价疼痛程度。假设一项治疗使患者疼痛评分平均下降0.8分,统计分析显示P<0.001。

从统计学角度看,这无疑是一个显著结果。但问题在于,患者是否真正感觉到改善?

进一步研究发现,大多数患者需要至少下降2分以上,才会主观认为疼痛有所缓解。那么在这种情况下:

MCID = 2分

如果治疗效果只有0.8分,即使统计学显著,也不能认为其具有明确临床价值。

这也是近年来许多临床试验越来越强调MCID的原因。实际上,研究者完全可以将MCID视为临床研究中的SESOI,并据此设计研究、计算样本量以及解释结果。

SESOI是如何确定的?

确定SESOI往往是整个研究过程中最困难的环节,因为它涉及科学判断,而不仅仅是统计计算。

目前学术界主要采用四类思路来确定SESOI。

第一种方法是依据临床或实践意义确定阈值。例如糖尿病研究中,许多指南认为糖化血红蛋白(HbA1c)下降0.5%以上才具有临床价值;肿瘤学研究中,生存期延长3个月以上可能才被认为值得关注。这些标准通常来源于专家共识、临床指南或长期随访研究。

第二种方法是利益—成本分析。公共卫生研究经常采用这种思路。例如一种新疫苗即使只能降低1%的感染率,但如果面向数亿人口接种,仍然可能预防数十万病例。此时SESOI可以设置得相对较低,因为即便是微小效应也可能产生巨大社会效益。

第三种方法是理论驱动。许多基础科学研究并不存在明确的临床终点,因此研究者需要根据理论预测确定SESOI。例如某认知理论认为,只有达到Cohen's d=0.40以上的效应才足以支持理论机制。如果实验仅得到0.10或0.15的效应,即使显著,也无法构成有力证据。

第四种方法是近年来越来越受重视的锚定法(Anchor-Based Method)。这种方法直接从研究对象的感受出发,通过主观评价与客观指标建立联系。例如在生活质量研究中,研究者询问患者何时开始感觉症状改善,然后将这种主观变化对应到量表得分变化上,从而确定SESOI。

无论采用哪种方法,一个重要原则始终不变:SESOI应当在数据收集之前预先定义,而不是在结果出来之后再进行调整。

否则研究者很容易根据结果反向修改标准,从而产生解释偏差。

SESOI如何影响样本量计算?

对于科研人员来说,SESOI最实际的应用之一就是样本量设计。

传统样本量计算通常需要输入一个预期效应量。很多研究者直接参考文献,使用Cohen提出的小效应(0.2)、中等效应(0.5)或大效应(0.8)作为依据。然而这种做法经常受到批评,因为这些标准并不一定适用于具体研究问题。SESOI提供了一种更加科学的思路。研究者首先思考:多大的效应才值得关注?然后围绕这一效应设计研究。例如,一项心理学实验认为:d = 0.30 为SESOI

研究者随后进行样本量计算,确保研究具有80%统计功效来检测d=0.30的效应。如果最终研究未能发现d≥0.30的效应,那么即使存在更小的差异,也可能缺乏实际价值。

这种思路的优势在于,研究设计从一开始就围绕“有意义的效应”展开,而不是单纯追求显著性结果。

SESOI如何改变结果解释?

近年来,越来越多研究者建议同时关注零效应线(Null Value)和SESOI界限。

这也是你提供图片所表达的核心思想。

传统统计学只关注置信区间是否跨越零效应。如果95%置信区间不包含零,就认为结果显著。然而SESOI框架下,还需要进一步观察置信区间与SESOI的位置关系。

最理想的情况是整个置信区间完全位于SESOI以上。这意味着研究不仅发现了真实效应,而且这一效应已经达到临床或实践意义。

如果置信区间虽然排除了零效应,但部分区域仍然低于SESOI,则说明研究结果具有一定潜力,但尚不能确认其实际价值。

还有一种情况经常被忽视:置信区间完全高于零,却始终低于SESOI。这种结果属于典型的:Statistical significance without practical significance

即统计学显著,但缺乏实际意义。这种情况在大样本研究中非常常见,也是SESOI概念诞生的重要原因之一。

SESOI与等效性检验:从“发现差异”到“证明差异不重要”

SESOI的另一个重要应用是等效性检验。传统显著性检验的逻辑是:判断效应是否不同于零。而等效性检验则试图回答:效应是否小到可以忽略?

例如某仿制药研究并不需要证明药物比原研药更好,而是需要证明两者之间不存在具有临床意义的差异。此时研究者首先设定SESOI边界,例如±5%。如果结果显示差异完全落在这一范围内,就可以认为两种药物具有临床等效性。

事实上,目前大量非劣效试验(Non-Inferiority Trial)、生物等效性研究(Bioequivalence Study)以及医疗器械评价研究,都是建立在SESOI思想基础上的。

在论文中如何报告SESOI?

随着开放科学运动的发展,越来越多期刊开始鼓励作者明确报告SESOI及其确定依据。在研究设计部分,可以这样描述:Based on previous clinical evidence, a reduction of 5 mmHg in systolic blood pressure was defined as the smallest effect size of interest (SESOI).

在样本量计算部分,可以说明:

Sample size was determined to provide 80% power to detect the predefined SESOI.

在结果部分,则应同时报告实际效应与SESOI的比较:

Although the treatment effect was statistically significant (P = 0.01), the observed reduction of 2.1 mmHg did not exceed the predefined SESOI of 5 mmHg.

而在讨论部分,则应重点分析研究结果是否真正达到理论、临床或实践意义,而不仅仅关注统计显著性。这样的报告方式能够显著提升研究结论的解释力,也更符合当前高水平期刊倡导的统计报告规范。

最后

过去几十年,科研界几乎将P<0.05视为研究成功的标志。然而随着统计学的发展,人们越来越认识到,一个效应即使达到统计学显著,也未必具有科学价值。SESOI的出现代表了一种重要的思维转变。它要求研究者在研究开始之前就认真思考:如果实验成功,我期待看到多大的效应?以及:多大的效应才真正值得我投入时间、经费和科研资源去研究?

从这个角度看,SESOI不仅仅是一个统计学概念,更是一种科学决策框架。它帮助研究者将统计显著性与实际意义联系起来,使研究结论不再停留在“是否存在差异”的层面,而能够进一步回答:这种差异是否足够重要,值得改变理论认知、临床实践或现实决策?这或许正是未来科研统计学发展的方向:从关注“是否显著”,走向关注“是否重要”。

撰稿人
标签
学术研究
目录
订阅邮件
订阅我们的邮箱后可提前获得AJE作者资源的文章,享受AJE服务的折扣,以及更多的优惠

查看 "隐私协议"

AJE英文润色帮您彻底解决论文语言问题!

来自Nature的实验数据表明, 使用AJE的润色服务之后,来自中国的稿件接收率提高了50%。