
在科研论文中,图表不仅承担“展示数据”的任务,更重要的是帮助读者快速理解变量之间的关系。散点图就是其中最常见、也最容易被误用的一类统计图形。与柱状图主要用于比较不同组别的大小、折线图主要用于呈现随时间变化的趋势不同,散点图关注的是两个连续变量之间是否存在某种关系,以及这种关系呈现出什么样的模式。
例如,研究者想分析年龄与收缩压之间的关系、基因表达量与疾病严重程度之间的关系、药物浓度与细胞存活率之间的关系,都可以考虑使用散点图。图中的每一个点通常代表一个独立观测对象,点的横坐标表示一个变量,纵坐标表示另一个变量。通过观察点云的分布,可以初步判断变量之间是否存在正相关、负相关、非线性关系或者明显的离群值。
需要特别注意的是,散点图能够帮助我们发现关系和模式,但不能单凭图形证明因果关系。即使两个变量在散点图中呈现出很强的相关性,也不能直接得出“X导致Y”的结论。科研分析中,散点图往往是探索性数据分析的第一步,之后还需要结合相关分析、回归分析以及研究设计进行进一步判断。
散点图的历史
散点图的思想可以追溯到19世纪的数据可视化实践。随着统计学的发展,研究者开始意识到,仅仅比较变量的平均值并不能充分描述数据,变量之间的关系同样值得被直观呈现。

散点图示意图,图源:https://data.europa.eu/
19世纪末,英国统计学家 Francis Galton 在研究遗传与身高问题时,大量使用了后来被认为与现代散点图非常接近的图形。他在研究父母身高与子代身高之间的关系时,将成对观测值绘制在二维坐标系中,通过点的整体分布观察两个变量之间的关联,并由此发展出著名的“回归”思想。
随后,Karl Pearson 等统计学家进一步推动了相关系数和回归分析的发展,使散点图逐渐成为统计学中分析两个变量关系的重要工具。
进入计算机时代后,散点图的制作成本大幅下降。Excel、SPSS、GraphPad Prism、R、Python、Origin 等软件都可以快速生成散点图。现代科研绘图中,散点图已经不再只是“把数据点画出来”,还经常结合回归线、置信区间、分组、颜色、点大小等元素,从而展示更加丰富的信息。
散点图的主要类型
最基本的散点图是二维散点图,即一个横轴变量X和一个纵轴变量Y,每个点代表一条观测数据。如果研究对象有多个组,可以使用不同颜色或不同形状区分组别,例如分别展示治疗组和对照组的数据。
根据研究目的不同,散点图还可以进一步扩展。带回归线的散点图适合展示变量之间的总体趋势,常见的是线性回归线,并可同时给出95%置信区间。需要强调的是,回归线并不是散点图本身的必要组成部分,是否添加应根据研究问题和统计模型决定。
当数据存在明显的非线性关系时,可以使用曲线拟合,例如二次回归或局部加权回归。对于大量重叠的数据点,可以考虑透明度、抖动或二维密度图,避免大量点重叠后无法判断数据分布。
如果第三个变量也需要表达,可以使用气泡图,通过点的大小编码第三个变量;如果需要展示多个类别,则可以通过颜色、形状或分面进行区分。但这些扩展形式也会增加图形复杂度,科研论文中应避免为了“信息更多”而无限增加视觉元素。
散点图的适用条件
散点图最适合用于两个定量变量之间的关系分析,尤其是连续变量。例如年龄、身高、体重、血压、浓度、基因表达量、实验测量值等。
其次,每一个点通常应该对应一个相对独立的观测单位。如果同一个受试者在多个时间点被重复测量,那么这些数据并不满足简单散点图背后的独立性假设。此时虽然仍然可以绘制散点图进行可视化,但统计分析可能需要采用重复测量模型、混合效应模型等方法。
此外,在使用散点图探索线性相关或线性回归之前,应注意检查变量之间是否大致呈现线性关系。还需要观察是否存在极端离群值,因为少数异常点可能显著影响相关系数和回归结果。
例如,当数据呈现明显的U形关系时,Pearson相关系数可能接近0,但这并不意味着两个变量之间不存在关系。此时如果研究者只报告“r≈0,因此没有相关性”,就可能产生错误结论。
因此,散点图真正重要的价值之一,就是在正式统计检验之前帮助研究者先看数据:是否线性?是否有离群值?是否存在分组?是否存在异方差?是否存在明显的非线性结构?这些问题都应该在选择统计方法之前考虑。
适用条件不满足时,有哪些替代方法?
如果两个变量并非连续变量,散点图通常不是最佳选择。例如,一个变量是分类变量,另一个变量是连续变量,那么箱线图(box plot)、小提琴图(violin plot)或蜂群图(beeswarm plot)往往更加合适。
如果两个变量都是分类变量,则可以考虑列联表(contingency table)、堆叠柱状图或马赛克图(mosaic plot)。
如果两个连续变量之间存在大量点重叠,普通散点图可能无法准确反映数据密度。这时可以采用透明散点图、二维直方图(2D histogram)、六边形分箱图(hexbin plot)或二维密度图。
如果数据严重偏离正态分布,或者研究者关注的是单调关系而不是线性关系,可以考虑Spearman秩相关(Spearman's rank correlation)等非参数方法。需要注意,统计检验方法的选择和图形类型并不是完全绑定的。例如,即使使用Spearman相关,也完全可以绘制散点图来展示原始数据,只是在图中解释关系时不能简单套用线性相关的逻辑。
对于纵向数据、重复测量数据或具有明显层级结构的数据,则需要考虑混合效应模型(mixed-effects model)、广义估计方程(GEE)等方法。此时普通散点图可以用于辅助展示,但不应替代正确的统计模型。
散点图的规范操作步骤
绘制散点图之前,首先需要明确研究问题:究竟想观察哪两个变量之间的关系?通常将解释变量或预测变量放在X轴,将结果变量放在Y轴。轴标题应写清变量名称和单位,例如“Age (years)”或“Serum concentration (ng/mL)”,而不是简单写“X”和“Y”。
接下来检查数据。确认每一个点是否对应一个独立观测,检查缺失值、异常值和录入错误,并确认变量的测量单位一致。对于科研数据,不能为了让图形“更好看”而随意删除离群点。任何排除数据的操作都应该有明确的统计或研究设计依据,并在方法部分说明。
完成数据检查后即可绘制散点图。以常见科研软件为例,SPSS通常可以通过“图形”中的散点图功能创建基本图形;GraphPad Prism可以直接选择XY数据表,将一个变量作为X值、另一个变量作为Y值,然后进一步添加回归分析;R和Python则能够提供更加灵活的绘图和统计分析能力。
绘图完成后,还需要进行图形诊断。重点观察点云的整体趋势、离群点、聚类现象、非线性关系以及方差是否随X变化而发生明显变化。如果添加回归线,应确保所使用的回归模型与数据结构相匹配。对于论文中的正式图形,还应统一字体、字号、坐标轴、单位和图例格式,使图形能够在缩小后仍然清晰可读。
最后,根据期刊要求导出图片。科研论文通常需要较高分辨率的图像,具体格式和分辨率应以目标期刊的作者指南为准。对于统计图形,应尽量保留矢量格式,以减少放大或排版过程中出现的清晰度损失。
散点图的优势与局限
散点图最大的优势是直观。相比只报告一个相关系数,散点图能够让读者直接看到原始数据的分布,因此特别适合科研论文中的探索性分析和结果展示。它可以同时呈现趋势、离群值、数据聚集以及非线性模式,这些信息往往是一个简单的均值±标准差无法提供的。
另一个优势是散点图能够与统计模型很好地结合。例如,可以在原始数据上叠加线性回归线和95%置信区间,同时报告相关系数、回归系数和P值,使“视觉证据”和“统计证据”相互补充。
但散点图也存在明显局限。首先,当样本量非常大时,点可能严重重叠,导致数据密度无法判断。其次,散点图容易让研究者产生“看起来有趋势就是有统计学意义”的错觉。视觉上的趋势并不等同于统计学显著性。
此外,散点图最常见的误用之一是把相关关系解释成因果关系。例如,如果散点图显示运动时间与健康指标之间存在正相关,不能据此直接证明运动导致健康指标改善,因为年龄、生活方式、疾病状态等混杂因素都可能影响结果。
因此,一张优秀的散点图应该服务于统计分析,而不是代替统计分析。
实际科研应用举例
假设某项临床研究纳入100名受试者,研究者希望分析年龄与收缩压之间是否存在关系。此时可以将年龄放在X轴,将收缩压放在Y轴,每个点代表一名受试者。
从图形上可以初步观察到,随着年龄增加,收缩压总体呈上升趋势。但这里的“趋势”只是探索性观察,不能直接得出年龄导致血压升高的因果结论。
如果进一步进行Pearson相关分析,可以量化两个连续变量之间的线性相关程度;如果数据不满足相应条件,也可以考虑Spearman相关。若研究者希望进一步控制性别、BMI、吸烟状态等混杂因素,则可以建立多元线性回归模型。
更进一步,如果研究数据来自多个时间点,例如同一批患者在治疗前、治疗后4周、8周和12周反复测量,那么就不能简单地把所有点当成彼此独立的观测。此时散点图仍然可以用于可视化,但正式统计分析应根据研究设计选择重复测量或混合效应模型。
因此,在实际科研工作中,散点图最理想的使用方式并不是“画一张图就结束”,而是形成一个完整的数据分析流程:
原始数据 → 散点图探索 → 检查分布与异常值 → 判断关系形式 → 选择相关或回归方法 → 建立统计模型 → 报告效应量及置信区间。
最后
散点图看似简单,实际上是科研数据分析中非常重要的一种图形。它最大的价值并不是告诉读者“两个变量是否相关”,而是让研究者和读者看到数据本身究竟是什么样子。
在规范使用散点图时,应重点关注三个问题:第一,数据是否适合用散点图表达;第二,点云呈现的是线性、非线性还是其他复杂关系;第三,图形观察结果是否与后续统计分析相一致。
尤其需要牢记的是,相关不等于因果。一张漂亮的散点图可以帮助我们发现科学问题,但真正可靠的科研结论仍然需要建立在合理的研究设计、恰当的统计方法和透明的数据分析基础之上。
