跳转至
For the complete DHIS2 documentation index, see llms.txt.

数据可视化最佳实践{ #data-visualization-best-practices }

介绍

数据可视化是理解和交流数据的有力工具。可视化的选择至关重要,应根据数据类型和需要传达的信息来决定。适当的可视化可以揭示原始数据中可能忽略的模式、趋势和见解。幸运的是,数据可视化遵循既定的规则和设计原则,与所使用的变量类型保持一致,确保数据可视化不是一个个人意见的问题,而是一个结构化的有效方法。

变量{ #variables }

任何可测量的特征都是变量
变量大致可分为两类:

  1. 分类(定性)
  2. 数字(定量)

了解这些类别对于选择正确的图表类型和有效设计图表至关重要。

分类变量{ #categorical-variables }

  • 名义 - 无序类别(如婚姻状况)。这些类别没有有意义的顺序。
  • 例如,单身、已婚、离婚和丧偶等婚姻状况是不同的类别,没有排列顺序。
  • 序数 - 具有有意义顺序的类别(如疾病状态)。这些类别具有逻辑顺序。
  • 例如,疾病的严重程度可分为轻度、中度和重度,这有其内在的顺序。

**二元变量是二分变量**的一个子类型,要么赋值为 0,要么赋值为 1(如男性(0)和女性(1))。它们代表两个类别,通常是简单的 "是/否"、"真/假 "条件。二分变量可以是离散变量,也可以是连续变量,与常规的离散变量和连续变量类似。

变量类别](resources/images/dataviz_001.png)

数值变量{ #numerical-variables }

  • 离散 - 可数变量(如兄弟姐妹数、死亡/存活 = 离散二分法)。离散变量取特定值,无法进行有意义的划分。
  • 例如,你不能有一半的兄弟姐妹,也不能有一半的生命。
  • 连续 - 在给定区间内取值无限(如体重和身高,及格/不及格 = 连续二分法)。连续变量可以在一定范围内取值。
  • 例如,高度可以是 170.5 厘米或 170.55 厘米。

选择合适的图表{ #choosing-the-right-chart }

怎样才能为手头的数据选择正确的可视化方式?从数据到可视化提出了一张与数据类别相匹配的可视化详尽地图。

另一个图表选择器映射在 Extreme Presentation Method 中。

以下摘要基于 DHIS2 数据展示台核心应用程序中的可视化内容。

分类变量{ #categorical-variables }

单一分类变量{ #single-categorical-variable }

  • 柱状图:使用条形图显示类别的频率或比例。每个条形代表一个类别,其高度表示数值。
  • 饼图:用圆片表示整体的各个部分。每个切片的大小与类别的频率成正比。
  • 蜘蛛图:也称为雷达图,它在坐标轴上显示从同一点开始的多个类别。适用于显示不同类别的性能指标。

多个分类变量{ #multiple-categorical-variables }

  • 分组/堆叠条形图:分组条形图并排显示每个类别的条形图,而堆叠条形图则将它们堆叠在一起。
  • 热图:使用颜色以矩阵格式表示数值,其中一个维度代表一个类别,另一个维度代表第二个类别。

数值变量{ #numerical-variables }

单一数值变量{ #single-numerical-variable }

  • 柱状图:通过将数据划分为多个分区并显示每个分区中观测值的频率,来显示数值变量的分布情况。

两个数值变量{ #two-numerical-variables }

  • 已订购
    • ** 面积图**:与折线图类似,但折线下的区域被填满。用于显示随时间变化的累积值。
    • 线形图:以直线连接的一系列数据点的形式显示信息。适合显示随时间变化的趋势。
  • 无序
    • 柱状图:也可用于比较两个不同变量的分布。
    • 散点图:将两个变量绘制成直角坐标平面上的点。每个点代表两个变量的观测值。

三个数字变量{ #three-numerical-variables }

  • 堆叠区域图:以层叠的形式显示多个数据系列。每个图层代表一个系列的值。
  • 线形图:可用于显示随时间变化的多个数据序列。

四个或更多数字变量{ #four-or-more-numerical-variables }

  • 已订购
    • 堆叠区域图:以层叠的形式显示多个数据系列。每个图层代表一个系列的值。
    • 线形图:这可以显示几个变量随时间变化的趋势。
  • 无序
    • 热图:使用颜色梯度来表示矩阵中的数据值,便于发现模式和异常值。

特定可视化样式{ #specific-visualization-styles }

数据胜于雄辩! **

在数据可视化中,选择正确的图表或图形类型对于有效传达数据至关重要。每种可视化风格都有其优势,最适合特定类型的数据和分析目的。本章将探讨各种可视化风格,详细介绍它们的应用和最佳实践。无论您是要显示随时间变化的趋势、比较数量、突出相关性,还是要说明整体的各个部分,选择适当的可视化方法都能提高清晰度和洞察力。通过了解每种风格的细微差别,您可以确保您的数据讲述了一个引人入胜且准确的故事。

DHIS2中可用的数据可视化样式](resources/images/dataviz_025.png)

相关{ #correlation }

注意事项

除非另有说明,否则相关性假定为因果关系。将相关性解释为因果关系时,请务必谨慎。

  • 散点图:显示两个连续变量之间的关系,每个变量都有自己的坐标轴。每个点代表两个变量的观测值。它有助于识别趋势、聚类和异常值。例如,散点图可以显示在不同地区开展的免疫接种活动次数与由此产生的免疫接种覆盖率之间的关系。

"扩大免疫方案绩效仪表板 "中的散点图,显示覆盖率与辍学率

  • 列+线时间轴:显示数量(列)和比率(线)之间的关系。这种组合通常用于比较一个数量及其随时间的变化率,如艾滋病毒检测患者(列)和阳性率(线)。

显示麻疹病例和覆盖率的双坐标轴图表,带列和线

排名{ #ranking }

强调项目在有序列表中的位置,而不是绝对值。

  • ** 排序条形图/列**:排序后更容易显示数值的等级。这种可视化方式有助于快速查看最高值和最低值。有序条形柱状图可用于显示每个地区的肺结核病例数,并按降序排序,以突出显示负担最重的地区。

按报告地区分列的肺结核病例有序堆叠条形图](resources/images/dataviz_005.png)

  • 斜坡:显示排名随时间的变化情况。可用于直观显示排名位置的变化,例如跟踪不同地区几年来的疟疾发病率,以了解地区发病率排名随时间的变化情况。

不同地区疟疾住院病人发病率随时间变化的斜率

随时间变化{ #change-over-time }

各列之间的间隙要小,以突出数据形状。 对不规则的数据点使用标记。

  • 专栏:强调变化趋势。柱状图用于显示一段时间内的离散数据点。例如,每月的案件数字可以用柱状图表示。
  • 保持柱状图中**列之间的间距**接近,对于强调数据的连续性和模式至关重要。如果各列之间的距离很近,就会产生更有凝聚力的视觉效果,从而更容易比较不同类别或时期的数值。这种紧密性有助于查看者快速识别趋势、变化和整体数据分布,从而提高图表的清晰度和有效性。此外,尽量减少列与列之间的间隙可以减少视觉上的混乱,并确保焦点始终集中在数据本身,而不是空白处。

每月艾滋病毒病例列

  • 线:最适合直观显示一段时间内的连续数据。折线图能有效显示趋势、周期和波动。例如,折线图可以跟踪一组患者 CD4 细胞计数随时间的变化,说明治疗干预的影响。

  • 年复一年(列和线) - 比较不同年份的同一时期,用线显示多年的趋势。例如,"YoY "线可用于比较不同年份的疟疾发病率,而 "YoY "列可用于直观显示不同年份的疟疾病例数。

  • ** 区域图**:适合显示总量的变化,但对于组成部分来说比较棘手。面积图对于说明趋势和随时间的变化非常有效,通过突出数据集的大小和总值,提供强烈的视觉冲击。它们对于显示累积数据和比较多个数据序列尤为有效。然而,当涉及多个类别时,它们可能会变得杂乱无章,难以阅读,因为区分单个成分可能具有挑战性。此外,下层的变化会扭曲上层的感知,可能导致误读。面积图虽然能有效突出总数,但不太适合离散数据点或非累积数据,对于色盲观众或黑白印刷品可能会有问题。例如,可以跟踪不同地区一年内报告的结核病或疟疾病例总数,以便直观地了解总体负担和趋势。

三个地区疟疾病例数量区域图](resources/images/dataviz_008.png)

幅度{ #magnitude }

小间隙突出显示数据形状。最适合单一数据系列。

  • 列/成对列/条:比较大小,通常是数字而不是比率或百分比。例如,可以用柱状图比较不同地区的艾滋病毒病例数字。在这种情况下,保持柱状图之间的距离是合适的,因为它们代表的是不同的实体,而不是时间上的变量。

不同地区开始接受抗逆转录病毒疗法的艾滋病毒新病例和艾滋病毒新病例的配对列](resources/images/dataviz_009.png)

性能指标{ #performance-metrics }

  • 雷达:雷达图又称蜘蛛图或网络图,可有效显示多个变量,是可视化绩效指标(如团队在各种技能方面的优缺点)的理想选择。它们能让人一目了然地全面查看数据,突出不同类别的比较绩效。然而,雷达图可能会变得杂乱无章,超过五个组就难以解释,导致线条重叠和呈现混乱。这种图表不适合趋势线可视化,因为它不能有效显示随时间推移而发生的变化。雷达图的优点是可以同时比较多个变量,直观形象。缺点是变量过多可能造成杂乱,难以进行精确比较,区域大小失真可能导致误读。常见的错误包括图表中变量过多、刻度不是从零开始,以及用它们来表示数据趋势而不是比较指标。

两区康复条件组别及其使用情况雷达图](resources/images/dataviz_010.png)

部分到整体{ #part-to-whole }

提示

记住色盲友好设计。在数据可视化应用程序中,您可以通过访问 **选项>样式>颜色设置**来更改图表的样式。

选择最合适的颜色集](resources/images/dataviz_022.png)

  • 堆叠列/条:显示单个实体如何分解成各个组成部分。这对于比较不同群体的组成非常有用。 在**需要对单个数据点进行详细比较时、在显示随时间变化的趋势时处理大量类别时、在数据类别不相加时、在突出显示单个部分变化时或在数据区间不均匀时,应避免使用堆叠柱形图或条形图。如果使用不当,这些图表可能会掩盖重要细节并导致误解。

肺结核病例的堆叠列 - 实验室确诊和临床确诊](resources/images/dataviz_011.png)

  • 派图:每个切片代表整体的一部分,可用于显示比例。在**比较多个类别、显示随时间变化的趋势、需要精确的数值表示、处理负值、总数没有意义以及复杂的数据集时,应避免使用饼图。这些限制可能会导致误解并掩盖重要细节,因此条形图、折线图或散点图等其他图表类型更适合这些情况。

已通报肺结核病例的性别](resources/images/dataviz_012.png)

单值显示{ #single-value-display }

  • 仪表:用于表示某一范围内的单一数值,类似于速度计。它非常适合用来显示实现目标的进展情况或与基准相比的当前状况。可用于显示当前免疫接种覆盖率占目标的百分比。

卡介苗覆盖率](resources/images/dataviz_026.png)
- 单一值:突出显示单一指标。有助于突出关键绩效指标(KPI)或关键数字。在 DHIS2 中,可以使用基于颜色的图例来突出进度或临界值。

卡介苗的覆盖率,带代表 EPI 覆盖阈值的彩色图例

详细分析{ #detailed-analyses }

  • 透视表:用于汇总、分析、探索和展示汇总数据。透视表是交互式的,可用于创建自定义报告。例如,可使用表格按地区和月份汇总肺结核病例数,允许用户深入到特定数据点进行更详细的分析。

补充免疫接种活动目标人群透视表,按年龄组、与接种点的距离和地点分列。注意行和列总数以及按类别分列的小计](resources/images/dataviz_028.png)

**记分卡**根据预定目标直观地显示关键绩效指标(KPI),从而提供附加值。记分卡对于跟踪进展情况、确定需要改进的领域以及一目了然地传达绩效信息尤为有用。例如,记分卡可以显示各医疗机构在患者满意度、员工效率和资源利用率方面的表现。这一工具可帮助利益相关方快速评估他们是否实现了目标,以及在哪些方面可能需要采取干预措施。记分卡促进了卫生系统内部的问责制和透明度,确保每个人都朝着共同的目标前进。

记分卡突出显示了常规 EPI 和 SIA 相关活动报告的 MR 覆盖率

空间{ #spatial }

  • Choropleth:地图比率标准。使用深浅不同的颜色来表示不同地区的数据值。例如,各地区的人口密度可以用 "choropleth "图来表示。

注意规范化--从技术上讲,不能在不同面积或人口的地区之间比较原始数据。一定要使用比率。

显示某地区肺结核病例百分比的地图

  • 比例符号:适合表示总数。在地图上放置不同大小的符号,表示每个地点的数值。

显示某地区已通报案件数量的地图

显示未接种儿童的位置和错过接种原因的地图

  • 点密度:显示事件发生的位置。每个点代表某种现象发生的固定次数。

该地区人口密度地图](resources/images/dataviz_021.png)

  • 热图:使用基于网格的数据值和强度色标。它显示数据密度,可用于显示在一个区域内平滑变化的数据,如温度变化率。

显示全国平均气温的地图](resources/images/dataviz_016.png)

谷歌地球与 DHIS2 集成{ #google-earth-integration-with-dhis2 }

DHIS2 与谷歌地球引擎进行了强大的集成,允许用户访问一系列详细的数据集,如人口(WorldPop)、建筑足迹、海拔高度、土地利用和气候数据。

将谷歌地球引擎与 DHIS2 集成的详细步骤和最佳实践可参见DHIS2 文档DHIS2 版本 2.39 概述。这些网页提供了有关 DHIS2 功能的全面指南和更新,包括与谷歌地球引擎的集成以及在 DHIS2 地图应用程序中使用人口、海拔、土地覆盖和气候图层的功能。

集成最佳实践{ #best-practices-for-integration }
  • 数据利用:利用谷歌地球引擎提供的大量数据集来加强空间分析。这包括整合人口密度地图、土地使用模式和气候数据,以更好地了解健康趋势和资源分布。
  • 定制:利用 DHIS2 地图绘制功能的灵活性,对集成进行定制,以满足您的卫生项目的特定需求。这可以包括定制地图图层,以突出与您的计划相关的关键指标。
  • 性能监控:定期监控和更新您的 Google 地球引擎访问和配置,以确保最佳性能和数据准确性。

常见错误{ #common-mistakes }

忽略数据密度{ #ignoring-data-density }

忽视数据密度问题会导致图表杂乱无章,难以解读。当数据点重叠过多时,重要的模式和趋势就会被掩盖,使浏览者难以提取有意义的见解。

意大利面图表{ #spaghetti-chart }

避免图表信息过多。意大利面条图是一种过于复杂的折线图,其中有许多交叉线,使人难以阅读。

图表显得杂乱无章,难以解读](resources/images/dataviz_017.png)

避免图表混乱的替代方法:

  • **小倍数**也称为面板图或棚架图,是一系列使用相同比例和坐标轴的类似图表,便于比较不同类别的数据。您可以创建多个折线图,并在仪表盘中相邻显示。例如,在不同的子图中显示不同地区的每月肺结核病例。
  • 组织单位。检查是否有必要为每个组织单位提供信息。在折线图中突出显示一个或几个关键系列,并用更柔和的颜色显示其余系列,以减少杂乱并强调重要趋势。例如,突出显示结核病例最多的地区,同时用浅色线条显示其他地区的情况。

下层 OU 的杂乱图形

  • **交互式仪表盘**允许用户动态过滤和探索数据,这对复杂的多序列数据尤其有用。在 DHIS2 "仪表盘 "中,用户可以选择特定地区或时期,查看结核病例的详细趋势。
  • **热图***使用颜色来表示矩阵中的数据值,便于比较两个维度的数值。DHIS2 中的地图可显示为单向(汇总)、分割视图或时间轴。

过于杂乱的视觉{ #overcluttered-visuals }

添加过多元素会使图表难以阅读。将重点放在最相关的数据上,并使用简洁明了的图例和标签,从而简化视觉效果

使用过多图层和数据点超载地图](resources/images/dataviz_023.png)

此外,该地图使用的配色方案可能不适合色盲人士使用,这使得相当一部分人难以理解。使用色盲友好的调色板,确保所有用户都能区分不同的数据值。ColorBrewer](https://colorbrewer2.org/) 等工具提供了专为色盲人士设计的调色板。请参阅本文档的 "部分到整体 "部分,了解如何更改可视化的颜色方案。

拥挤的仪表板{ #crammed-dashboards }

在一个仪表盘中挤入过多的可视化内容会使仪表盘变得难以阅读和无效。每个可视化内容都应有足够的空间进行解读。在仪表盘中加入过多元素会让浏览者不知所措,也会掩盖关键见解。应力求布局均衡,让每个可视化内容都能轻松阅读和理解。

仪表板中的项目太小,无法表达需要表达的内容,标签无法阅读,数据透视表没有空间显示变量

缺乏背景{ #lack-of-context }

如果不提供必要的上下文,如标签、标题、图例和解释性说明,会让观众对图表所表示的内容感到困惑。**上下文对于帮助观众理解所展示的数据并得出准确的结论**至关重要。

可视化应始终具备

  • 标题:一定要有一个描述性的标题,清楚地说明图表的内容。标题应提供足够的信息,使图表一目了然。
  • 轴标签:给 x 轴和 y 轴加上标签,说明它们所代表的数据。在适用的情况下包括测量单位。
  • 图例:使用颜色、符号或不同线条区分多个数据系列或类别时,应提供图例。确保图例清晰易懂。
  • 解释性说明:包括任何必要的解释性注释或脚注,以澄清数据来源、所作的任何假设或需要补充说明的特定数据点。在 DHIS2 中,点击可视化右侧的三个点,选择 "显示细节和解释",即可添加注释和解释。

情境化图表](resources/images/dataviz_024.png)

注意事项

由于 DHIS2 面板的互动性质,在标题中包含特定的时间范围(如 "过去 12 个月")可能会在应用筛选器(如将时间段更改为过去 6 个月)时导致混淆。标题和可视化数据之间的这种差异会造成误解。因此,建议避免在标题中指定时间范围,以保持清晰度和准确性。

饼图{ #pie-chart }

人类不善于阅读角度。避免使用饼图进行详细比较。在饼图中,很难准确比较切片的大小。
条形图或柱形图同样可以通过水平条形图进行比较,它们更注重类别之间的比较,而不是数值的比较。

要比较的类别数量较少的饼图

总计和部件{ #totals-and-parts }

在同一张图表中显示总数及其组成部分可能会产生误导、冗余和视觉混乱,使受众难以准确解读数据。为了提高清晰度和突出重点,最好使用单独的图表来表示总数及其组成部分。

  • 误导性表述:在同一张图表中合并总值和各部分可能会产生误导。总值包括所有部分,将它们放在一起可能会造成不同指标间比较的假象。此外,在一张图表中同时包含总值和部分值会影响图表的清晰度和重点。受众可能会觉得难以区分总值和单个贡献。
  • 比例问题:总数和各部分的比例通常相差很大。总数总是大于各部分,因此很难准确解释和比较较小的数值。
  • 冗余:在同一张图表中同时显示总数和各部分是多余的。因为总数只是各部分的总和,并不能提供额外的信息,而且会使可视化效果变得杂乱无章。

全国总剂量和各地区剂量

作为替代方案,人们可以选择

  • ** 单独的条形图**:使用一个条形图显示全国发放的总剂量,另一个条形图显示各地区发放的剂量。这种分隔方式可保持清晰度,便于比较和理解。
  • 堆叠条形图:使用堆叠条形图,每个条形图代表全国的总剂量,但条形图被分成若干部分,代表每个地区。这种方法将各部分和总数放在一起,但区分了各部分的贡献。这种方法只有在实体的数量不会使可视化效果变得杂乱无章并陷入与意大利面条图相同的陷阱时才可接受。

不适当的图表类型{ #inappropriate-chart-types }

为数据使用错误的图表类型可能会误导观众,模糊预期信息。每种图表类型都有其优缺点,选择正确的图表类型对于有效的数据可视化至关重要。

  • 例 1:使用折线图来显示分类数据是不合适的,例如按类型(如诊所、医院、流动医疗站)划分的医疗机构数量。折线图旨在显示随时间变化的趋势,并假定数据点有先后顺序。而分类数据没有自然顺序,最好用柱状图或饼状图表示。
  • 例 2:使用饼图来显示大量类别中的微小差异(如不同地区的疟疾病例数)是不合适的。饼图最适合显示差异大且容易区分的少量类别。如果类别较多,切片就会变得太小,难以区分,使图表难以阅读和解释。条形图更适合比较差异较小的多个类别。例如
  • 例 3:使用雷达图(也称蜘蛛图)显示随时间变化的趋势线是不合适的。雷达图的设计目的是以圆形格式比较不同类别的多个变量。它们不适合显示随时间推移的趋势,因为它们不按顺序排列,很难解释随时间推移的变 化。折线图或柱状图更适合用来说明随时间变化的趋势,因为它们沿着连续的时间轴描绘数据点的变化。

错误地使用蜘蛛图来显示肺结核病例在一段时间内的变化](resources/images/dataviz_029.png)

  • 示例 4:使用双轴图表,用列显示在不同地区进行的 HIV 检测次数(X 轴),用线描述这些地区的 HIV 检测阳性率是不恰当的。这条线错误地暗示了各地区之间的顺序关系和趋势。每个地区的阳性率都是一个独立的值,不应将它们连接起来,好像它们遵循的是一个连续的趋势。将这些数据可视化的最佳方法是使用数据透视表。使用数据透视表可以并列显示每个地区的 HIV 检测次数和阳性率,而不会暗示地区之间存在错误的趋势或关系。

双轴错误地统一了独立实体](resources/images/dataviz_030.png)

独立实体与随时间变化的对比{ #separate-entities-vs-change-over-time }

在可视化独立实体时,例如在不同地区分配的疫苗剂量,为每个地区使用不同的列有助于明确区分不同的实体。这种方法可确保每个地区的数据易于比较,突出不同地区之间疫苗分布的差异。相反,在直观显示随时间推移而发生的变化时,例如在特定组织单位中分发的疫苗数量,应尽量减少各栏之间的间隔,以强调期间的连续性和趋势。这种紧密的排列方式有助于说明疫苗分发的流程和进展,从而更容易识别数据中的模式、高峰和低谷。

左边是独立的实体,右边是随时间不断变化的实体](resources/images/dataviz_020.png)

结论{ #conclusion }

有效的数据可视化需要根据变量类型和想要传达的信息选择合适的图表类型。必须避免常见错误,确保受众一目了然。例如,在说明空间分布时,地图更有意义,因为它能有效显示集群以及高覆盖率和低覆盖率地区的分布。在检查工作时,如果绝对数字中包含用于比较的目标值,则更有意义。此外,为了进行准确的比较,对数据分布进行归一化处理至关重要。良好的可视化实践可加强理解,促进更好的决策,确保数据讲述一个令人信服和准确的故事。

您想测试一下自己对变量和数据可视化最佳实践的了解程度吗?参加 测验

其他资源{ #additional-resources }

讲述气候与健康数据故事:为支持 DHIS2 社区成员处理气候与健康数据,我们很高兴与大家分享由 data.org 团队开发的免费在线课程:数据讲故事:关注健康的气候传播