GIS在空间统计学中的应用:冷热点分析(Getis-Ord Gi*)

GIS基础理论
Dr.GIS
wowwwai GIS研习社 · 工具流程与项目排障

引言

《GIS在空间统计学中的应用:冷热点分析(Getis-Ord Gi*)》要解决的是一个很常见的问题:一张点数据或面数据看起来“某些地方很多、某些地方很少”,但我们如何判断这些高值区或低值区不是随机出现,而是具有统计显著性?冷热点分析就是为这个问题服务的。

在GIS项目中,冷热点分析常用于识别犯罪高发区、疾病聚集区、商业活跃区、交通事故密集区、房价高值区、生态风险低值区等空间模式。Getis-Ord Gi* 是冷热点分析中最常用的方法之一,它不仅看某个要素自身的数值,还会结合周边要素的数值,判断局部区域是否形成显著的高值聚集或低值聚集。

GIS在空间统计学中的应用 冷热点分析Getis-Ord Gi*结果示意图
Getis-Ord Gi* 冷热点分析的核心思路:根据要素及其邻域的属性值,识别显著高值聚集区和显著低值聚集区。

背景:为什么不能只看颜色深浅判断冷热点

很多GIS初学者会把分级设色图直接当作热点图。例如,某些街道的案件数量颜色更深,就认为那里是热点;某些区域颜色更浅,就认为那里是冷点。这个判断并不严谨。

原因是分级设色图只表达属性值大小,并不判断空间聚集是否显著。一个区域数值高,可能只是单个异常值;一个区域数值低,也可能只是总体分布的一部分。空间统计学关心的是:高值是否和高值相邻?低值是否和低值相邻?这种聚集是否显著到足以排除随机性?

Getis-Ord Gi* 冷热点分析正是用来回答这些问题。它通常输出三个关键结果:

  • Z得分:表示高值或低值聚集的强度。Z得分越高,越可能是热点;Z得分越低,越可能是冷点。
  • P值:表示结果随机出现的概率。P值越小,统计显著性越强。
  • 置信度等级:常见为90%、95%、99%显著性,用于地图表达和结果解释。

原理:Getis-Ord Gi* 冷热点分析到底在算什么

Getis-Ord Gi* 的核心思想并不复杂:对每一个空间要素,比较它及其邻近要素的属性值之和,与全局平均水平之间的差异。如果某个位置周边都是高值,并且这种高值聚集超过随机分布的可能范围,就会被识别为热点;如果周边都是低值,则可能被识别为冷点。

这里有两个关键概念需要理解。

1. 邻域关系

冷热点分析必须先定义“谁和谁是邻居”。常见方式包括:

  • 固定距离带:一定距离范围内的要素都算邻居,适合点数据和连续空间现象。
  • K近邻:每个要素选取最近的K个邻居,适合点分布不均匀的数据。
  • 面邻接关系:共享边或共享点的面要素算邻居,适合行政区、网格、地块等面数据。
  • 反距离权重:距离越近权重越高,距离越远权重越低,适合距离衰减明显的现象。

2. 属性值字段

Getis-Ord Gi* 不是直接对几何形状做判断,而是对某个数值字段进行分析。例如:

  • 犯罪案件数量
  • 人口密度
  • 店铺销售额
  • 交通事故次数
  • 空气污染浓度
  • 地块成交单价

如果字段本身质量不高,比如存在大量空值、单位不一致、极端异常值,冷热点分析结果就很容易误导。

步骤:在ArcGIS Pro中进行Getis-Ord Gi*冷热点分析

ArcGIS Pro 对 Getis-Ord Gi* 支持较完整,常用工具是 Hot Spot Analysis (Getis-Ord Gi*)。下面以“街道网格内事件数量”为例说明操作流程。

步骤1:准备输入数据

冷热点分析的输入数据可以是点、线、面,但最常见的是点聚合后的网格或行政区面数据。建议先确认以下内容:

  • 数据已投影到适合距离计算的投影坐标系,不建议直接使用经纬度坐标系进行距离邻域分析。
  • 每个要素都有一个可用于分析的数值字段,例如 case_countdensitysales
  • 分析区域边界完整,避免只截取中心城区导致边缘区域邻居不足。
  • 空值已处理,异常值已检查。

步骤2:打开热点分析工具

在 ArcGIS Pro 中依次打开:

  1. 点击 Analysis 选项卡。
  2. 进入 Tools 工具箱。
  3. 搜索 Hot Spot Analysis
  4. 选择 Hot Spot Analysis (Getis-Ord Gi*) 工具。

步骤3:设置核心参数

在工具参数中重点关注以下几项:

参数 建议设置 说明
Input Feature Class 输入点、网格或行政区数据 要进行冷热点分析的空间数据
Input Field 选择数值字段 例如案件数、密度、销售额等
Output Feature Class 设置输出结果路径 建议保存到文件地理数据库中
Conceptualization of Spatial Relationships 固定距离、K近邻、面邻接等 决定空间邻域如何定义
Distance Band or Threshold Distance 根据研究尺度设置 过大或过小都会影响结果
Standardization 通常使用行标准化 可降低邻居数量差异带来的影响

步骤4:选择合理的距离阈值

距离阈值是 Getis-Ord Gi* 冷热点分析中最容易出错的参数。距离太小,很多要素没有足够邻居;距离太大,局部差异会被平滑掉,热点边界变得模糊。

实务中可以采用以下方法确定距离:

  • 使用平均最近邻距离作为初始参考。
  • 根据业务尺度设置,例如步行服务范围、街道尺度、乡镇尺度。
  • 尝试多个距离阈值,观察热点是否稳定。
  • 避免只为了“做出好看的热点”而随意调参。

步骤5:运行工具并查看结果字段

运行完成后,输出图层通常会包含以下字段:

  • GiZScore:Z得分,正值越大表示热点越强,负值越小表示冷点越强。
  • GiPValue:P值,用于判断显著性。
  • Gi_Bin:显著性分级字段,常用于符号化。

一般情况下,Gi_Bin 可用于快速制图:

  • +3:99%置信度热点
  • +2:95%置信度热点
  • +1:90%置信度热点
  • 0:不显著
  • -1:90%置信度冷点
  • -2:95%置信度冷点
  • -3:99%置信度冷点

步骤6:符号化冷热点结果

建议使用红蓝发散色带表达结果:

  • 红色表示热点,颜色越深显著性越高。
  • 蓝色表示冷点,颜色越深显著性越高。
  • 灰色或浅色表示不显著区域。

制图时不要只保留热点而隐藏冷点和不显著区域。完整显示结果有助于读者理解空间格局,也能避免过度解读。

常见坑:冷热点分析结果不可信的原因

1. 使用经纬度坐标系直接做距离分析

如果数据仍是 WGS84 经纬度坐标,距离单位是度,不适合直接设置米、公里等距离阈值。进行 Getis-Ord Gi* 分析前,应将数据投影到适合研究区的投影坐标系,例如UTM、高斯克吕格或本地等距投影。

2. 把点密集区域误认为热点

点数据看起来密集,不一定代表属性值热点。如果分析的是事件点数量,应先聚合到网格或行政区,再对计数字段进行冷热点分析。否则,单纯点位密度和属性高值聚集容易混淆。

3. 分析字段选择错误

例如用“人口数量”分析疾病热点,可能得到的只是人口多的地方。更合理的做法是使用发病率、每万人案件数、单位面积强度等标准化指标。冷热点分析依赖输入字段,字段选错,统计结果再显著也没有业务意义。

4. 距离阈值只凭感觉设置

距离阈值决定邻域范围。若研究交通事故路口聚集,500米可能合适;若研究城市群经济活动,500米可能过小。参数必须与研究问题的空间尺度匹配。

5. 忽视边界效应

研究区边缘的要素邻居较少,容易受到边界效应影响。比如只截取一个行政区内部数据,但真实热点可能跨越边界。分析时应尽量包含周边缓冲区域,或在解释结果时说明边界限制。

方法比较:Getis-Ord Gi*、核密度和空间自相关怎么选

方法 适合问题 输出结果 注意事项
Getis-Ord Gi* 冷热点分析 判断高值或低值是否显著聚集 Z得分、P值、冷热点等级 需要合理定义邻域和分析字段
核密度分析 表达点事件空间密度 连续密度表面 主要反映密度,不直接提供显著性判断
全局 Moran’s I 判断整体是否存在空间自相关 全局统计量和显著性 不能定位具体热点或冷点
局部 Moran’s I 识别高高、低低、高低、低高聚集 局部聚类和异常值 更强调局部相似性和空间离群点

简单来说,如果你想知道“哪里是显著高值聚集区、哪里是显著低值聚集区”,优先考虑 Getis-Ord Gi*。如果你只是想看事件点在哪里更密集,可以先用核密度。若想判断整个研究区是否存在空间自相关,可以先做全局 Moran’s I,再进一步做局部分析。

检查清单:运行冷热点分析前后要核对什么

分析前检查

  • 研究问题是否明确:分析的是数量、密度、比率还是强度?
  • 输入数据是否已投影到合适的投影坐标系?
  • 分析字段是否为数值字段,并且没有大量空值?
  • 是否处理了明显异常值?
  • 空间单位是否合理,例如网格大小或行政区尺度是否符合业务问题?
  • 邻域关系是否与研究对象的空间作用机制一致?

分析后检查

  • 热点是否集中在少数孤立要素上?如果是,需要检查异常值。
  • 冷点是否出现在数据缺失区域?如果是,需要检查数据覆盖范围。
  • 不同距离阈值下,主要热点区域是否稳定?
  • 结果解释是否同时引用Z得分、P值和业务背景?
  • 地图图例是否清楚区分热点、冷点和不显著区域?
  • 是否说明了边界效应、数据时间范围和字段口径?

FAQ:冷热点分析(Getis-Ord Gi*)常见问题

1. Getis-Ord Gi* 的热点是不是数值最高的地方?

不一定。热点指的是高值在空间上显著聚集的区域,而不是单个数值最高的位置。一个区域自身数值很高,但周边都是低值,未必会被识别为显著热点。

2. 冷点是不是代表没有问题的区域?

不能简单这样理解。冷点表示低值显著聚集,但低值本身的业务含义取决于分析字段。例如犯罪率低的冷点可能是安全区域,但医院可达性低的冷点可能反而代表公共服务不足。

3. 冷热点分析必须使用面数据吗?

不是。点、线、面都可以参与分析,但在实际项目中,点事件通常会先聚合到网格或行政区,再对计数、密度或比率字段进行 Getis-Ord Gi* 分析,这样结果更容易解释。

4. 为什么我的冷热点分析结果全是不显著?

常见原因包括:分析字段空间差异不明显、距离阈值设置不合理、样本数量太少、数据噪声过大、研究尺度与现象不匹配。可以先检查字段分布,再尝试不同邻域参数。

5. Getis-Ord Gi* 和核密度分析可以一起用吗?

可以。核密度适合探索事件密度分布,Getis-Ord Gi* 适合判断高值或低值聚集是否具有统计显著性。实际工作中可以先用核密度观察趋势,再用冷热点分析验证显著区域。

6. 冷热点分析结果能直接作为决策依据吗?

不建议单独使用。冷热点分析提供的是统计证据,还需要结合数据来源、采集时间、业务机制、现场调查和政策目标进行综合判断。GIS结果应作为决策支持,而不是替代专业判断。

结论

Getis-Ord Gi* 冷热点分析是GIS在空间统计学中非常实用的一类方法,它能帮助我们从“看起来哪里高、哪里低”进一步走向“哪里存在显著高值聚集或低值聚集”。这对于犯罪分析、公共卫生、商业选址、交通安全和城市管理都很有价值。

真正做好冷热点分析,关键不在于点击工具按钮,而在于理解研究问题、选择合适字段、设置合理邻域、检查投影坐标系,并谨慎解释Z得分和P值。只要把这些环节控制好,Getis-Ord Gi* 就能成为空间统计分析中非常可靠的一把工具。