GIS在空间统计学中的应用:冷热点分析(Getis-Ord Gi*)
引言
《GIS在空间统计学中的应用:冷热点分析(Getis-Ord Gi*)》要解决的是一个很常见的问题:一张点数据或面数据看起来“某些地方很多、某些地方很少”,但我们如何判断这些高值区或低值区不是随机出现,而是具有统计显著性?冷热点分析就是为这个问题服务的。
在GIS项目中,冷热点分析常用于识别犯罪高发区、疾病聚集区、商业活跃区、交通事故密集区、房价高值区、生态风险低值区等空间模式。Getis-Ord Gi* 是冷热点分析中最常用的方法之一,它不仅看某个要素自身的数值,还会结合周边要素的数值,判断局部区域是否形成显著的高值聚集或低值聚集。

背景:为什么不能只看颜色深浅判断冷热点
很多GIS初学者会把分级设色图直接当作热点图。例如,某些街道的案件数量颜色更深,就认为那里是热点;某些区域颜色更浅,就认为那里是冷点。这个判断并不严谨。
原因是分级设色图只表达属性值大小,并不判断空间聚集是否显著。一个区域数值高,可能只是单个异常值;一个区域数值低,也可能只是总体分布的一部分。空间统计学关心的是:高值是否和高值相邻?低值是否和低值相邻?这种聚集是否显著到足以排除随机性?
Getis-Ord Gi* 冷热点分析正是用来回答这些问题。它通常输出三个关键结果:
- Z得分:表示高值或低值聚集的强度。Z得分越高,越可能是热点;Z得分越低,越可能是冷点。
- P值:表示结果随机出现的概率。P值越小,统计显著性越强。
- 置信度等级:常见为90%、95%、99%显著性,用于地图表达和结果解释。
原理:Getis-Ord Gi* 冷热点分析到底在算什么
Getis-Ord Gi* 的核心思想并不复杂:对每一个空间要素,比较它及其邻近要素的属性值之和,与全局平均水平之间的差异。如果某个位置周边都是高值,并且这种高值聚集超过随机分布的可能范围,就会被识别为热点;如果周边都是低值,则可能被识别为冷点。
这里有两个关键概念需要理解。
1. 邻域关系
冷热点分析必须先定义“谁和谁是邻居”。常见方式包括:
- 固定距离带:一定距离范围内的要素都算邻居,适合点数据和连续空间现象。
- K近邻:每个要素选取最近的K个邻居,适合点分布不均匀的数据。
- 面邻接关系:共享边或共享点的面要素算邻居,适合行政区、网格、地块等面数据。
- 反距离权重:距离越近权重越高,距离越远权重越低,适合距离衰减明显的现象。
2. 属性值字段
Getis-Ord Gi* 不是直接对几何形状做判断,而是对某个数值字段进行分析。例如:
- 犯罪案件数量
- 人口密度
- 店铺销售额
- 交通事故次数
- 空气污染浓度
- 地块成交单价
如果字段本身质量不高,比如存在大量空值、单位不一致、极端异常值,冷热点分析结果就很容易误导。
步骤:在ArcGIS Pro中进行Getis-Ord Gi*冷热点分析
ArcGIS Pro 对 Getis-Ord Gi* 支持较完整,常用工具是 Hot Spot Analysis (Getis-Ord Gi*)。下面以“街道网格内事件数量”为例说明操作流程。
步骤1:准备输入数据
冷热点分析的输入数据可以是点、线、面,但最常见的是点聚合后的网格或行政区面数据。建议先确认以下内容:
- 数据已投影到适合距离计算的投影坐标系,不建议直接使用经纬度坐标系进行距离邻域分析。
- 每个要素都有一个可用于分析的数值字段,例如 case_count、density、sales。
- 分析区域边界完整,避免只截取中心城区导致边缘区域邻居不足。
- 空值已处理,异常值已检查。
步骤2:打开热点分析工具
在 ArcGIS Pro 中依次打开:
- 点击 Analysis 选项卡。
- 进入 Tools 工具箱。
- 搜索 Hot Spot Analysis。
- 选择 Hot Spot Analysis (Getis-Ord Gi*) 工具。
步骤3:设置核心参数
在工具参数中重点关注以下几项:
| 参数 | 建议设置 | 说明 |
|---|---|---|
| Input Feature Class | 输入点、网格或行政区数据 | 要进行冷热点分析的空间数据 |
| Input Field | 选择数值字段 | 例如案件数、密度、销售额等 |
| Output Feature Class | 设置输出结果路径 | 建议保存到文件地理数据库中 |
| Conceptualization of Spatial Relationships | 固定距离、K近邻、面邻接等 | 决定空间邻域如何定义 |
| Distance Band or Threshold Distance | 根据研究尺度设置 | 过大或过小都会影响结果 |
| Standardization | 通常使用行标准化 | 可降低邻居数量差异带来的影响 |
步骤4:选择合理的距离阈值
距离阈值是 Getis-Ord Gi* 冷热点分析中最容易出错的参数。距离太小,很多要素没有足够邻居;距离太大,局部差异会被平滑掉,热点边界变得模糊。
实务中可以采用以下方法确定距离:
- 使用平均最近邻距离作为初始参考。
- 根据业务尺度设置,例如步行服务范围、街道尺度、乡镇尺度。
- 尝试多个距离阈值,观察热点是否稳定。
- 避免只为了“做出好看的热点”而随意调参。
步骤5:运行工具并查看结果字段
运行完成后,输出图层通常会包含以下字段:
- GiZScore:Z得分,正值越大表示热点越强,负值越小表示冷点越强。
- GiPValue:P值,用于判断显著性。
- Gi_Bin:显著性分级字段,常用于符号化。
一般情况下,Gi_Bin 可用于快速制图:
- +3:99%置信度热点
- +2:95%置信度热点
- +1:90%置信度热点
- 0:不显著
- -1:90%置信度冷点
- -2:95%置信度冷点
- -3:99%置信度冷点
步骤6:符号化冷热点结果
建议使用红蓝发散色带表达结果:
- 红色表示热点,颜色越深显著性越高。
- 蓝色表示冷点,颜色越深显著性越高。
- 灰色或浅色表示不显著区域。
制图时不要只保留热点而隐藏冷点和不显著区域。完整显示结果有助于读者理解空间格局,也能避免过度解读。
常见坑:冷热点分析结果不可信的原因
1. 使用经纬度坐标系直接做距离分析
如果数据仍是 WGS84 经纬度坐标,距离单位是度,不适合直接设置米、公里等距离阈值。进行 Getis-Ord Gi* 分析前,应将数据投影到适合研究区的投影坐标系,例如UTM、高斯克吕格或本地等距投影。
2. 把点密集区域误认为热点
点数据看起来密集,不一定代表属性值热点。如果分析的是事件点数量,应先聚合到网格或行政区,再对计数字段进行冷热点分析。否则,单纯点位密度和属性高值聚集容易混淆。
3. 分析字段选择错误
例如用“人口数量”分析疾病热点,可能得到的只是人口多的地方。更合理的做法是使用发病率、每万人案件数、单位面积强度等标准化指标。冷热点分析依赖输入字段,字段选错,统计结果再显著也没有业务意义。
4. 距离阈值只凭感觉设置
距离阈值决定邻域范围。若研究交通事故路口聚集,500米可能合适;若研究城市群经济活动,500米可能过小。参数必须与研究问题的空间尺度匹配。
5. 忽视边界效应
研究区边缘的要素邻居较少,容易受到边界效应影响。比如只截取一个行政区内部数据,但真实热点可能跨越边界。分析时应尽量包含周边缓冲区域,或在解释结果时说明边界限制。
方法比较:Getis-Ord Gi*、核密度和空间自相关怎么选
| 方法 | 适合问题 | 输出结果 | 注意事项 |
|---|---|---|---|
| Getis-Ord Gi* 冷热点分析 | 判断高值或低值是否显著聚集 | Z得分、P值、冷热点等级 | 需要合理定义邻域和分析字段 |
| 核密度分析 | 表达点事件空间密度 | 连续密度表面 | 主要反映密度,不直接提供显著性判断 |
| 全局 Moran’s I | 判断整体是否存在空间自相关 | 全局统计量和显著性 | 不能定位具体热点或冷点 |
| 局部 Moran’s I | 识别高高、低低、高低、低高聚集 | 局部聚类和异常值 | 更强调局部相似性和空间离群点 |
简单来说,如果你想知道“哪里是显著高值聚集区、哪里是显著低值聚集区”,优先考虑 Getis-Ord Gi*。如果你只是想看事件点在哪里更密集,可以先用核密度。若想判断整个研究区是否存在空间自相关,可以先做全局 Moran’s I,再进一步做局部分析。
检查清单:运行冷热点分析前后要核对什么
分析前检查
- 研究问题是否明确:分析的是数量、密度、比率还是强度?
- 输入数据是否已投影到合适的投影坐标系?
- 分析字段是否为数值字段,并且没有大量空值?
- 是否处理了明显异常值?
- 空间单位是否合理,例如网格大小或行政区尺度是否符合业务问题?
- 邻域关系是否与研究对象的空间作用机制一致?
分析后检查
- 热点是否集中在少数孤立要素上?如果是,需要检查异常值。
- 冷点是否出现在数据缺失区域?如果是,需要检查数据覆盖范围。
- 不同距离阈值下,主要热点区域是否稳定?
- 结果解释是否同时引用Z得分、P值和业务背景?
- 地图图例是否清楚区分热点、冷点和不显著区域?
- 是否说明了边界效应、数据时间范围和字段口径?
FAQ:冷热点分析(Getis-Ord Gi*)常见问题
1. Getis-Ord Gi* 的热点是不是数值最高的地方?
不一定。热点指的是高值在空间上显著聚集的区域,而不是单个数值最高的位置。一个区域自身数值很高,但周边都是低值,未必会被识别为显著热点。
2. 冷点是不是代表没有问题的区域?
不能简单这样理解。冷点表示低值显著聚集,但低值本身的业务含义取决于分析字段。例如犯罪率低的冷点可能是安全区域,但医院可达性低的冷点可能反而代表公共服务不足。
3. 冷热点分析必须使用面数据吗?
不是。点、线、面都可以参与分析,但在实际项目中,点事件通常会先聚合到网格或行政区,再对计数、密度或比率字段进行 Getis-Ord Gi* 分析,这样结果更容易解释。
4. 为什么我的冷热点分析结果全是不显著?
常见原因包括:分析字段空间差异不明显、距离阈值设置不合理、样本数量太少、数据噪声过大、研究尺度与现象不匹配。可以先检查字段分布,再尝试不同邻域参数。
5. Getis-Ord Gi* 和核密度分析可以一起用吗?
可以。核密度适合探索事件密度分布,Getis-Ord Gi* 适合判断高值或低值聚集是否具有统计显著性。实际工作中可以先用核密度观察趋势,再用冷热点分析验证显著区域。
6. 冷热点分析结果能直接作为决策依据吗?
不建议单独使用。冷热点分析提供的是统计证据,还需要结合数据来源、采集时间、业务机制、现场调查和政策目标进行综合判断。GIS结果应作为决策支持,而不是替代专业判断。
结论
Getis-Ord Gi* 冷热点分析是GIS在空间统计学中非常实用的一类方法,它能帮助我们从“看起来哪里高、哪里低”进一步走向“哪里存在显著高值聚集或低值聚集”。这对于犯罪分析、公共卫生、商业选址、交通安全和城市管理都很有价值。
真正做好冷热点分析,关键不在于点击工具按钮,而在于理解研究问题、选择合适字段、设置合理邻域、检查投影坐标系,并谨慎解释Z得分和P值。只要把这些环节控制好,Getis-Ord Gi* 就能成为空间统计分析中非常可靠的一把工具。