基金项目:广东省自然资源厅科技项目(GDZRZYKJ2025002);广东省自然资源厅“2024年广东省地质灾害野外科学观测站和模拟试验场建设项目”(DHZZ2024032)联合资助。
作者简介:张伟(1983-),男,高级工程师,主要从事环境地质与地质灾害防治方面的研究。E-mail: janezhangwei@126.com
1.广东省地质环境监测总站,广州 510308;2.自然资源部气候变化驱动下滑坡风险野外科学观测研究站,广州 510308;3.广州市城市规划勘测设计研究院有限公司,广州 510030
1.Guangdong Geological Environment Monitoring Station, Guangzhou 510510, China;2.South China Field Scientific Observation and Research Station for Climate-Driven Landslide Risk, Ministry of Natural Resources, Guangzhou 510510, China;3.Guangzhou Urban Planning&Design Survey Research Institute Co., Ltd., Guangzhou 510030, China
Landslide; Susceptibility assessment; Logistic regression; Random forest; Analytic Hierarchy Process;Evaluation factor
DOI: 10.13512/j.hndz.2026.04.16
广东省地处南岭以南、南海之滨,山地丘陵广布、地形起伏大,断裂构造发育,风化土层厚,在强降雨与人类活动叠加影响下,地质灾害易发多发、危害严重。崩塌、滑坡是最主要的地质灾害类型。崩塌、滑坡易发性评价是地质灾害调查评价的基础,而地质灾害影响因子的选取及评价又是核心[1]。国内外学者进行了相关的研究并取得一定成果,如Singh、 Ado、 Liu、 Zhang、陈国圳等[2-5]利用机器学习、逻辑回归模型、随机森林、反向传播神经网络对不同地区的滑坡进行了易发性评价,得出不同方法在大尺度区域且灾害样本数量充足下评价的差异性、优缺点。李文杰等[6]融合SVM-RFE与层次分析—信息量模型开展了林芝市地质灾害易发性评价研究,研究出定性-定量耦合的评价方法。臧烨祺等[7]通过主成分分析来剔除因子,提高了模型精度。许烈等[8]应用随机森林模型和XGBoost模型在栅格单元和斜坡单元下进行滑坡灾害易发性评价,发现在栅格单元下地层是主控因素,在斜坡单元下地形切割深度是主控因素。黄成等[9]基于随机森林赋权信息量模型开展了云南省施甸县地质灾害易发性评价,发现在单一信息量模型中引入随机森林进行赋权能有效表达因子间的权重差异,提升地质灾害易发性分区的精度。关于地质灾害易发性评价因子的选取,国内很多学者也进行了研究。武辰爽[10]选取了地貌类型、坡度、坡向、高差、河网密度、年平均降水量、距断裂距离、土地利用类型、NDVI等9个评价因子。唐杰[11]选取高程、坡度、坡向、平面曲率、与河流距离、与断裂距离、工程岩组、与道路距离、植被指数、年平均降雨量等10个评价指标。
本文在研究筛选地质灾害影响因子基础上,采用逻辑回归和随机森林算法并进行实验比较,分析形成广东崩塌、滑坡地质灾害易发性因子重要性排名,并进行归一化处理得到各评价指标的权重,为后续大区域内采用信息量法评价易发性提供支撑。同时,考虑到行政村、斜坡单元尺度下,灾害样本少,难以采用信息量法评价地质灾害易发性,需要通过野外调查获取相关指标后采取综合指数法评价易发性,故本文采用层次分析法,以广州市增城区中新镇作为研究区,研究形成小区域内易发性评价指标体系及量化分值表,为后续采用综合指数法评价易发性提供技术参考。研究成果可支撑广东开展不同尺度下的地质灾害易发性评价。
广东地势北高南低,东西向腹部倾斜,粤东、粤西、粤北多为丘陵山地,最高峰石坑崆海拔1902 m;南部为平原和台地。地层自中新元古界至第四系均有出露,分布面积占陆域面积的65%,其余为岩浆岩。工程地质岩类包括侵入岩、变质岩、碎屑岩、红层碎屑岩、碳酸盐岩、土体六类。地质构造发育,主要有吴川—四会、恩平—新丰、莲花山、河源、佛岗—丰良、高要—惠来、南澳、汕头—惠来、潮安—普宁、琼洲海峡等深断裂带。地形地貌、工程地质岩类、地质构造等条件为崩塌、滑坡形成提供了有利条件。
广州市增城区中新镇属亚热带湿润季风气候,雨量充沛。中新镇地貌可分中低山、丘陵、侵蚀台地和丘间谷地,地势大致东高西低、北高南低,整体以丘陵为主,中部为相对低平的河谷冲积平原,镇内地质灾害主要以小型崩塌为主。
本文从2008—2022年广东地质灾害灾情数据中,筛选出有坐标的2774个崩塌、滑坡历史灾害点作为研究对象(图1),主要分布在粤东、粤西和粤北等广大中低山区和丘陵区以及经济发达人类工程活动强烈的局部地区,开展易发性评价指标研究。本文研究的数量来源详见表1。
图1 广东省2008—2022年崩塌滑坡历史灾害点分布图Fig.1 Distribution of historical collapse and landslide disaster sites in Guangdong province from 2008 to 2022
表1 研究数据来源Table 1 Sources of data
不同研究区评价因子的选取存在差异,本文基于广东省地质环境条件、地质灾害发育分布规律、历史灾害数据及相关研究[12-15],选取灾害点高程、坡度、坡向、地形起伏度、平面曲率、剖面曲率、植被覆盖度(NDVI指数)、工程地质岩组、土地利用类型、与断层距离共10个指标作为初始因子,各因子的专题图如图2所示。
地质灾害的发生通常受到多种因素的影响,然而过多的孕灾因子涉入会带来“维度灾难”问题。因此,在开展易发性评价因子的重要性排名前,要进行因子多重共线性检测。方差膨胀因子(VIF)方法是检测因子多重共线性的方法之一[16]。VIF是多项模型的方差除以单独一项模型的方差的比值,它量化了多重共线性的程度,相关技术公式如下:为:

式(1)中, R 2是以Xj为因变量时对其他自变量回归的复测定系数。当R越大,变量之间的相关性就越高,VIF就越大。
如果VIF值大于10或容差值小于0.1,则表明诱发因素之间存在多重共线性问题。选择低VIF值的孕灾因子能够有效减少甚至避免模型预测误差。

图2 崩塌、滑坡易发性评价因子Fig.2 Evaluation factors for collapse and landslide susceptibility
逻辑回归模型建立了一个非线性概率函数,找到合适的回归系数来表示自变量和因变量之间的相关性,所涉及到的公式如下:

式(2)、(3)中,p为灾害发生概率;y是一个线性组合函数;b0为常数值,(b1, b2, ..., bn)表示每个导致灾害发生的影响因子变量(x1, x2, ..., xn)的系数。
此外,本文运用随机森林方法来计算各个因子的权重并进行重要性排名。随机森林属于集成学习方法,既可解决回归问题,也可解决分类问题。随机森林的简要建模步骤如下:
1)从总训练集R中采用自助抽样法,有放回地随机重复抽取T个样本组成N个训练子集;
2)在训练子集(Nk)中无放回地随机选取m个特征作为决策树上每个节点分裂的依据,最终训练生长为一棵完整的决策树,训练过程不需要剪枝;
3)重复步骤2,生成多棵决策树,构建为随机森林;
4)将袋外数据输入随机森林让每一棵决策树进行决策,对于分类问题用,使用majority voting;对于回归问题,使用均值;
5)重复步骤4直至完成所有测试数据。
随机森林的简要流程如图3所示。与传统的决策树相比,随机森林的主要优点之一是防止决策树中常常出现的过拟合问题。Bagging、随机特征选择和袋外误差验证保证了随机森林的先进性。此外,随机森林可以有效地解决多数据间的共线性问题。对变量的类型没有限制,可以是连续的数值型变量,也可以是离散的分类变量,所以随机森林可用于特征选择。
预测准确率(Accuracy)被广泛用于评价滑坡等地质灾害模型的预测能力。预测准确率是模型正确分类的滑坡和非滑坡样本占总体的比例。敏感性(Sensitivity)与特异性(Specificity)的概念源于医学统计,敏感性是指本来就有病的人被诊断为有病的概率,而特异性则指本来没有病的人被诊断为没病的概率。对于其中一个指标值,假如提升其确诊的敏感度,必定减少其确诊的特异性,也就是说降低误诊必定提升错诊,反之亦然。反映到滑坡敏感性预测上,敏感性指本来就是滑坡而能被模型识别为滑坡的概率,特异性则指本来是非滑坡而又被模型识别为非滑坡的概率。涉及的各个指标计算公式如下:

式(4)中, True Positive(TP)指正确分类的滑坡样本数; True Negative(TN)指正确分类的非滑坡样本数; False Positive(FP)指分类错误的滑坡样本数; False Negative(FN)是指分类错误的非滑坡样本的数量。
层次分析法是指将与决策总是有关的元素分解成目标、准则、方案等层次,在此基础之上进行定性和定量分析的决策方法[17]。本次区域地质灾害易发性评价层次结构模型如图4所示。
图3 随机森林流程图Fig.3 Flowchart of random forest model
图4 地质灾害易发性评价层次结构模型Fig.4 Hierarchical structure model for geological hazard susceptibility evaluation
按因素两两比较结果构成的矩阵称作判断矩阵,判断矩阵元素标度如表2所示。
构造好判断矩阵之后通过一次性检验,采用层次分析辅助软件计算各评价因子的权重系数,最终得到评价体系及量化分值。
表2 判断矩阵元素的标度Table 2 Scale of judgment matrix elements
依据地质灾害易发性综合指数计算公式(公式5)即可求得斜坡单元易发性。

式(5)中, Yi为第i个斜坡单元易发性综合指数; Fj为第i个斜坡单元第j类指标权重;Sj为第i个斜坡单元第j类指标赋值;n为项数。
本文采用方差膨胀因子(VIF)方法进行因子多重共线性检测,结果如表3所示,其中坡度、平面曲率和起伏度的VIF值分别为24.455、 31.686、54.051,均大于10,证明三者存在较强的共线关系,在后续逻辑回归方法建模中应剔出其中部分因子。
首先去除VIF最大的起伏度因子,再重新进行共线性分析,其结果如表4所示,可知坡度和平面曲率的VIF值仍大于10。
剔除平面曲率后再重新进行共线性分析,计算得各个影响因子的VIF如表5所示,表中各个因子的VIF均小于10,各因子间不存在共线性关系。
表3 崩塌、滑坡易发性评价因子多重共线性分析结果Table 3 Multicollinearity analysis results of evaluation factors for collapse and landslide susceptibility
表4 去除起伏度因子后多重共线性分析结果Table 4 Multicollinearity analysis results after removing topographic relief factor
表5 去除平面曲率后多重共线性分析结果Table 5 Multicollinearity analysis results after removing planar curvature
本文利用共线性分析剔除平面曲率和起伏度因子之后对应剩余8个因子作为输入变量,利用逻辑回归方法计算得到各个因子对应的系数如下表6所示,系数的大小能够反映因子对地质灾害是否发生的影响程度。
由表5可知,植被覆盖度、坡度、与断层距离等因子系数的绝对值最大,为主要影响因子;其中植被覆盖度、与断层距离和剖面曲率因子系数为负值,说明与灾害总体呈现负相关关系,即植被覆盖度越大、距离断层距离越远时该点发生地质灾害的概率反而越小;其余因子的系数均为正值,说明与灾害总体呈现正相关关系。
由于土地利用类型和工程地质岩组作为类别信息,仅可作为文本输入进行逻辑回归,分别得到各个类别对应的权重,可见土地利用类型中是否属于林地和耕地,工程地质岩组中是否属于侵入岩和碎屑岩对判断该点是否是可能发生地质灾害的影响较大。
表6 因子重要性逻辑回归方法计算结果Table 6 Calculation results of factor importance by logistic regression
拟合得到线性组合函数为:
y = -0.509 - 1.874x1+1.609x2 - 0.855x3 + 0.319x4 -0.12x5 + 0.084x6 + 3.181x71 + 1.442x72 + 0.496x73 -0.157x74 - 0.11x75 + 3.381x81 + 0.923x82 + 0.451x83 +0.445x84+0.271x85+0.072x80 (6)
式(6)中,(x1, x2, ..., x6)分别表示该点的植被覆盖度、坡度、与断层距离、高程、剖面曲率、坡向等因子;(x7 1, x7 2, x7 3, x7 4, x7 5)分别表示该点的土地利用类型为林地、耕地、人造地表、裸地和灌木地,计 算 时 根 据 该 点 的 实 际 类 别 带 入;(x8 1, x8 2, x8 3, x8 4, x8 5, x8 6)分别表示该点的工程地质岩组分别为侵入岩、碎屑岩、变质岩、土体、红层碎屑岩组以及碳酸盐岩,计算时同样需要根据该点的实际类别带入。将所求得的y带入式(2)中即可得该点灾害发生概率p,当其大于0.5时将该点判断为地质灾害易发点。
基于IBM SPSS Modeler软件进行随机森林方法建模,将整理的高程、坡度、坡向、地形起伏度、平面曲率、剖面曲率、植被覆盖度(NDVI指数)、工程地质岩组、土地利用类型、与断层距离等10个影响因子作为输入变量输入模型进行计算,最终得到广东省崩滑流地质灾害易发性因子重要性排名如下图5所示,可见在随机森林方法计算结果中,坡度因子对判别该点是否可能是地质灾害点的影响最显著;此外,土地利用类型、与断层距离、工程地质岩组、植被覆盖度等也是主要影响因子。
为对比逻辑回归方法和随机森林方法模型预测能力,表7列出了两种方法的Accuracy、Sensitivi⁃ty、Specificity,由表可见随机森林方法在各个评价指标上均优于逻辑回归方法,由此可见随机森林方法的预测能力更为突出,预测结果也更加可靠。因此,随机森林识别出的主控因子可靠度更高。
基于上述研究,综合选取坡度、平面曲率、地形起伏度、工程地质岩组、与断裂距离、植被覆盖、土地利用类型7种类型影响因子作为易发性评价因子,即选取图5中重要性排名前7的因子。将该7个因子重要性排名系数进行归一化处理得到各评价指标的权重如表8所示,该成果可为现规范建议采用的信息量法评价易发性方法提供重要支撑。
图5 基于随机森林方法的因子重要性排名Fig.5 Factor importance ranking based on random forest
表7 模型预测能力对比Table 7 Comparison of predictive performance of different models
表8 易发性评价因子归一化权重Table 8 Normalized weights of susceptibility evaluation factors
本研究中结合野外地质条件、地质灾害发育分布规律和地质环境情况,综合选取影响地质灾害发生、发展的因素作为影响因子。结合上述随机森林易发性评价指标研究,选取坡度、坡向、高差、岩性与岩土结构、斜坡结构、切坡高度和破坏迹象7种影响因子后,同时考虑纳入年均降雨量因子,共同构成地质灾害易发性评价指标。通过加入年均降雨量因子,将易发性评价和危险性评价合并,进一步简化评价过程。针对以上8个评价指标,需要进一步确定各个评价指标的权重,本研究中采用层次分析法确定,结果如表9所示。
表9 综合指数法易发性评价体系及量化分值表Table 9 Susceptibility evaluation system and quantitative score of comprehensive index method
根据以上方法计算地质灾害易发性综合指数,再依据表 10将地质灾害易发程度划分为高易发、中易发、低易发三个等级。研究成果为采用综合指数法评价易发性提供技术参考。
表 10 崩塌、滑坡地质灾害易发程度划分标准表Table 10 Classification criteria for disaster susceptibility levels of collapse and landslide geological hazards
以广州市增城区中新镇作为研究区评价其适用性。结果如图6所示,中新镇斜坡单元易发性以低易发和中易发为主,占总数量99.35%,高易发斜坡单元数量较少,现存的风险隐患点基本分布在中易发区,从而证明了该方法的合理性。
图6 中新镇重点调查区斜坡单元易发程度分区图Fig.6 Susceptibility zonation map of slope units in the key survey area of Zhongxin Town
本文选取高程、坡度、坡向等等10个初始影响因子,采用逻辑回归和随机森林方法分析出适用于大区域评价的主控因素及其权重。而在进行单一斜坡或小区域评价方面,采用层次分析法确定主控因子及权重。
1)随机森林方法较逻辑回归算法的预测能力更为突出,预测结果也更加可靠。确定的坡度、平面曲率、地形起伏度、岩土体类型、与断层距离、植被覆盖及土地利用类型7个主控因子及其权重。其中坡度重要程度最高,说明坡度对广东崩塌和滑坡易发性控制作用最强;与断层距离、工程地质岩组重要程度较高,其他4个因子次之。
2)研究形成以坡度、坡向、高差、岩性与岩土结构、斜坡结构、切坡高度、破坏迹象、年均降雨量8个因子的综合指数法易发性评价指标体系。其中破坏迹象和坡度权重最高,说明对崩塌和滑坡的影响最大;年均降雨量、切坡高度影响程度较高,其他4个因子次之。