空间数据挖掘


空间数据挖掘

文章插图
空间数据挖掘【空间数据挖掘】空间数据挖掘是指从空间资料库中抽取没有清楚表现出来的隐含的知识和空间关係,并发现其中有用的特徵和模式的理论、方法和技术 。空间数据挖掘和知识发现的过程大致可分为以下多个步骤:数据準备、数据选择、数据预处理、数据缩减或者数据变换、确定数据挖掘目标、确定知识发现算法、数据挖掘、模式解释、知识评价等,而数据挖掘只是其中的一个关键步骤 。但是为了简便,人们常常用空间数据挖掘来代替空间数据挖掘和知识发现 。
基本介绍中文名:空间数据挖掘
性质:数据挖掘
属性:空间
空间分析方法:指採用综合属性数据分析
1. 基于机率论的方法 。这是一种通过计算不确定性属性的机率来挖掘空间知识的方法,所发现的知识通常被表示成给定条件下某一假设为真的条件机率 。在用误差矩阵描述遥感分类结果的不确定性时,可以用这种条件机率作为背景知识来表示不确定性的置信度 。2. 空间分析方法 。指採用综合属性数据分析、拓扑分析、缓冲区分析、密度分析、距离分析、叠置分析、网路分析、地形分析、趋势面分析、预测分析等在内的分析模型和方法,用以发现目标在空间上的相连、相邻和共生等关联规则,或挖掘出目标之间的最短路径、最优路径等知识 。目前常用的空间分析方法包括探测性的数据分析、空间相邻关係挖掘算法、探测性空间分析方法、探测性归纳学习方法、图像分析方法等 。3. 统计分析方法 。指利用空间对象的有限信息和/或不确定性信息进行统计分析,进而评估、预测空间对象属性的特徵、统计规律等知识的方法 。它主要运用空间自协方差结构、变异函式或与其相关的自协变数或局部变数值的相似程度实现包含不确定性的空间数据挖掘 。4. 归纳学习方法 。即在一定的知识背景下,对数据进行概括和综合,在空间资料库(数据仓库)中搜寻和挖掘一般的规则和模式的方法 。归纳学习的算法很多,如由Quinlan提出的着名的C5.0决策树算法、Han Jiawei教授等提出的面向属性的归纳方法、裴健等人提出的基于空间属性的归纳方法等 。5. 空间关联规则挖掘方法 。即在空间资料库(数据仓库)中搜寻和挖掘空间对象(及其属性)之间的关联关係的算法 。最着名的关联规则挖掘算法是Agrawal提出的Apriori算法;此外还有程继华等提出的多层次关联规则的挖掘算法、许龙飞等提出的广义关联规则模型挖掘方法等 。6. 聚类分析方法 。即根据实体的特徵对其进行聚类或分类,进而发现数据集的整个空间分布规律和典型模式的方法 。常用的聚类方法有K-mean, K-medoids方法、Ester等提出的基于R—树的数据聚焦法及发现聚合亲近关係和公共特徵的算法、周成虎等提出的基于信息熵的时空数据分割聚类模型等 。7. 神经网路方法 。即通过大量神经元构成的网路来实现自适应非线性动态系统,并使其具有分布存储、联想记忆、大规模并行处理、自学习、自组织、自适应等功能的方法;在空间数据挖掘中可用来进行分类和聚类知识以及特徵的挖掘 。8. 决策树方法 。即根据不同的特徵,以树型结构表示分类或决策集合,进而产生规则和发现规律的方法 。採用决策树方法进行空间数据挖掘的基本步骤如下:首先利用训练空间实体集生成测试函式;其次根据不同取值建立决策树的分支,并在每个分支子集中重複建立下层结点和分支,形成决策树;然后对决策树进行剪枝处理,把决策树转化为据以对新实体进行分类的规则 。9. 粗集理论 。一种由上近似集和下近似集来构成粗集,进而以此为基础来处理不精确、不确定和不完备信息的智慧型数据决策分析工具,较适于基于属性不确定性的空间数据挖掘 。10. 基于模糊集合论的方法 。这是一系列利用模糊集合理论描述带有不确定性的研究对象,对实际问题进行分析和处理的方法 。基于模糊集合论的方法在遥感图像的模糊分类、GIS模糊查询、空间数据不确定性表达和处理等方面得到了广泛套用 。11. 空间特徵和趋势探侧方法 。这是一种基于邻域图和邻域路径概念的空间数据挖掘算法,它通过不同类型属性或对象出现的相对频率的差异来提取空间规则 。12. 基于云理论的方法 。云理论是一种分析不确定信息的新理论,由云模型、不确定性推理和云变换三部分构成 。基于云理论的空间数据挖掘方法把定性分析和定量计算结合起来,处理空间对象中融随机性和模糊性为一体的不确定性属性;可用于空间关联规则的挖掘、空间资料库的不确定性查询等 。13. 基于证据理论的方法 。证据理论是一种通过可信度函式(度量已有证据对假设支持的最低程度)和可能函式(衡量根据已有证据不能否定假设的最高程度)来处理不确定性信息的理论,可用于具有不确定属性的空间数据挖掘 。14. 遗传算法 。这是一种模拟生物进化过程的算法,可对问题的解空间进行高效并行的全局搜寻,能在搜寻过程中自动获取和积累有关搜寻空间的知识,并可通过自适应机制控制搜寻过程以求得最优解 。空间数据挖掘中的许多问题,如分类、聚类、预测等知识的获取,均可以用遗传算法来求解 。这种方法曾被套用于遥感影像数据中的特徵发现 。15. 数据可视化方法 。这是一种通过可视化技术将空间数据显示出来,帮助人们利用视觉分析来寻找数据中的结构、特徵、模式、趋势、异常现象或相关关係等空间知识的方法 。为了确保这种方法行之有效,必须构建功能强大的可视化工具和辅助分析工具 。16. 计算几何方法 。这是一种利用电脑程式来计算平麵点集的Voronoi图,进而发现空间知识的方法 。利用Voronoi图可以解决空间拓扑关係、数据的多尺度表达、自动综合、空间聚类、空间目标的势力範围、公共设施的选址、确定最短路径等问题 。17. 空间线上数据挖掘 。这是一种基于网路的验证型空间来进行数据挖掘和分析的工具 。它以多维视图为基础,强调执行效率和对用户命令的及时回响,一般以空间数据仓库为直接数据源 。这种方法通过数据分析与报表模组的查询和分析工具(如OLAP、决策分析、数据挖掘等)完成对信息和知识的提取,以满足决策的需要 。