论文摘要
主成分分析(Principal Component Analysis)是一种用于特征提取和降维的线性方法,它一般使用具有较大方差的维作为主成分而忽略方差小的维,从而将数据映射到低维的子空间中提取线性特征。但是当数据是线性不可分的情况下,该方法不能很好地提取判别特征,通常使用核方法把数据映射到高维特征空间进行主成分的运算,即核主成分分析(Kernel Principal Component Analysis),该过程不需要显式地知道映射函数,而是利用核技巧实现,提取的非线性特征被成功应用于图像处理等任务中。在核主成分计算过程中,需要储存全部数据集生成的核矩阵,该矩阵是通过核函数计算数据之间的内积而得到的,矩阵的大小随着数据集样本数目m变化而变化,空间复杂度为O(m2),而对核矩阵进行特征分解的时间复杂度为O(m3)。在大规模数据集的情况下,由于内存容量的限制,在一般计算机上对核矩阵的存储和计算都是困难的,应寻找可行的解决方法。在深入研究模式分析中核方法相关技术的基础上,本文针对大规模数据集问题,探讨了已有解决方法的实质以及相互之间的关系,提出了三种有效的求解核主成分的方法,具体内容包括:●使用incomplete Cholesky分解将核矩阵转化为两个互为转置的三角矩阵,三角矩阵的每一列可以看作为特征空间特殊的“输入样本”,将这些样本输入到主成分分析的迭代算法中,经过若干次迭代后,就可以计算出核主成分。该方法不需要对核矩阵进行特征分解,其空间和时间复杂度分别为O(nm)和O(nm)+O(nkp),其中n,k,m,p分别为核矩阵的秩、需提取的主成分数、样本数以及迭代次数。在大规模数据集的情况下,核矩阵的秩和要提取的主成分数通常远小于样本数,因此空间和时间复杂度都有较大程度的降低。●利用核矩阵的对称性质,基于初始核矩阵创建一个新的Gram-power矩阵,因为新矩阵和原核矩阵具有有相同的特征向量,可以计算Gram-Power矩阵的特征向量来代替核矩阵的特征分解,把核矩阵的每一列看成是迭代主成分分析算法的“输入样本”,经过若干次迭代后,可以很容易的求出核主成分,并且算法的空间复杂度从O(m2)减少到O(m)。●提出了一个基于矩阵的核主成分分析(Matrix-based Kernel PrincipalComponent Analysis)方法,该方法首先将大规模数据集等分成许多小的数据子集,每个数据子集的自相关矩阵可以看成是核空间的“特殊样本”,用一个基于矩阵的创新核函数来计算数据子集之间的内积。由于子集的数量远小于数据集样本的数目,因此较大程度地降低核矩阵的大小,提出的方法和KPCA的实现过程几乎完全一样,并且自相关矩阵含有每个子集的高阶统计信息,有助于性能的改善。通过在人工合成的数据集以及真实的数据上进行实验,验证了大规模数据集的情况下所提出算法的有效性。
论文目录
相关论文文献
- [1].六个全球历史土地覆盖数据集数据来源的对比分析[J]. 北京师范大学学报(自然科学版) 2019(06)
- [2].基于多数据集动态潜变量的在线性能分级评估方法[J]. 控制理论与应用 2020(03)
- [3].代表性人口空间分布数据集的精度评价——以2010年广东省为例[J]. 热带地理 2020(02)
- [4].高速公路场景下基于深度学习的数据集建立[J]. 数字技术与应用 2020(02)
- [5].构建图形图像数据集的方法概述[J]. 计算机产品与流通 2020(08)
- [6].多国议会数据集及平台建设研究[J]. 情报工程 2020(02)
- [7].国际主要科学数据集检索平台对比研究[J]. 情报工程 2020(01)
- [8].实验室化学品纯化方法数据集[J]. 中国科学数据(中英文网络版) 2020(02)
- [9].化学药物数据集[J]. 中国科学数据(中英文网络版) 2019(01)
- [10].中亚地区陆表物候逐年数据集(1982–2015)[J]. 全球变化数据学报(中英文) 2020(01)
- [11].南京百年人物数据集[J]. 中国科学数据(中英文网络版) 2020(03)
- [12].替代计量学视角下科学数据集价值的定量测度研究[J]. 情报理论与实践 2020(09)
- [13].数据集采器在临床护理工作中的应用价值探讨[J]. 基层医学论坛 2017(12)
- [14].医院感染监测基本数据集的建立及作用[J]. 中华医院感染学杂志 2016(11)
- [15].TextGen:用于新型存储系统基准测试的真实文本数据集生成方法(英文)[J]. Frontiers of Information Technology & Electronic Engineering 2016(10)
- [16].卫星气候数据集的应用研究与发展分析[J]. 地球信息科学学报 2015(11)
- [17].用于生命之树重建的数据集[J]. 中国科学数据(中英文网络版) 2017(03)
- [18].中国有毒动物数据集[J]. 中国科学数据(中英文网络版) 2017(04)
- [19].基于次序依赖的电力数据集修复[J]. 电测与仪表 2019(24)
- [20].粤港澳湾区1:50000斗门镇幅工程地质调查及岩土样品试验数据集[J]. 中国地质 2019(S2)
- [21].全集水网数据集更新方法研究[J]. 经纬天地 2020(01)
- [22].智能城市产业资讯汇总[J]. 智能城市 2020(11)
- [23].基于神经网络的机器阅读理解综述[J]. 软件学报 2020(07)
- [24].2002–2010年中国典型生态系统辐射及光能利用效率数据集[J]. 中国科学数据(中英文网络版) 2019(01)
- [25].基于镶嵌数据集的海量数据存储管理——以青海湖流域为例[J]. 地球环境学报 2013(04)
- [26].基于数据集相似性的分类算法推荐[J]. 计算机应用与软件 2016(08)
- [27].数字数据集揭示文化遗产促进城市可持续发展[J]. 世界遗产 2016(05)
- [28].洞庭湖区堤垸1949—2013空间分布数据集[J]. 全球变化数据学报(中英文) 2017(01)
- [29].云南省标准化降水蒸散指数数据集(1998-2012)[J]. 全球变化数据学报(中英文) 2017(04)
- [30].1979~1998年工业腐蚀失效分析数据集[J]. 中国科学数据(中英文网络版) 2017(01)
标签:大规模数据集论文; 核主成分分析论文; 核方法论文; 核矩阵论文; 非线性特征论文; 矩阵分解论文; 迭代算法论文; 数据子集论文;