[发明专利]基于MapReduce的FP-Growth的负载均衡并行计算方法在审

申请号：	201510138318.0	申请日：	2015-03-26
公开（公告）号：	CN104731925A	公开（公告）日：	2015-06-24
发明（设计）人：	杨勇;陈曙东	申请（专利权）人：	江苏物联网研究发展中心
主分类号：	G06F17/30	分类号：	G06F17/30
代理公司：	无锡市大为专利商标事务所(普通合伙) 32104	代理人：	曹祖良;张涛
地址：	214135 江苏省无锡市新***	国省代码：	江苏;32
权利要求书：	查看更多	说明书：	查看更多
摘要：
搜索关键词：	基于 mapreduce fp growth 负载均衡并行计算方法
钻瓜网技术展会专利词库专利权人专利榜在售专利公布日期热门专利

【权利要求书】：

1.一种基于MapReduce的FP-Growth的负载均衡并行计算方法，其特征是，所述负载均衡并行计算方法包括如下步骤：

步骤1、输入所需的数据库事务集D以及最小支持度计数，并将所述数据库事务集D分成连续不同的分区，且数据库事务集D的子事务集存储在多台节点上；

步骤2、第一次扫描数据库事务集D，并行计算每台节点上的项的支持度计数，且将所有节点计算的项的支持度技术合并，以得到全部频繁1项集FList；

步骤3、将频繁1项集FList的项根据负载均衡的方法划分成M组，以得到长度为M的新列表GList，新列表GList中每一组的组号为gid_i（1≤i≤M）；

步骤4、第二次扫描数据库事务集D，根据新列表GList将数据库事务集D也划分为M组，划分得到数据库事务集D的组号与新列表GList内的组号相对应，若一条事务包含GList_gidi中的项，则将该条事务对应的部分发送到组号为gid_i的事务组DB；在数据库事务集D划分结束后，对每一个事务组DB创建其本地FP-Tree，并根据本地FP-Tree挖掘对应的GList_gidi，以得到频繁1项集中所有项的频繁模式；

步骤5、将每台节点上得到的频繁1项集中所有项的频繁模式聚合输出。

2.根据权利要求1所述的基于MapReduce的FP-Growth的负载均衡并行计算方法，其特征是，所述步骤3包括如下步骤：

步骤3.1、计算频繁1项集FList中每项的负载，按照负载降序排列，以得到排列表SList；

步骤3.2、根据指定的组数M，将排列表SList中的前M项初始化为新列表GList中的M组，且新列表GList中的每组与排列表SList中的每项呈一一对应；

步骤3.3、将排列表SList中未被分到新列表GList中组的第一项添加到新列表GList中负载最小的组内，并将添加的项的负载值进行累加，并更新新列表GList中组的负载；

步骤3.4、重复上述步骤3，直至排列表SList中的所有项都完成分组；

步骤3.5、将得到的新列表GList保存在HDFS文件中，以便多台节点共享。

下载完整专利技术内容需要扣除积分，VIP会员可以免费下载。

免登录下载普通用户下载升级VIP会员，免费下载

该专利技术资料仅供研究查看技术是否侵权等信息，商用须获得专利权人授权。该专利全部权利属于江苏物联网研究发展中心;，未经江苏物联网研究发展中心;许可，擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作，请联系【客服】

本文链接：http://www.vipzhuanli.com/pat/books/201510138318.0/1.html，转载请声明来源钻瓜专利网。