[发明专利]一种网络负载均衡的多代理分布式爬虫系统和方法有效
申请号: | 201810540298.3 | 申请日: | 2018-05-30 |
公开(公告)号: | CN108712503B | 公开(公告)日: | 2021-06-22 |
发明(设计)人: | 洪晔凡;任勋益 | 申请(专利权)人: | 南京邮电大学 |
主分类号: | H04L29/08 | 分类号: | H04L29/08 |
代理公司: | 南京纵横知识产权代理有限公司 32224 | 代理人: | 董建林 |
地址: | 210023 *** | 国省代码: | 江苏;32 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 网络 负载 均衡 代理 分布式 爬虫 系统 方法 | ||
1.一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:
数据计算模块,被配置为计算任务的权重,根据带权任务提交中心控制模块,并从代理节点返回的数据中筛选出新的种子;
中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:获取目标的物理位置和工作次数信息,计算求出备选代理节点等待参数,然后将任务下发给等待参数最小的代理节点;
代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点监控模块提交新代理节点;
代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交的新代理节点的可用性;
其中计算任务的权重时计算公式如下:
其中i为被计算的节点,Weighti为任务权重,WeightMAX为允许的最大任务权重,WeightMIN为允许的最小任务权重,Ri为任务的轮次,r为管理员设定的轮次阀值。
2.根据权利要求1所述的一种网络负载均衡的多代理分布式爬虫系统,其特征是:所述中心控制模块,被进一步配置为:用于管理员对系统进行控制,其中系统控制包括启动系统、关闭系统、注入初始种子、请求新可用代理节点、维护节点池、存储代理节点的状态信息、向代理节点监控模块发出节点监控命令以及选择代理节点并分配任务给代理节点。
3.根据权利要求2所述的一种网络负载均衡的多代理分布式爬虫系统,其特征是,还包括:
所述中心控制模块与代理节点监控模块被配置为配合完成监控所有当前存活的代理节点的任务;进一步地,中心控制模块被配置为在监控间隔时间范围内随机向代理节点监控模块发出监控命令,代理节点监控模块将在接收命令后,对指定代理节点进行监控;
所述代理节点监控模块,被配置为将代理节点的状态信息提交给中心控制模块;进一步地,还被配置为监控代理节点获取模块所提交的新代理节点,若返回时间小于允许最大返回值,则视为可用,代理节点监控模块将此新代理节点的状态信息提交给中心控制模块,中心控制模块将更新该节点的状态信息,否则将丢弃。
4.一种网络负载均衡的多代理分布式爬虫方法,其特征在于,包括:
计算任务的权重,根据带权任务提交中心控制模块,并从代理节点返回的数据中筛选出新的种子;
根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡,根据代理节点选择算法选定代理节点时包括获取目标的物理位置和工作次数信息,计算求出备选代理节点等待参数,等待参数最小的代理节点将被选中;
计算任务的权重时计算公式如下:
其中i为被计算的节点,Weighti为任务权重,WeightMAX为允许的最大任务权重,WeightMIN为允许的最小任务权重,Ri为任务的轮次,r为管理员设定的轮次阀值。
5.根据权利要求4所述的一种网络负载均衡的多代理分布式爬虫方法,其特征在于,当一次爬取成功后筛选出的新种子的Ri将加1实现自增,初始种子的任务轮次Ri为0,表达式如下:
其中Rparent为当前已完成任务的轮次。
6.根据权利要求5所述的一种网络负载均衡的多代理分布式爬虫方法,其特征在于,当轮次Ri达到预设值时,丢弃该爬虫节点并不再下发该爬虫节点引入的种子。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于南京邮电大学,未经南京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201810540298.3/1.html,转载请声明来源钻瓜专利网。