[发明专利]一种网络负载均衡的多代理分布式爬虫系统和方法有效

专利信息
申请号: 201810540298.3 申请日: 2018-05-30
公开(公告)号: CN108712503B 公开(公告)日: 2021-06-22
发明(设计)人: 洪晔凡;任勋益 申请(专利权)人: 南京邮电大学
主分类号: H04L29/08 分类号: H04L29/08
代理公司: 南京纵横知识产权代理有限公司 32224 代理人: 董建林
地址: 210023 *** 国省代码: 江苏;32
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 一种 网络 负载 均衡 代理 分布式 爬虫 系统 方法
【权利要求书】:

1.一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:

数据计算模块,被配置为计算任务的权重,根据带权任务提交中心控制模块,并从代理节点返回的数据中筛选出新的种子;

中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:获取目标的物理位置和工作次数信息,计算求出备选代理节点等待参数,然后将任务下发给等待参数最小的代理节点;

代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点监控模块提交新代理节点;

代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交的新代理节点的可用性;

其中计算任务的权重时计算公式如下:

其中i为被计算的节点,Weighti为任务权重,WeightMAX为允许的最大任务权重,WeightMIN为允许的最小任务权重,Ri为任务的轮次,r为管理员设定的轮次阀值。

2.根据权利要求1所述的一种网络负载均衡的多代理分布式爬虫系统,其特征是:所述中心控制模块,被进一步配置为:用于管理员对系统进行控制,其中系统控制包括启动系统、关闭系统、注入初始种子、请求新可用代理节点、维护节点池、存储代理节点的状态信息、向代理节点监控模块发出节点监控命令以及选择代理节点并分配任务给代理节点。

3.根据权利要求2所述的一种网络负载均衡的多代理分布式爬虫系统,其特征是,还包括:

所述中心控制模块与代理节点监控模块被配置为配合完成监控所有当前存活的代理节点的任务;进一步地,中心控制模块被配置为在监控间隔时间范围内随机向代理节点监控模块发出监控命令,代理节点监控模块将在接收命令后,对指定代理节点进行监控;

所述代理节点监控模块,被配置为将代理节点的状态信息提交给中心控制模块;进一步地,还被配置为监控代理节点获取模块所提交的新代理节点,若返回时间小于允许最大返回值,则视为可用,代理节点监控模块将此新代理节点的状态信息提交给中心控制模块,中心控制模块将更新该节点的状态信息,否则将丢弃。

4.一种网络负载均衡的多代理分布式爬虫方法,其特征在于,包括:

计算任务的权重,根据带权任务提交中心控制模块,并从代理节点返回的数据中筛选出新的种子;

根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡,根据代理节点选择算法选定代理节点时包括获取目标的物理位置和工作次数信息,计算求出备选代理节点等待参数,等待参数最小的代理节点将被选中;

计算任务的权重时计算公式如下:

其中i为被计算的节点,Weighti为任务权重,WeightMAX为允许的最大任务权重,WeightMIN为允许的最小任务权重,Ri为任务的轮次,r为管理员设定的轮次阀值。

5.根据权利要求4所述的一种网络负载均衡的多代理分布式爬虫方法,其特征在于,当一次爬取成功后筛选出的新种子的Ri将加1实现自增,初始种子的任务轮次Ri为0,表达式如下:

其中Rparent为当前已完成任务的轮次。

6.根据权利要求5所述的一种网络负载均衡的多代理分布式爬虫方法,其特征在于,当轮次Ri达到预设值时,丢弃该爬虫节点并不再下发该爬虫节点引入的种子。

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于南京邮电大学,未经南京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/201810540298.3/1.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top