[发明专利]一种网络负载均衡的多代理分布式爬虫系统和方法有效
申请号: | 201810540298.3 | 申请日: | 2018-05-30 |
公开(公告)号: | CN108712503B | 公开(公告)日: | 2021-06-22 |
发明(设计)人: | 洪晔凡;任勋益 | 申请(专利权)人: | 南京邮电大学 |
主分类号: | H04L29/08 | 分类号: | H04L29/08 |
代理公司: | 南京纵横知识产权代理有限公司 32224 | 代理人: | 董建林 |
地址: | 210023 *** | 国省代码: | 江苏;32 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开了一种网络负载均衡的多代理分布式爬虫系统和方法,其中系统包括用于根据代理节点选择算法选定代理节点并将任务下发的中心控制模块、数据计算模块、代理节点监控模块和代理节点获取模块;本发明方法包括计算任务的权重并根据计算结果筛选出新种子;根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡。本发明根据网络负载均衡的代理节点选择算法在实现各代理节点网络负载均衡的基础上选择物理距离最近、等待时间最短、响应最快、成功概率最高的代理节点,可以更好的完成数据爬虫任务;另一方面本发明能够基于代理节点技术通过中心控制模块和代理节点监控模块的协作,有较好的抵御反爬虫系统能力。 | ||
搜索关键词: | 一种 网络 负载 均衡 代理 分布式 爬虫 系统 方法 | ||
【主权项】:
1.一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:数据计算模块,被配置为计算任务的权重并根据计算结果筛选出新种子;中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:根据任务的权重、任务的特征、代理节点的负载情况计算节点的等待参数,然后将任务下发给等待参数最小的代理节点;代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点提交新代理节点;代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交的新代理节点的可用性。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于南京邮电大学,未经南京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201810540298.3/,转载请声明来源钻瓜专利网。