[发明专利]一种网络负载均衡的多代理分布式爬虫系统和方法有效
申请号: | 201810540298.3 | 申请日: | 2018-05-30 |
公开(公告)号: | CN108712503B | 公开(公告)日: | 2021-06-22 |
发明(设计)人: | 洪晔凡;任勋益 | 申请(专利权)人: | 南京邮电大学 |
主分类号: | H04L29/08 | 分类号: | H04L29/08 |
代理公司: | 南京纵横知识产权代理有限公司 32224 | 代理人: | 董建林 |
地址: | 210023 *** | 国省代码: | 江苏;32 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 网络 负载 均衡 代理 分布式 爬虫 系统 方法 | ||
本发明公开了一种网络负载均衡的多代理分布式爬虫系统和方法,其中系统包括用于根据代理节点选择算法选定代理节点并将任务下发的中心控制模块、数据计算模块、代理节点监控模块和代理节点获取模块;本发明方法包括计算任务的权重并根据计算结果筛选出新种子;根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡。本发明根据网络负载均衡的代理节点选择算法在实现各代理节点网络负载均衡的基础上选择物理距离最近、等待时间最短、响应最快、成功概率最高的代理节点,可以更好的完成数据爬虫任务;另一方面本发明能够基于代理节点技术通过中心控制模块和代理节点监控模块的协作,有较好的抵御反爬虫系统能力。
技术领域
本发明涉及一种网络负载均衡的多代理分布式爬虫系统和方法,属于互联网技术领域。
背景技术
随着互联网技术的发展,Web站点日益增多,伴随着分布式技术的迅猛发展,Web站点的部署已逐渐趋于多主机化,不仅仅在同一个物理位置区域。与此同时,为了保护自己的网站数据,反爬虫技术也日益加强,越来越多的反爬虫机制给爬虫系统造成的麻烦越来越多。因此,爬虫系统的爬取方式也从单点发展至分布式,以便更快速的爬取数据,此外,代理节点技术也是一个很好的抵御反爬虫技术的方式。
但是在这个过程中,由于网络负载的问题、代理节点的可用性问题、代理节点的的工作效率问题,将导致爬虫任务的低效率。
因此,亟待提供一种能够充分均衡网络负载的高效、稳定的分布式爬虫系统解决方案。
发明内容
本发明所要解决的技术问题是克服现有技术的缺陷,提供一种能够均衡网络负载、高效、稳定的分布式爬虫系统。
为解决上述技术问题,本发明提供一种网络负载均衡的多代理分布式爬虫系统,包括多个代理节点,所述多个代理节点被配置为执行爬虫任务并返回爬行结果,其特征是,包括:
数据计算模块,被配置为计算任务的权重并根据计算结果筛选出新种子;
中心控制模块,被配置为根据代理节点选择算法选定代理节点并将任务下发至选定代理节点实现网络负载均衡;中心控制模块被进一步配置为:获取目标的物理位置和工作次数信息,计算求出备选代理节点等待参数,然后将任务下发给等待参数最小的代理节点。
代理节点获取模块,被配置为获取可被使用的代理节点并向代理节点监控模块提交新代理节点;
代理节点监控模块,被配置为监控可用代理节点的生存状态及考核代理节点获取模块提交的新代理节点的可用性。
进一步地,所述中心控制模块,被进一步配置为:管理员对系统进行控制,其中系统控制包括启动系统、关闭系统、注入初始种子、请求新可用代理节点、维护节点池、存储代理节点的状态信息、向代理节点监控模块发出节点监控命令以及选择代理节点并分配任务给代理节点。
进一步地,还包括:数据存储模块,被配置为将数据爬取结果进行存储。
在另一方面本发明要解决的技术问题是提供一种有较好的抵御反爬虫系统能力的分布式爬虫系统解决方案,为解决此技术问题,本发明系统进一步包括:
所述中心控制模块与代理节点监控模块被配置为配合完成监控所有当前存活的代理节点的任务;进一步地,中心控制模块被配置为在监控间隔时间范围内随机向代理节点监控模块发出监控命令,代理节点监控模块将在接收命令后,对指定代理节点进行监控;
所述代理节点监控模块,被配置为将代理节点的状态信息提交给中心控制模块;进一步地,还被配置为监控代理节点获取模块所提交的新代理节点,若返回时间小于允许最大返回值,则视为可用,代理节点监控模块将此新代理节点的状态信息提交给中心控制模块,中心控制模块将更新该节点的状态信息,否则将丢弃。
在另一方面,本发明提供一种网络负载均衡的多代理分布式爬虫方法,其特征在于,包括:
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于南京邮电大学,未经南京邮电大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201810540298.3/2.html,转载请声明来源钻瓜专利网。