[发明专利]一种基于人工智能的大数据采集存储系统及方法在审
申请号: | 202010361774.2 | 申请日: | 2020-04-30 |
公开(公告)号: | CN111538886A | 公开(公告)日: | 2020-08-14 |
发明(设计)人: | 不公告发明人 | 申请(专利权)人: | 广东所能网络有限公司 |
主分类号: | G06F16/951 | 分类号: | G06F16/951;G06F16/9536;G06F16/955 |
代理公司: | 暂无信息 | 代理人: | 暂无信息 |
地址: | 528000 广东省佛山市禅城区张槎*** | 国省代码: | 广东;44 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 基于 人工智能 数据 采集 存储系统 方法 | ||
1.一种基于人工智能的大数据采集存储系统及方法,其包括大数据管理平台、大数据抓取及方法、大数据存储及方法;
大数据管理平台对大数据抓取和大数据存储进行数据管理及方法管理;
所述的大数据抓取用于全网抓取公开数据,包括但不限于百度、搜狗、360、微博、微信及其他网站的公开数据进行抓取;
进一步的,所述大数据存储基于大数据抓取的数据进行数据存储,用分布式进行数据存储;
本发明提供一种大数据抓取方法,包括步骤如下:
①分布式抓取:利用分布式原理搭建分布式方法进行分布式抓取;
②意外断开后从断点续抓:因特殊原因导致系统意外断开,当重新连接后能有效的接着上次抓取的数据继续抓取剩余的信息,防止特殊情况带来的损失;
③能反抓取:具有了自我管理和学习进步的能力,能够针对现有的知识进行快速的学习并且进行后续改进防止别人进行抓取;
④时间判断:每天抓取的内容都不一样,通过时间判断能有效的抓取当前的数据,过滤掉昨天以前的数据;
⑤防止重复抓取:各个公开全网站及各个页面的数据有可能是完全一样的,为了避免重复数据的的出现,需对数据标题及内容进行分析再抓取,避免出现重复抓取,减少资源消耗;
⑥关键词抓取:通过关键词进行数据抓取,能精准有效的抓取网络公开数据;
⑦定期和持续抓取:定期抓取就是在一定的时间内进行数据抓取,过了这段时间将不再进行抓取,持续抓取将一直保持数据抓取;
⑧记忆采集点:人工智能记忆法,只要采集过的网站,就像人的记忆一样能智能识别并且准确的进行采集所需数据,智能过滤没用的数据,只保留图文信息,在采集过程中因意外导致停止工作时,能有效的记住采集进度,当重新工作时能接着完成未完成的工作;
⑨自动分析归类:自动分析过滤广告等没用的信息,存储所需的图文信息;自动分析生产采集规则,智能抓取各个公开全网站的图文信息;自动分析纠正,能够智能学习人工纠错的内容,使准确率越来越精准;
本发明提供一种数据存储的方法,包括步骤如下:
①利用分布式文件系统:hdfs为管理大数据资源池和支撑相关大数据分析应用提供了一个具有高可靠性的工具,为分布式数据库做好铺垫;
②分布式数据库:hbase、mongodb、elasticsearch充分利用它们的存储原理将抓取过滤过的数据进行存储;
③分布式内存存储:redis缓存,使平台保证访问速度的同时减少数据库的访问;
与现有技术相比,本发明具有的明显优点与效果:本发明属于大数据技术领域,公开了一种基于人工智能的大数据采集存储系统及方法,包括以下步骤:利用所能大数据管理平台获取指定公开全网站的网络公开资源,利用大数据抓取网络信息,具备分布式抓取,意外断开后智能抓取,反抓取,智能判断时间,智能防重,定期抓取及持续抓取等方法,精准完整得获取网络信息,最后把抓取的数据都分布式存储到hbase、MongoDB、elasticsearch中以此解决千万级的数据处理,大大提升了大数据采集效率以及减少大数据采集过程中技术人员的工作量。
2.根据权利需求1所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述大数据管理模块用于对用户操作管理过程中存在异常行为进行判定,以识别异常用户,并将异常用户的账号进行安全控制。
3.根据权利要求2所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述的大数据抓取过程中存在并发中出现的异常进行判定,以识别出异常数据,并将异常数据进行安全控制。
4.根据权利需求3所述的一种基于人工智能的大数据采集存储系统及方法,其特征在于:所述的数据存储模块,用于对数据存储过程中出现的异常数据进行判定,以识别出异常存储数据,并将异常存储数据进行安全控制。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于广东所能网络有限公司,未经广东所能网络有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202010361774.2/1.html,转载请声明来源钻瓜专利网。
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置