[发明专利]一种网站信息分析系统及其方法有效

专利信息
申请号: 201010574349.8 申请日: 2010-12-03
公开(公告)号: CN102073678A 公开(公告)日: 2011-05-25
发明(设计)人: 陈奋;吴世雄;张永光 申请(专利权)人: 厦门市美亚柏科信息股份有限公司
主分类号: G06F17/30 分类号: G06F17/30
代理公司: 厦门市首创君合专利事务所有限公司 35204 代理人: 连耀忠
地址: 361000 福建省厦门*** 国省代码: 福建;35
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 一种 网站 信息 分析 系统 及其 方法
【权利要求书】:

1.一种网站信息分析系统,其特征在于:包括:

一权限验证器,其用来对目标网站进行权限检测,向目标网站发送登陆指令以提取网站的页面信息,判定目标网站是否需要用户名和密码登陆访问,对于需要用户名和密码登陆访问的目标网站,利用网络爬虫技术分析模块模拟网站的登陆流程自动登陆目标网站;

一链接提取器,其用来获取目标网站的所有链接数据信息,利用链接提取算法模块,从目标网站的页面中提取所有链接数据信息;

一链接分析器,其用来对所有链接数据信息进行分析,并按照预先设定的分类方式对所有链接数据信息进行分类分析;

一链接页面成像器,其用来对已经分类好的链接数据信息进行内存成像分析,以将链接页面自动加载在内存中并对页面直接进行成像保存分析,保存于指定存储器中;

一增量信息分析器,其用来重新遍历目标网站的所有链接并成像存储未出现于指定存储器的链接队列;

一报表生成器,根据成像的链接数据信息生成预置格式的报表;

权限验证器的输出接至链接提取器的输入,权限验证器将目标网站的页面信息输给链接提取器,由链接提取器进行网站页面链接数据信息的提取;链接提取器的输出接至链接分析器的输入,链接提取器将提取的链接数据信息输给链接分析器,由链接分析器进行归类整理;链接分析器的输出接至链接页面成像器的输入,链接分析器将归类整理的链接数据信息输给链接页面成像器,由链接页面成像器进行链接页面成像分析;链接页面成像器的输出接至增量信息分析器的输入,由增量信息分析器重新遍历目标网站的所有链接并成像存储未出现于指定存储器的链接队列;增量信息分析器的输出接至报表生成器,由报表生成器生成报表。

2.一种网站信息分析方法,其特征在于:包括如下步骤:

对目标网站进行权限检测的步骤;该步骤用来判定目标网站是否需要用户名和密码登陆访问,对于需要用户名和密码登陆访问的目标网站,采用网络爬虫技术模拟网站的登陆流程自动登陆目标网站;

获取目标网站的所有链接的步骤;该步骤是采用链接提取算法来提取目标网站中的所有链接数据信息;

分析所述链接数据信息并对其进行分类的步骤;该步骤是根据预置的方式对链接数据信息进行分类分析;

对分类好的所述链接数据信息进行内存成像分析并保存于指定存储器的步骤;

重新遍历目标网站的所有链接并成像存储未出现在指定存储器的链接队列的步骤;

根据成像的链接数据信息生成报表的步骤。

3.根据权利要求2所述的网站信息分析方法,其特征在于:所述对分类好的所述链接数据信息进行内存成像分析并保存于指定存储器的步骤,其进一步包括:

A.提取内存中分类好的链接队列中的链接信息;

B.创建一个应用程序窗口,该窗口具有一定的初始大小,同时该窗口处于隐藏状态;

C.绑定一个浏览器内核到该窗口上;

D.通过浏览器内核访问并加载链接页面内容;

E.浏览器内核加载的链接页面通过绑定的窗口展现在窗口中;

F.当链接页面加载完成或达到预定时间,则对隐藏窗口页面内容进行成像存储;

G.获取链接页面内容在窗口中的长度和高度,调用图形GDI接口对该范围内的窗口输出进行成像保存;

H.重复步骤A至G,直至链接队列容器中的链接为空。

4.根据权利要求2所述的网站信息分析方法,其特征在于:所述重新遍历目标网站的所有链接并成像存储未出现在指定存储器的链接队列的步骤,其进一步包括:

a.将已遍历的链接信息以及内存成像器成像过的链接信息保存在内存哈西容器中;

b.对整个网站重新进行遍历,将提取到的链接信息发送到内存哈西容器中进行快速查找,若发现该链接已经存在则直接忽略,否则对链接进行分类进入链接列队;

c.内存成像器对链接队列中的链接进行成像保存,同时将链接的信息存入内存哈西容器中。

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于厦门市美亚柏科信息股份有限公司,未经厦门市美亚柏科信息股份有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/201010574349.8/1.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top