[发明专利]网页数据抓取系统在审

专利信息
申请号: 201710590969.2 申请日: 2017-07-19
公开(公告)号: CN110069681A 公开(公告)日: 2019-07-30
发明(设计)人: 吴建波 申请(专利权)人: 上海臻客商务咨询有限公司
主分类号: G06F16/951 分类号: G06F16/951;G06F16/9535;G06F16/903
代理公司: 上海宏京知识产权代理事务所(普通合伙) 31297 代理人: 孙益青
地址: 202150 上海市崇明县长兴镇潘园公*** 国省代码: 上海;31
权利要求书: 查看更多 说明书: 查看更多
摘要: 本申请公开了一种网页数据抓取系统,包括:数据配置模块,线程管理模块,数据读取模块,数据解析模块,数据匹配模块和数据存储模块;数据配置模块用于写入、存储、修改和删除网页数据配置文件;数据读取模块用于连接待抓取数据的网页;线程控制模块控制数据读取模块实现多线程同步网页连接;数据解析模块解析该网页的网页文本信息;数据匹配模块根据网页文本信息中的表达式语法规则,从网页中抓取网页数据;数据存储网页数据并对其分配自动生成的数据标记。本申请结构简单,易于制备。能够实现精确快速高效的网页数据抓取工作。
搜索关键词: 网页数据 抓取 网页 数据读取模块 数据解析模块 数据配置模块 数据匹配模块 网页文本 抓取系统 数据存储模块 线程管理模块 读取模块 控制模块 控制数据 配置文件 数据标记 数据存储 语法规则 自动生成 多线程 线程 申请 制备 解析 删除 写入 存储 分配
【主权项】:
1.一种网页数据抓取系统,其特征在于包括:数据配置模块,线程管理模块,数据读取模块,数据解析模块,数据匹配模块和数据存储模块;所述数据配置模块用于写入、存储、修改和删除网页数据配置文件,所述网页数据配置文件用于描述带抓取网页数据的网页登录信息配置;所述数据读取模块连接数据配置模块、根据数据配置模块中存储的网页数据配置文件连接至待抓取数据的网页;所述线程控制模块连接数据读取模块、控制数据读取模块实现多线程同步网页连接;所述数据解析模块连接数据读取模块、读取数据读取模块连接的网页并解析该网页的网页文本信息;所述数据匹配模块连接数据解析模块和数据读取模块,根据数据解析模块获取的网页文本信息中的表达式语法规则,从数据读取模块连接的网页中抓取网页数据;所述数据存储模块连接数据匹配模块,存储网页数据并对该网页数据分配自动生成的数据标记。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于上海臻客商务咨询有限公司,未经上海臻客商务咨询有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/patent/201710590969.2/,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top