[发明专利]网页数据抓取系统在审
申请号: | 201710590969.2 | 申请日: | 2017-07-19 |
公开(公告)号: | CN110069681A | 公开(公告)日: | 2019-07-30 |
发明(设计)人: | 吴建波 | 申请(专利权)人: | 上海臻客商务咨询有限公司 |
主分类号: | G06F16/951 | 分类号: | G06F16/951;G06F16/9535;G06F16/903 |
代理公司: | 上海宏京知识产权代理事务所(普通合伙) 31297 | 代理人: | 孙益青 |
地址: | 202150 上海市崇明县长兴镇潘园公*** | 国省代码: | 上海;31 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本申请公开了一种网页数据抓取系统,包括:数据配置模块,线程管理模块,数据读取模块,数据解析模块,数据匹配模块和数据存储模块;数据配置模块用于写入、存储、修改和删除网页数据配置文件;数据读取模块用于连接待抓取数据的网页;线程控制模块控制数据读取模块实现多线程同步网页连接;数据解析模块解析该网页的网页文本信息;数据匹配模块根据网页文本信息中的表达式语法规则,从网页中抓取网页数据;数据存储网页数据并对其分配自动生成的数据标记。本申请结构简单,易于制备。能够实现精确快速高效的网页数据抓取工作。 | ||
搜索关键词: | 网页数据 抓取 网页 数据读取模块 数据解析模块 数据配置模块 数据匹配模块 网页文本 抓取系统 数据存储模块 线程管理模块 读取模块 控制模块 控制数据 配置文件 数据标记 数据存储 语法规则 自动生成 多线程 线程 申请 制备 解析 删除 写入 存储 分配 | ||
【主权项】:
1.一种网页数据抓取系统,其特征在于包括:数据配置模块,线程管理模块,数据读取模块,数据解析模块,数据匹配模块和数据存储模块;所述数据配置模块用于写入、存储、修改和删除网页数据配置文件,所述网页数据配置文件用于描述带抓取网页数据的网页登录信息配置;所述数据读取模块连接数据配置模块、根据数据配置模块中存储的网页数据配置文件连接至待抓取数据的网页;所述线程控制模块连接数据读取模块、控制数据读取模块实现多线程同步网页连接;所述数据解析模块连接数据读取模块、读取数据读取模块连接的网页并解析该网页的网页文本信息;所述数据匹配模块连接数据解析模块和数据读取模块,根据数据解析模块获取的网页文本信息中的表达式语法规则,从数据读取模块连接的网页中抓取网页数据;所述数据存储模块连接数据匹配模块,存储网页数据并对该网页数据分配自动生成的数据标记。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于上海臻客商务咨询有限公司,未经上海臻客商务咨询有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201710590969.2/,转载请声明来源钻瓜专利网。
- 上一篇:搜索处理方法、移动终端和计算机可读存储介质
- 下一篇:一种互联网网页采集方法