[发明专利]一种版面信息识别的方法及装置有效
申请号: | 201010193898.0 | 申请日: | 2010-05-28 |
公开(公告)号: | CN102262618A | 公开(公告)日: | 2011-11-30 |
发明(设计)人: | 高良才;汤帜;房婧;仇睿恒 | 申请(专利权)人: | 北京大学;北大方正集团有限公司;北京北大方正技术研究院有限公司 |
主分类号: | G06F17/22 | 分类号: | G06F17/22;G06F17/27 |
代理公司: | 北京天昊联合知识产权代理有限公司 11112 | 代理人: | 陈源;罗建民 |
地址: | 100871*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明提供一种版面信息识别方法,包括:读取待识别版面,分离字符文本对象与图像对象,合并文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。相应地,本发明提供一种版面信息识别装置。本发明将版面上的全部图像和图注综合考虑,通过最优匹配方法获得图像与图注的全局最优匹配,不受图像与图注数目以及它们之间空间样式的限制,能够从全局上找到最优的关联关系,从而改进现有的版面阅读顺序识别效果。 | ||
搜索关键词: | 一种 版面 信息 识别 方法 装置 | ||
【主权项】:
一种改进版面阅读顺序识别效果的方法,包括以下步骤:读取待识别版面,分离该版面中的字符文本对象与图像对象,并将字符文本对象合并成文本块,将图像对象保留为图像块;从合并的文本块中识别出图注文本块;利用优化方法对图像块和图注文本块进行最优匹配,从而获得相关联的图像块与图注文本块;从所述版面的文本块中去掉图注文本块,并确定其余文本块和图像块的阅读顺序;在阅读顺序中将图注文本块插回到相关联的图像块之后。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京大学;北大方正集团有限公司;北京北大方正技术研究院有限公司,未经北京大学;北大方正集团有限公司;北京北大方正技术研究院有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201010193898.0/,转载请声明来源钻瓜专利网。
- 信息记录介质、信息记录方法、信息记录设备、信息再现方法和信息再现设备
- 信息记录装置、信息记录方法、信息记录介质、信息复制装置和信息复制方法
- 信息记录装置、信息再现装置、信息记录方法、信息再现方法、信息记录程序、信息再现程序、以及信息记录介质
- 信息记录装置、信息再现装置、信息记录方法、信息再现方法、信息记录程序、信息再现程序、以及信息记录介质
- 信息记录设备、信息重放设备、信息记录方法、信息重放方法、以及信息记录介质
- 信息存储介质、信息记录方法、信息重放方法、信息记录设备、以及信息重放设备
- 信息存储介质、信息记录方法、信息回放方法、信息记录设备和信息回放设备
- 信息记录介质、信息记录方法、信息记录装置、信息再现方法和信息再现装置
- 信息终端,信息终端的信息呈现方法和信息呈现程序
- 信息创建、信息发送方法及信息创建、信息发送装置