[发明专利]中文分词方法及装置无效
申请号: | 200710102082.0 | 申请日: | 2007-05-14 |
公开(公告)号: | CN101071421A | 公开(公告)日: | 2007-11-14 |
发明(设计)人: | 王启明 | 申请(专利权)人: | 腾讯科技(深圳)有限公司 |
主分类号: | G06F17/28 | 分类号: | G06F17/28 |
代理公司: | 北京集佳知识产权代理有限公司 | 代理人: | 逯长明 |
地址: | 518044广东省深圳市*** | 国省代码: | 广东;44 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 中文 分词 方法 装置 | ||
1、一种中文分词方法,其特征在于,包括:
为分词集合中的分词赋权值,所述分词集合中的分词按照分词在句子中的位置排序;
从所述分词集合的最后一个分词开始,记录当前分词的权值与其在前分词到句尾的距离的和,作为当前分词到句尾的距离,标记该在前分词与当前分词的拼接关系,直到得到分词集合中第一个分词到句尾的距离,及所述第一个分词与其在前分词的拼接关系;其中,所述在前分词为所述当前分词的所有在前分词中到句尾的距离最短的在前分词;
从所述分词集合的第一个分词开始,选择所述到句尾的距离最短的句首分词,所述句首分词的第一个字为所述句子的第一个字;
从所述句首分词开始,根据所述拼接关系,依次获取拼接关系中所标记的在前分词,直到句子结束。
2、如权利要求1所述的方法,其特征在于,所述方法进一步包括:
对句子进行分词处理,得到所述句子的分词集合;
按照分词在句子中的位置,对所述分词集合中的分词进行排序,得到排序后的分词集合。
3、如权利要求1或2所述的方法,其特征在于,若当前分词的至少两个在前分词到句尾的距离相等且最短,则
从其中选择在分词集合中排序位置靠前的在前分词,为该当前分词与所述在前分词标记一个拼接关系。
4、如权利要求3所述的方法,其特征在于,若至少有两个句首分词到句尾的距离相等且最短;
从其中选择在分词集合中排序位置靠前的句首分词。
5、如权利要求4所述的方法,其特征在于,分词集合中的每个分词所赋的权值相等或者不相等。
6、一种中文分词装置,其特征在于,包括:
赋值单元,用于为分词集合中的分词赋权值,所述分词集合中的分词按照分词在句子中的位置排序;
记录单元,用于从所述排序的最后一个分词开始,记录当前分词的权值与其在前分词到句尾的距离的和,作为当前分词到句尾的距离,标记该在前分词与当前分词的拼接关系,直到得到分词集合中第一个分词到句尾的距离,及所述第一个分词与其在前分词的拼接关系;其中,所述在前分词为所述当前分词的所有在前分词中到句尾的距离最短的在前分词;
句首分词选择单元,用于从分词集合中的第一个分词开始,选择所述到句尾的距离最短的句首分词,所述句首分词的第一个字为所述句子的第一个字;
分词选择单元,用于从所述句首分词开始,根据所述拼接关系,依次获取拼接关系中所标记的在前分词,直到句子结束。
7、如权利要求6所述的装置,其特征在于,所述装置进一步包括:
句子粗分单元,用于对句子进行分词处理,得到所述句子的分词集合;
排序单元,用于按照分词在句中的位置,对所述分词集合中的分词进行排序,得到排序后的分词集合。
8、如权利要求6或7所述的装置,其特征在于,若当前分词的至少两个在前分词到句尾的距离相等且最短,则
所述记录单元,用于从其中选择在分词集合中排序位置靠前的在前分词,为该当前分词与所述在前分词标记一个拼接关系。
9、如权利要求8所述的装置,其特征在于,若至少有两个句首分词到句尾的距离相等且最短,则
所述句首分词选择单元,用于从其中选择分词集合中排序位置靠前的句首分词。
10、如权利要求9所述的装置,其特征在于,所述赋值单元为分词集合中的每个分词所赋的权值相等或者不相等。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于腾讯科技(深圳)有限公司,未经腾讯科技(深圳)有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/200710102082.0/1.html,转载请声明来源钻瓜专利网。