[发明专利]句子级双语对齐方法及系统有效
申请号: | 201811561745.X | 申请日: | 2018-12-20 |
公开(公告)号: | CN109697287B | 公开(公告)日: | 2020-01-21 |
发明(设计)人: | 聂镭;李睿;聂颖;郑权;张峰 | 申请(专利权)人: | 龙马智芯(珠海横琴)科技有限公司 |
主分类号: | G06F40/205 | 分类号: | G06F40/205;G06F40/211;G06F40/58 |
代理公司: | 11593 北京博讯知识产权代理事务所(特殊普通合伙) | 代理人: | 柳兴坤 |
地址: | 519031 广东省珠*** | 国省代码: | 广东;44 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | 本发明公开了一种句子级双语对齐方法及系统,该方法包括:步骤S1:对待对齐的两文本进行处理,得到第一语句列表和第二语句列表;步骤S2:计算该第一语句列表中的每一个语句与该第二语句列表中的每一个语句的文本相似度;步骤S3:根据该第一语句列表中的语句在该一个文本中的对应语句的位置与该第二语句列表中的语句在该另一个文本中的对应语句的位置对该文本相似度进行修正,得到该第一语句列表中的每一个语句与该第二语句列表中的每一个语句的语句匹配度;步骤S4:根据该第一语句列表中的每一个语句与该第二语句列表中的每一个语句的语句匹配度得到该两文本的语句对齐结果。本发明有利于提高语句对齐效率。 | ||
搜索关键词: | 语句 对齐 文本 文本相似度 匹配度 句子 修正 | ||
【主权项】:
1.一种句子级双语对齐方法,其特征在于,包括:/n步骤S1:对待对齐的两文本进行处理,得到第一语句列表和第二语句列表,其中,所述第一语句列表的语句由所述两文本中的一个文本的语句得到,所述第二语句列表的语句由所述两文本中的另一个文本的语句得到,且所述第一语句列表中的语句与所述第二语句列表中的语句语言相同;/n步骤S2:计算所述第一语句列表中的每一个语句与所述第二语句列表中的每一个语句的文本相似度;/n步骤S3:根据所述第一语句列表中的语句在所述一个文本中的对应语句的位置与所述第二语句列表中的语句在所述另一个文本中的对应语句的位置对所述文本相似度进行修正,得到所述第一语句列表中的每一个语句与所述第二语句列表中的每一个语句的语句匹配度;/n步骤S4:根据所述第一语句列表中的每一个语句与所述第二语句列表中的每一个语句的语句匹配度得到所述两文本的语句对齐结果;/n其中,所述步骤S3包括:/n建立文本相似度矩阵B:/n
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于龙马智芯(珠海横琴)科技有限公司,未经龙马智芯(珠海横琴)科技有限公司许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201811561745.X/,转载请声明来源钻瓜专利网。