[发明专利]基于两两对齐的多语种句对齐方法及装置有效
申请号: | 201310674134.7 | 申请日: | 2013-12-11 |
公开(公告)号: | CN103617160A | 公开(公告)日: | 2014-03-05 |
发明(设计)人: | 薛永增;郑德权;徐冰;赵铁军;朱聪慧;杨沐昀;曹海龙 | 申请(专利权)人: | 哈尔滨工业大学 |
主分类号: | G06F17/28 | 分类号: | G06F17/28;G06F17/27 |
代理公司: | 哈尔滨市松花江专利商标事务所 23109 | 代理人: | 张利明 |
地址: | 150001 黑龙*** | 国省代码: | 黑龙江;23 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 基于 对齐 语种 方法 装置 | ||
1.基于两两对齐的多语种句对齐装置,其特征在于,它包括:
用于获取同一文件至少三种不同语言版本的文本的装置;
用于分别对每个语种的文本进行句子分割,获得不同语种待对齐的句子的装置;
用于对不同语种待对齐的句子进行两两对齐,然后对每组两两对齐的句子进行评分,获得所有两两对齐句子的集合A的装置;
用于对集合A中每组两两对齐句子进行冲突识别,将不冲突的两两对齐的句子从集合A中剔除,获得集合A中所有冲突的句子的集合,即差异部分的装置;
用于对差异部分进行评分,然后对该差异部分进行重新对齐,获得重新对齐的结果集合B,将A的非差异部分与B合在一起,获得全部句对齐结果的装置。
2.根据权利要求1所述基于两两对齐的多语种句对齐装置,其特征在于,用于分别对每个语种的文本进行句子分割,获得不同语种待对齐的句子的装置进一步包括:
用于将每个语种的文本中所有的时间标识和换行符删除,获得所有句子均合并为一行的文本的装置;
用于对文本中所有字符进行扫描,扫描所有表示语句结束的符号,然后根据所述符号将文本分割成若干条句子,每条句子作为一个独立的单语种句子的装置。
3.根据权利要求1所述基于两两对齐的多语种句对齐装置,其特征在于,用于对两两对齐句子进行冲突识别的装置进一步包括:
用于将所有两两对齐的句子放入索引表中进行索引的装置;
用于判断所有两两对齐的句子是否冲突,并将冲突的两两对齐句子标记为冲突的装置。
4.基于两两对齐的多语种句对齐方法,其特征在于,该方法包括以下步骤:
步骤一:用于获取同一文件至少三种不同语言版本的文本的步骤;
步骤二:用于分别对步骤一获得的每个语种的文本进行句子分割,获得不同语种待对齐的句子的步骤;
步骤三:用于对步骤二获得的不同语种待对齐的句子进行两两对齐,然后对每组两两对齐的句子进行评分,获得所有两两对齐句子的集合A的步骤;
步骤四:用于对步骤三获得的集合A中每组两两对齐句子进行冲突识别,将不冲突的两两对齐的句子从集合A中剔除,获得集合A中所有冲突的句子的集合,即差异部分的步骤;
步骤五:用于对步骤四获得的差异部分进行评分,然后对该差异部分进行重新对齐,获得重新对齐的结果集合B,将A的非差异部分与B合在一起,获得全部句对齐结果的步骤。
5.根据权利要求4所述基于两两对齐的多语种句对齐方法,其特征在于,步骤二中对每个语种的文本进行句子分割的方法为:
步骤二一:用于将每个语种的文本中所有的时间标识和换行符删除,获得所有句子均合并为一行的文本的步骤;
步骤二二:用于对步骤二一获得的文本中所有字符进行扫描,扫描所有表示语句结束的符号,然后根据所述符号将文本分割成若干条句子,每条句子作为一个独立的单语种句子的步骤。
6.根据权利要求4所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四中对两两对齐结果中的差异部分进行识别的方法为:
步骤四一:用于将集合A中所有两两对齐的句子放入索引表中进行索引的步骤;
步骤四二:用于判断所有两两对齐的句子是否冲突,并将冲突的两两对齐句子标记为冲突的步骤。
7.根据权利要求6所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四一所述的索引表包括四层,第一层为源语言的语种序号i;第二层为目标语言的语种序号j;第三层为所有两两对齐句子中,源语言句子的标识Ni;第四层为与Ni两两对齐的目标语言句子的标识Nj。
8.根据权利要求6所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四二所述判断所有两两对齐的句子是否冲突的方法为:
根据索引获得的结果,当Ni-Nj的值为0时,则构成一个冲突。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于哈尔滨工业大学,未经哈尔滨工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201310674134.7/1.html,转载请声明来源钻瓜专利网。
- 上一篇:提高宽厚板长度方向厚度精度的轧制方法
- 下一篇:一种矿井突水水源层识别方法