[发明专利]基于两两对齐的多语种句对齐方法及装置有效

专利信息
申请号: 201310674134.7 申请日: 2013-12-11
公开(公告)号: CN103617160A 公开(公告)日: 2014-03-05
发明(设计)人: 薛永增;郑德权;徐冰;赵铁军;朱聪慧;杨沐昀;曹海龙 申请(专利权)人: 哈尔滨工业大学
主分类号: G06F17/28 分类号: G06F17/28;G06F17/27
代理公司: 哈尔滨市松花江专利商标事务所 23109 代理人: 张利明
地址: 150001 黑龙*** 国省代码: 黑龙江;23
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 基于 对齐 语种 方法 装置
【权利要求书】:

1.基于两两对齐的多语种句对齐装置,其特征在于,它包括:

用于获取同一文件至少三种不同语言版本的文本的装置;

用于分别对每个语种的文本进行句子分割,获得不同语种待对齐的句子的装置;

用于对不同语种待对齐的句子进行两两对齐,然后对每组两两对齐的句子进行评分,获得所有两两对齐句子的集合A的装置;

用于对集合A中每组两两对齐句子进行冲突识别,将不冲突的两两对齐的句子从集合A中剔除,获得集合A中所有冲突的句子的集合,即差异部分的装置;

用于对差异部分进行评分,然后对该差异部分进行重新对齐,获得重新对齐的结果集合B,将A的非差异部分与B合在一起,获得全部句对齐结果的装置。

2.根据权利要求1所述基于两两对齐的多语种句对齐装置,其特征在于,用于分别对每个语种的文本进行句子分割,获得不同语种待对齐的句子的装置进一步包括:

用于将每个语种的文本中所有的时间标识和换行符删除,获得所有句子均合并为一行的文本的装置;

用于对文本中所有字符进行扫描,扫描所有表示语句结束的符号,然后根据所述符号将文本分割成若干条句子,每条句子作为一个独立的单语种句子的装置。

3.根据权利要求1所述基于两两对齐的多语种句对齐装置,其特征在于,用于对两两对齐句子进行冲突识别的装置进一步包括:

用于将所有两两对齐的句子放入索引表中进行索引的装置;

用于判断所有两两对齐的句子是否冲突,并将冲突的两两对齐句子标记为冲突的装置。

4.基于两两对齐的多语种句对齐方法,其特征在于,该方法包括以下步骤:

步骤一:用于获取同一文件至少三种不同语言版本的文本的步骤;

步骤二:用于分别对步骤一获得的每个语种的文本进行句子分割,获得不同语种待对齐的句子的步骤;

步骤三:用于对步骤二获得的不同语种待对齐的句子进行两两对齐,然后对每组两两对齐的句子进行评分,获得所有两两对齐句子的集合A的步骤;

步骤四:用于对步骤三获得的集合A中每组两两对齐句子进行冲突识别,将不冲突的两两对齐的句子从集合A中剔除,获得集合A中所有冲突的句子的集合,即差异部分的步骤;

步骤五:用于对步骤四获得的差异部分进行评分,然后对该差异部分进行重新对齐,获得重新对齐的结果集合B,将A的非差异部分与B合在一起,获得全部句对齐结果的步骤。

5.根据权利要求4所述基于两两对齐的多语种句对齐方法,其特征在于,步骤二中对每个语种的文本进行句子分割的方法为:

步骤二一:用于将每个语种的文本中所有的时间标识和换行符删除,获得所有句子均合并为一行的文本的步骤;

步骤二二:用于对步骤二一获得的文本中所有字符进行扫描,扫描所有表示语句结束的符号,然后根据所述符号将文本分割成若干条句子,每条句子作为一个独立的单语种句子的步骤。

6.根据权利要求4所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四中对两两对齐结果中的差异部分进行识别的方法为:

步骤四一:用于将集合A中所有两两对齐的句子放入索引表中进行索引的步骤;

步骤四二:用于判断所有两两对齐的句子是否冲突,并将冲突的两两对齐句子标记为冲突的步骤。

7.根据权利要求6所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四一所述的索引表包括四层,第一层为源语言的语种序号i;第二层为目标语言的语种序号j;第三层为所有两两对齐句子中,源语言句子的标识Ni;第四层为与Ni两两对齐的目标语言句子的标识Nj

8.根据权利要求6所述基于两两对齐的多语种句对齐方法,其特征在于,步骤四二所述判断所有两两对齐的句子是否冲突的方法为:

根据索引获得的结果,当Ni-Nj的值为0时,则构成一个冲突。

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于哈尔滨工业大学,未经哈尔滨工业大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/201310674134.7/1.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top