[发明专利]一种赛事文字直播关键句抽取方法在审
申请号: | 201810310247.1 | 申请日: | 2018-04-09 |
公开(公告)号: | CN108549636A | 公开(公告)日: | 2018-09-18 |
发明(设计)人: | 吕学强;董志安 | 申请(专利权)人: | 北京信息科技大学;吕学强 |
主分类号: | G06F17/27 | 分类号: | G06F17/27;G06F17/30;G06N3/08 |
代理公司: | 暂无信息 | 代理人: | 暂无信息 |
地址: | 100192 北*** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 抽取 时间特征 二分类 关键词扩展 直播 正确率 转换 算法 分类 应用 | ||
本发明涉及一种赛事文字直播关键句抽取方法,其特征在于,包括:步骤一:利用Word2Vec进行关键词扩展,得到得分相关词集和其他相关词集,将得分相关词集、其他相关词集再加上比分特征和时间特征共同构成关键句抽取特征;步骤二:把关键句抽取转换为二分类问题,利用Adaboost算法进行分类。本发明首先利用Word2Vec对得分关键词和其他关键词进行扩展,得到得分相关词集和其他相关词集,然后把关键句抽取转换为二分类问题,以得分相关词集、其他相关词集、比分特征以及时间特征作为抽取特征,并利用Adaboost提升算法进行抽取,得到了更加准确的抽取效果,达到了很好的抽取效果,抽取结果的正确率、召回率和F值均较高,可以很好地满足实际应用的需要。
技术领域
本发明属于文本信息处理技术领域,具体涉及一种赛事文字直播关键句抽取方法。
背景技术
随着科学技术的发展,互联网信息已经深刻地影响了人们的工作和日常生活,尤其是手机终端的普遍流行,让信息的传达变得越来越便捷,在这种互联网新媒体下,体育新闻成为人们及时了解体育赛况的一个主要途径,但是相对于体育赛事直播来说,体育新闻的报导还存在一定的滞后性,因此如何提高新闻写作的时效性,实现将传统的信息采集、新闻稿撰写、新闻稿编排等过程的融合,形成从“数据抽取”到“文稿生成”的两步式新闻自动生产方式,是未来新闻写作的热点研究方向。目前体育赛事的“数据抽取”包括赛事实体的抽取、比赛数据的挖掘以及赛事动态信息的抽取。其中,赛事精彩动态信息的自动提取是目前研究的热点之一,利用这一功能,可以从大量直播数据中方便地获取比赛中的重要事件。关键句抽取可以使用自动文摘中文摘句的选取方法。自动文摘中文摘句的选取主要有三种方法:第一种是利用句子排序问题,对句子进行排序,选择分值高的句子作为文摘句,分值低的句子被排除在外。然而,现有技术的方法设计不够科学,关键句抽取效果不佳,抽取结果的正确率、召回率和F值均比较低,不能满足实际应用的需要,现在亟待研发一种抽取效果好、抽取结果的正确率、召回率和F值均较高的抽取方法。
发明内容
针对上述现有技术中存在的问题,本发明的目的在于提供一种可避免出现上述技术缺陷的赛事文字直播关键句抽取方法。
为了实现上述发明目的,本发明提供的技术方案如下:
一种赛事文字直播关键句抽取方法,包括:
步骤一:利用Word2Vec进行关键词扩展,得到得分相关词集和其他相关词集,将得分相关词集、其他相关词集再加上比分特征和时间特征共同构成关键句抽取特征;
步骤二:把关键句抽取转换为二分类问题,利用Adaboost算法进行分类。
进一步地,步骤一包括:利用Word2Vec工具把背景语料中的词语用向量进行形式化表示,把对文本的处理简化为向量空间中的向量运算,通过计算向量空间上的相似度来表示文本语义上的相似度,实现相关词扩展。
进一步地,步骤一还包括:在将词表示为相应的向量形式后,向训练后得到的词向量文件中输入关键词,通过计算余弦距离,输出在一定阈值内或者一定的顺序与该关键词在语义上相似的词语,从而得到关键词的相关词集。
进一步地,余弦距离的计算如下式所示:
其中,distance(w1,w2)代表词w1和w2的余弦距离,和分别为向量空间中w1和w2的词向量。
进一步地,步骤一包括:
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于北京信息科技大学;吕学强,未经北京信息科技大学;吕学强许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/201810310247.1/2.html,转载请声明来源钻瓜专利网。