[发明专利]面向多源软件开发数据融合的开发者画像建模方法有效
申请号: | 201710554338.5 | 申请日: | 2017-07-04 |
公开(公告)号: | CN107491299B | 公开(公告)日: | 2021-09-10 |
发明(设计)人: | 李斌;丁佐琳;孙小兵;周澄 | 申请(专利权)人: | 扬州大学 |
主分类号: | G06F16/35 | 分类号: | G06F16/35;G06F40/30;G06F8/30 |
代理公司: | 南京中新达专利代理有限公司 32226 | 代理人: | 孙鸥;朱杰 |
地址: | 225009 *** | 国省代码: | 江苏;32 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: |
本发明涉及面向多源软件开发数据融合的开发者画像建模方法。本发明从GitHub中的README.md、代码文本和Stack Overflow中Answers中的代码文本、Answers中的描述文本提取特征和API,计算出特征的相似度和API的相似度,再计算两者的综合相似度,并排序,综合相似度大于某一个值(θ)时,即认为GitHub的developer |
||
搜索关键词: | 面向 软件 开发 数据 融合 开发者 画像 建模 方法 | ||
【主权项】:
面向多源软件开发数据融合的开发者画像建模方法,其特征在于如下步骤:步骤1).收集GitHub中的数据,对GitHub的信息进行文本提取,提取所有项目中的README.md,将README.md进行自然语言处理,使用命名实体识别技术确定文本中的单词或者短语是否为特征,使用命名实体消歧技术确定特定单词或者短语所指的具体特征,提取到的单词或短语都为特征;对GitHub信息库中的信息进行文本提取,提取所有diff中的代码文本,使用文本信息预处理技术,如分词、词根还原、去掉停用词,提取代码文本中的API;步骤2).收集Stack Overflow中的数据,对Stack Overflow的信息进行文本提取,提取Answers中的代码文本,使用文本信息预处理技术,如分词、词根还原、去掉停用词,提取代码文本中的API;对Stack Overflow的信息进行文本提取,提取Answers中的描述文本,对Answers中的描述文本进行自然语言处理,使用命名实体识别技术确定文本中的单词或者短语是否为特征,使用命名实体消歧技术确定特定单词或者短语所指的具体特征,提取到的单词或短语都为特征;步骤3).经过步骤1)后得到的特征和经过步骤2)后得到的特征进行相似度计算;经过步骤1)后得到的API和经过步骤2)后得到的API进行相似度计算;步骤4).同一用户的数据进行融合,对步骤3)中得到的特征相似度和API相似度再计算综合相似度,根据综合相似度值,判别用户的同一性。步骤5).对融合后的数据进行自然语言处理,提取commit和Answers信息,LDA(Latent Dirichlet All ocation)是一种文档主题生成模型,可利用LDA主题模型提取主题词,得到开发者的技能;步骤6).对融合后的数据进行文本提取,提取commit,issue,questions,Answers等描述文本,利用LDA主题模型,按照日期提取主题词,得到开发者在某一天的活动;步骤7).对融合后的数据进行文本提取,提取代码文本,使用文本信息预处理技术,如分词、词根还原、去掉停用词,提取代码文本中的API,建立开发者与代码的关系;步骤8).对融合后的数据进行文本提取,提取commit,issue,questions,Answers等描述文本,利用文本处理提取开发者,组建软件开发者的网络关系,开发者建立关系边的类型有:参加过同一个项目,Stars,Following,Followers,回答过同一个问题,对答案进行评论;步骤9)将步骤5)得到的技能、步骤6)得到的活动、步骤7)得到的开发者与代码之间的关系、步骤8)得到的开发者与开发者之间的关系结合起来,最终生成开发者画像。
下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于扬州大学,未经扬州大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/patent/201710554338.5/,转载请声明来源钻瓜专利网。
- 上一篇:一种按钮对象自动扫描方法及系统
- 下一篇:一种智能功能的提示方法及其终端
- 数据显示系统、数据中继设备、数据中继方法、数据系统、接收设备和数据读取方法
- 数据记录方法、数据记录装置、数据记录媒体、数据重播方法和数据重播装置
- 数据发送方法、数据发送系统、数据发送装置以及数据结构
- 数据显示系统、数据中继设备、数据中继方法及数据系统
- 数据嵌入装置、数据嵌入方法、数据提取装置及数据提取方法
- 数据管理装置、数据编辑装置、数据阅览装置、数据管理方法、数据编辑方法以及数据阅览方法
- 数据发送和数据接收设备、数据发送和数据接收方法
- 数据发送装置、数据接收装置、数据收发系统、数据发送方法、数据接收方法和数据收发方法
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置
- 数据发送方法、数据再现方法、数据发送装置及数据再现装置