[发明专利]一种基于代码文档的安卓API语义关系图谱构建方法有效

专利信息
申请号: 202011274561.2 申请日: 2020-11-15
公开(公告)号: CN112395884B 公开(公告)日: 2022-04-12
发明(设计)人: 杨珉;张源;张晓寒;张谧 申请(专利权)人: 复旦大学
主分类号: G06F40/30 分类号: G06F40/30;G06F9/54
代理公司: 上海正旦专利代理有限公司 31200 代理人: 陆飞;陆尤
地址: 200433 *** 国省代码: 上海;31
权利要求书: 查看更多 说明书: 查看更多
摘要:
搜索关键词: 一种 基于 代码 文档 api 语义 关系 图谱 构建 方法
【权利要求书】:

1.一种基于代码文档的安卓API语义关系图谱构建方法,其特征在于,具体步骤为:

(一)安卓API语义关系分类

API是安卓官方文档中最基本的元素,此外还包括类、包和权限;

对API与API、类、包和权限之间的语义关系进行分类,具体分为5大类别关系,即结构关系、原型关系、引用关系、用法关系和权限关系;

(1)结构关系,该类别描述不同API、类、包和权限之间在代码组织上的关系;安卓API文档具有层次化结构,从顶层到底层按照包、类和API的结构进行组织;每个包含有多个类,每个类是一个单独的HTML文件;类是API文档的最小文件单位,每个类文档描述了基本的层次信息和该类中的所有API;

(2)原型关系,该类别描述与API的参数类型、返回值类型和抛出的异常类型相关的关系;其中,参数类型指定了在调用时传送给API的值类型,返回值类型指定了API调用后返回何种类型的值,抛出的异常类型指定了API调用过程中如果发生异常需要捕获何种异常,它们都与API的使用息息相关,直接反映一个API的功能;

(3)用法关系,该类别描述API的使用规范和方法;在安卓的API中,存在一些API在功能和用法上相似,用法类关系就关注在描述中的可选择性;在一个实际的场景中,除了要按照API的原型正确地调用,还需要关注API与API之间的使用条件;

(4)引用关系,该类别描述一个API引用另一个API、类、包或权限的关系,包括该类关系指明一个API的使用需要参照另一个API;

(5)权限关系,该类别关注API使用权限的关系,权限描述安卓API在执行过程中需要的资源,用于API的功能和敏感程度;

(二)可泛化表示API关系的模板及迭代式模板生成

在安卓官方文档中,与API语义有关的信息主要包括结构化的语义信息和非结构化的语义信息;对于结构化的语义信息,按照从顶层到底层的层次依次进行解析,得到结构化的API语义关系;对于非结构化的语义信息,非结构化的语义信息是安卓官方文档中的描述信息,描述信息以自然语言的方式描述API的功能、用法和注意事项等信息;据此,总结出可泛化表示API关系的模板,并提出其迭代式生成方法;

其中,可泛化表示API的关系有4种,分别是条件关系、可选择关系、引用关系、权限使用关系;其迭代式生成的步骤如下:

首先,随机选择 1% 的类,包括这些类中的所有经过 NLP 预处理之后的描述信息,使用人工的方式提取模板;

然后,随机选择另外 1% 的类,进行 NLP 预处理之后,使用上一步中的模板进行匹配以抽取关系;对于每一句包含API、类、包或权限的句子,如果能匹配模板并提取关系,否则删掉,剩下没有提取关系的句子,人工检查这些句子并从中提取模板,添加到模板集合;

重复上述步骤,直到模板集合不再增加;

(三)基于自然语言处理和模板的关系图谱构建

使用自然语言处理技术对描述信息进行预处理,包括句子拆分、词干提取、指代消解、命名归一化,然后基于预先定义的模板进行匹配,提取API语义关系;具体步骤如下:

句子拆分,对于一大段的描述,使用句号作为描述的分割符,将描述拆分成一个一个的句子;

词干提取,对于API描述中的每个单词,去除单词的词缀,得到其词根;

指代消解,对于描述信息中的代词,确定代词指向的名词或名词短语;

命名归一化,在API文档中对API、类、包和权限存在多种命名形式,基于预定义的命名方式,将它们的多种不同名称替换为预定义名称,以便规范化实体的表示;

基于自然语言处理的预处理完成之后,通过前面总结的模板使用正则表达式去进行匹配,构建API语义关系图谱。

下载完整专利技术内容需要扣除积分,VIP会员可以免费下载。

该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于复旦大学,未经复旦大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服

本文链接:http://www.vipzhuanli.com/pat/books/202011274561.2/1.html,转载请声明来源钻瓜专利网。

×

专利文献下载

说明:

1、专利原文基于中国国家知识产权局专利说明书;

2、支持发明专利 、实用新型专利、外观设计专利(升级中);

3、专利数据每周两次同步更新,支持Adobe PDF格式;

4、内容包括专利技术的结构示意图流程工艺图技术构造图

5、已全新升级为极速版,下载速度显著提升!欢迎使用!

请您登陆后,进行下载,点击【登陆】 【注册】

关于我们 寻求报道 投稿须知 广告合作 版权声明 网站地图 友情链接 企业标识 联系我们

钻瓜专利网在线咨询

周一至周五 9:00-18:00

咨询在线客服咨询在线客服
tel code back_top