[发明专利]一种基于区域表示和视觉表示的视觉问答方法及系统有效
申请号: | 202310768905.2 | 申请日: | 2023-06-28 |
公开(公告)号: | CN116542995B | 公开(公告)日: | 2023-09-22 |
发明(设计)人: | 徐昊;高玲;盛楠;石立达;张洪达 | 申请(专利权)人: | 吉林大学 |
主分类号: | G06T7/11 | 分类号: | G06T7/11;G06N3/0464;G06V10/22;G06V10/764;G06V10/80 |
代理公司: | 北京盛询知识产权代理有限公司 11901 | 代理人: | 相凡 |
地址: | 130012 吉林省长*** | 国省代码: | 吉林;22 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 基于 区域 表示 视觉 问答 方法 系统 | ||
1.一种基于区域表示和视觉表示的视觉问答方法,其特征在于,步骤包括:
基于Faster R-CNN模型学得的图像区域特征,为每张待问答图像构建图像区域特征图;
基于所述图像区域特征图,生成邻居增强的区域表示;生成所述邻居增强的区域表示的方法包括:在所述图像区域特征图中对每个区域节点的信息和节点的邻居信息进行整合,生成所述邻居增强的区域表示;采用带重启的随机游走机制来关注区域特征图中所有节点的邻居增强的区域表示:为图像
其中,表示步行者在任意时刻返回起始节点的概率;表示步行者在t=0时刻时,处于初始节点;和分别表示在
基于GRU模型学得的问题特征对所述邻居增强的区域表示进行指导,得到最终的视觉特征;
基于所述区域表示、所述视觉特征和所述问题特征,得到预测答案,完成视觉问答。
2.根据权利要求1所述的基于区域表示和视觉表示的视觉问答方法,其特征在于,将待问答图像的每个区域作为所述图像区域特征图中的节点,并将每个所述待问答图像的区域特征作为节点属性;所述图像区域特征图由加权边组成;其中,图像区域之间关联的计算过程包括:
其中,
3.根据权利要求1所述的基于区域表示和视觉表示的视觉问答方法,其特征在于,得到所述视觉特征的方法包括:利用问题引导的纵横双注意力机制,增强与问题相关的区域表征,并在区域和表征层面保留关键特征,得到所述视觉特征。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于吉林大学,未经吉林大学许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202310768905.2/1.html,转载请声明来源钻瓜专利网。