[发明专利]一种面向文本和图像的跨媒体检索方法及电子装置有效
申请号: | 202010663328.7 | 申请日: | 2020-07-10 |
公开(公告)号: | CN112000818B | 公开(公告)日: | 2023-05-12 |
发明(设计)人: | 于静;郭晶晶;胡玥;谭建龙;郭莉 | 申请(专利权)人: | 中国科学院信息工程研究所 |
主分类号: | G06F16/432 | 分类号: | G06F16/432;G06N3/0464;G06N3/047;G06N3/048;G06N3/08 |
代理公司: | 北京君尚知识产权代理有限公司 11200 | 代理人: | 陈艳 |
地址: | 100093 *** | 国省代码: | 北京;11 |
权利要求书: | 查看更多 | 说明书: | 查看更多 |
摘要: | |||
搜索关键词: | 一种 面向 文本 图像 媒体 检索 方法 电子 装置 | ||
1.一种面向文本和图像的跨媒体检索方法,其步骤包括:
1)提取一设定长度语音信息的g维MFCC特征,并将长度为m的g维MFCC特征转换为包含各维度之间相关关系及语音特征帧与帧之间局部语义关系的一维语音特征,g=3h,h≥1,m≥1;
2)对一设定文本进行编码,获取词级别文本表示,并将词级别文本表示中每一个词与一维语音特征进行拼接,得到语音引导文本特征;其中,所述将词级别文本表示中每一个词与一维语音特征进行拼接,得到语音引导文本特征,包括:
融合若干样本语音信息的一维语音特征与若干样本文本的词级别文本表示,获取第i个词的门控值gatei=σ(Wg[f’p,f’si]+bg),其中σ为Sigmoid激活函数,f’si为一样本文本的词级别文本中的第i个词文本表示,f’p为一样本语音信息的一维语音特征,Wg是f’p和f’si拼接后的结果线性映射的权重矩阵,bg是f’p和f’si拼接后的结果线性映射的偏置;
通过第i个词的门控制,计算第i个词的语音引导文本特征为词级别文本中第i个词文本表示,fp为设定长度语音信息的一维语音特征,Ws是fp和的拼接结果在门控值选择后的结果线性映射的权重矩阵,bs是fp和的拼接结果在门控值选择后的结果线性映射的偏置;
3)对查找到的每一图片,提取图片的区域特征,计算区域特征与语音引导文本特征的相似性分数,判断该图片是否包含设定长度语音信息及设定文本信息,得到检索结果。
2.如权利要求1所述的方法,其特征在于,g维MFCC特征包括h维MFCC系数、h维一阶差分参数和h维二阶差分参数。
3.如权利要求1所述的方法,其特征在于,通过以下步骤得到包含各维度之间相关关系及语音特征帧与帧之间局部语义关系的语音特征:
1)将g维MFCC特征输入一卷积神经网络,其中该卷积神经网络包括L个卷积层、V个池化层及一全连接层,L≥2,V≥1,L≥V;
2)通过一卷积层,获取包含各维度之间相关关系的卷积特征;
3)通过L-1个卷积层及V个池化层,获取包含语音特征帧与帧之间局部语义关系的卷积特征;
4)将最后一卷积层得到的卷积特征展开成一维向量,使用全连接层映射到指定维度,得到一维语音特征。
4.如权利要求1所述的方法,其特征在于,通过以下步骤获取词级别文本表示:
1)对设定文本的各词语使用one-hot表示,得到词级别文本;
2)通过双向门控循环单元对词级别文本进行编码,得到词级别文本表示。
5.如权利要求1所述的方法,其特征在于,将所述图片输入在Visual Genomes数据集上预训练的Faster-RCNN模型,提取所述图片的区域特征。
6.如权利要求1所述的方法,其特征在于,通过以下步骤计算区域特征与语音引导文本特征的相似性分数:
1)计算语音引导文本特征中的词与区域特征的余弦相似性其中vj为待选图片的第j个区域特征;
2)使用softmax函数将余弦相似性αij转换为语音引导文本特征引导下各图像区域的组合权重其中N为待选图片的区域特征数量,λ1为超参数;
3)计算引导后的组合图像
4)计算与vsi的相似性
5)计算区域特征与语音引导文本特征的相似性分数
7.如权利要求1所述的方法,其特征在于,通过相似性分数及一设定阈值,判断该图片是否包含设定长度语音信息及设定文本信息。
该专利技术资料仅供研究查看技术是否侵权等信息,商用须获得专利权人授权。该专利全部权利属于中国科学院信息工程研究所,未经中国科学院信息工程研究所许可,擅自商用是侵权行为。如果您想购买此专利、获得商业授权和技术合作,请联系【客服】
本文链接:http://www.vipzhuanli.com/pat/books/202010663328.7/1.html,转载请声明来源钻瓜专利网。
- 彩色图像和单色图像的图像处理
- 图像编码/图像解码方法以及图像编码/图像解码装置
- 图像处理装置、图像形成装置、图像读取装置、图像处理方法
- 图像解密方法、图像加密方法、图像解密装置、图像加密装置、图像解密程序以及图像加密程序
- 图像解密方法、图像加密方法、图像解密装置、图像加密装置、图像解密程序以及图像加密程序
- 图像编码方法、图像解码方法、图像编码装置、图像解码装置、图像编码程序以及图像解码程序
- 图像编码方法、图像解码方法、图像编码装置、图像解码装置、图像编码程序、以及图像解码程序
- 图像形成设备、图像形成系统和图像形成方法
- 图像编码装置、图像编码方法、图像编码程序、图像解码装置、图像解码方法及图像解码程序
- 图像编码装置、图像编码方法、图像编码程序、图像解码装置、图像解码方法及图像解码程序