基于Transformer元学习网络的毫米波雷达手势识别方法

屈乐乐,洪雨云

(沈阳航空航天大学电子信息工程学院,辽宁沈阳 110136)

摘 要:传统深度学习依赖大量训练数据,而雷达数据的收集耗时费力,且难以涵盖所有手势类别,针对上述问题,本文提出一种基于Transformer元学习网络的毫米波雷达手势识别方法。首先对毫米波雷达采集的手势回波进行预处理得到多普勒时频图(DTFM),将DTFM输入到特征提取模块,该模块结合卷积神经网络局部特征提取和Transformer全局上下文建模能力,能够准确提取手势动作对应的DTFM特征。然后构建基于Transformer和序列池化的非线性分类器,执行特征级比较以衡量不同手势样本之间的相似度。最后将比较结果送入到分类模块中进行手势类别预测。实验结果表明,所提方法在小样本情况下可以有效地提高手势动作识别准确率。

关键词:手势识别;毫米波雷达;Transformer网络;元学习

0 引 言

随着科技的高速发展,人机交互领域吸引了许多关注。手势识别作为其中的核心技术之一,近年来发展迅速,被广泛应用于游戏娱乐[1]、智能家居[2]和智能驾驶[3]等领域。手势识别根据数据获取方式可分为3类:基于计算机视觉的手势识别[4]、基于可穿戴设备的手势识别[5]和基于无线技术的手势识别[6-10]。与前两种识别方法相比,基于无线技术的识别方法具有不受光照影响、用户隐私性强、无需穿戴等优点,适用于更丰富的手势识别场景。随着雷达技术的不断进步,现有的无线信号手势识别大多使用雷达获取手势回波信号,进而获取距离、速度和角度等信息,再结合机器学习或深度学习等方法实现不同手势动作的识别。

文献[6]基于微多普勒特征对不同手势的识别进行研究,利用脉冲压缩和动目标显示(Moving Target Indication, MTI),将不同手势动作产生的多普勒频移生成手势特征图像,并送入支持向量机进行分类识别。基于支持向量机依赖人工提取特征,过程较为繁琐,且由于人工提取特征的局限性,识别准确率相对较低,一定程度上限制该方法在手势识别上的应用。文献[7]设计了一个单通道的卷积神经网络(Convolutional Neural Network,CNN)学习和分类距离-多普勒的手势特征信息,在识别准确性上具有明显优势。文献[8]利用77 GHz毫米波雷达获取手势回波信号,采用MTI滤除静态物体的反射,开发一种相对于原点稳定运动的虚拟坐标系,并通过设计的坐标转换方法将原始多普勒频谱图转换为虚拟频谱图,随后输送到深度学习网络中进行识别,所提方法对10种手势的平均识别准确率达到了88.4%。基于深度学习的手势识别大都以CNN为基础搭建网络框架,存在着手势特征提取不充分、泛化性不强的问题。

针对上述问题,郭剑等人[9]搭建基于卷积自注意力机制的网络模型,首先通过卷积层对输入特征图进行提取,再利用Vision Transformer进行手势识别。Jin等人[10]构建用于动态手势识别的CNNTransformer网络模型,利用CNN提取动态手势的精细局部特征,后堆叠多个Transformer编码器来提取全局特征。上述两种方法需要大量的数据进行有效训练以保证分类的准确性。近年来,元学习常被用于解决小样本学习问题,可用很少的样本实现分类任务。针对小样本数据识别,Sung等人[11]提出了基于关系网络的元学习方法。基于关系网络的元学习方法通过神经网络计算支持和查询样本的相似性,从而输出预测类别。然而在相似度计算过程中,模型未利用所有支持样本的信息,只是进行简单的一对一比较任务。Zeng等人[12]在基于关系网络的元学习方法基础上提出一种基于加权的元学习网络实现小样本数据下的手势识别,将多普勒时频图(Doppler Time-Frequency Maps, DTFM)输入到基于加权的元学习网络中进行手势分类识别。但网络模型仅基于CNN框架,未能有效捕捉全局上下文特征,这在一定程度上限制了模型的识别性能。

为了提高小样本场景下手势识别的准确率,本文提出基于Transformer元学习网络的毫米波雷达手势识别方法。首先采用77 GHz的毫米波雷达获取不同手势动作的回波信号,对采样后的回波信号进行预处理生成DTFM。然后将DTFM输入到基于Transformer的元学习网络中实现小样本数据下的手势识别。网络模型利用CNN和堆叠的Transformer编码器,提取支持集和查询集中手势样本的局部特征和全局特征。随后将支持集和查询集对应的特征进行拼接,形成“支持-查询”特征对。将拼接后的特征对送入基于Transformer和序列池化[13]的非线性分类器进行相似度衡量,最终通过分类模块实现手势动作的识别。

1 信号模型

由于调频连续波(Frequency Modulated Continuous Wave,FMCW)具有测距精度高、功耗低以及抗干扰能力强等优点,本文使用的毫米波雷达采用FMCW技术。FMCW常见的调制方式包括锯齿波和三角波,本文采用锯齿波作为FMCW雷达的调制方式。

1.1 FMCW雷达原理

FMCW雷达发射一系列Chirp信号,通过将来自手势目标的回波信号与发射信号正交混频,生成包含目标信息的中频信号。FMCW雷达的发射信号St(t)可表示为

假设手势目标在距离R(t)处,则雷达接收信号Sr(t)可表示为

式中,t∈[0,Tc],τ=2R(t)/c表示雷达信号从发射到接收的时间延迟,c为光速,At为发射信号振幅,Ar为接收信号振幅,f0为起始频率,B为雷达的带宽,Tc为调频周期。

将发射信号与接收信号的复共轭进行相乘得到中频信号:

式中,2/2Tc值很小,可以忽略不记。模数转换器对每个Chirp对应的中频信号进行离散化采样,将不同Chirp对应采样的中频信号按列堆叠成二维矩阵。第m个Chirp的第n个采样点对应的中频信号为

式中,n=1,2,…,Nm=1,2,…, Mfb=/Tc为中频信号的频率,TsTf分别为慢时间和快时间采样间隔,λ0=c/f0f0对应的工作波长。

1.2 回波信号预处理

因DTFM具有可以捕捉目标的微小运动特征、对环境鲁棒性强等特点,采用其作为网络的输入,回波信号预处理的流程如图1所示。首先,将模数转换器采样后的数据重新排列成二维矩阵SIF(n, m)。然后,对SIF(n, m)的每一列即快时间维进行快速傅里叶变换(Fast Fourier Transform,FFT)得到距离-时间矩阵:

图1 回波信号处理流程

式中,b=1,…,N,表示手势目标与雷达距离信息。为消除背景杂波的影响,使用巴特沃斯高通滤波器对SRT(b,m)进行MTI,得到滤波后的矩阵SMTI(b,m)。选取合适的距离区间,将区间内的距离单元进行相干叠加得到

式中,b1b2为距离门的上下限,实验中手势目标在距雷达7~30 cm的范围内运动,雷达的距离分辨率为ΔR=c/2B=3.75 cm,因此b1b2的取值为2和8。最后,对R(m)进行短时傅里叶变换(Short Time Fourier Transform,STFT)得到多普勒时频信息:

式中,ζ(·)是窗函数,x为多普勒频率的索引值,y为时延索引值,根据U(x,y)可以得到DTFM。

2 小样本元学习

元学习基于任务实现,通常分为元训练和元测试阶段。每个阶段的任务由支持集和查询集构成,在每个任务中,随机选择C类样本,K为每类选取标记样本个数,V为每类剩余的待预测样本个数。C×K个样本组成支持集,C×V个样本组成查询集。当支持集中包含C类样本,每类样本有K(K≥1)个标记样本时,即可将该任务称为C-way K-shot问题[14]

在元训练阶段,通过元训练集Dtrain创建大量模拟实际小样本问题的任务,并将其输入搭建的网络中以提取可转移的知识,赋予网络应对不同目标任务的泛化能力。元测试阶段代表实际想解决的问题,通过元测试集Dtest创建少量任务进行测试,衡量元学习网络完成任务的效果。需要注意的是,DtrainDtest是相互独立,互不重叠的数据集。

3 模型框架

本文提出的网络由特征提取模块fθ、比较模块rθ和分类模块gθ三个模块组成,θ为可训练参数。考虑到Transformer[15]捕获全局信息的优势,在特征提取模块fθ和比较模块rθ中引入了Transformer编码器,网络架构如图2所示。DTFM作为网络的输入,首先由特征提取模块fθ提取支持集和查询集的手势特征信息。然后将支持样本的每个特征依次与查询样本的特征进行连接,输入到基于神经网络的比较模块rθ进行相似性衡量,最终由分类模块gθ计算分类结果。

图2 网络模型总体框图

3.1 特征提取模块

CNN处理二维图像时表现出色,尤其擅长局部特征的提取,而Transformer则擅长捕获全局特征。结合两者的优势,通过使用多层CNN和Transformer编码器构建出提取手势信息的特征提取模块fθ

3.1.1 CNN

CNN由4个卷积层组成,每个卷积层后面都有一个批量归一化层(Batch Normalization,BN)和修正线性单元(Rectified Linear Unit,ReLU)激活函数。BN帮助模型学习关于相似任务的共同先验知识、增加模型的稳定性;ReLU激活函数可以减少数据相互依赖,增强模型泛化。CNN通过核为2×2的池化层进行降维,从而减少网络参数。为了更好地获取动态手势的精细局部特征,将卷积核大小设置为3×3,输入特征图尺寸为128×128×3,4层CNN网络结构如表1所示。

表1 CNN模型结构

层数1 2 3 4层结构卷积层1、最大池化层1卷积层2、最大池化层2卷积层3、平均池化层3卷积层4卷积核尺寸3×3卷积核数量64输出尺寸63×63×64 3×3 128 30×30×128 3×3 3×3 128 128 14×14×128 12×12×128

输入特征经过CNN处理后,输出尺寸变为12×12×128。对输出特征前两个维度进行展平操作,使输出尺寸变为144×128。

3.1.2 位置编码

从均值为0、方差为1的正态分布中抽取一组大小为144×128的随机数作为位置码,与CNN输出的结果相加:

式中,xl(l=1,2,…,144)是CNN输出特征矩阵的第l个行向量,pl(l=1,2,…,144)是第l个位置的绝对位置码,X为位置编码后的输出即二维矩阵。随后,将X输入到Transformer编码器中进行深层特征提取。

3.1.3 Transformer编码器

图2给出了Transformer编码器的详细结构,Transformer编码器主要由层归一化(Layer Normalization,LN)、多层感知器(Multi-Layer Perceptron,MLP)和多头注意力(Multi-Head Attention,MHA)组成。本文中Transformer编码器由D=2个相同的编码器堆叠而成,MHA头数为H=4。

1) LN

LN主要计算二维输入的均值和方差,遵循的原则如下所示:

式中,X为输入样本,E(X)为样本的期望,σ(X)为样本的标准差,αβ分别为增益和偏置参数,ε为小浮点数,可避免σ(X)为0时溢出现象的发生。

2) MHA

MHA是Transformer编码器的核心,为每个特征序列分配不同的权重,更好地捕捉序列间的联系和差异,具体结构如图3所示。

图3 MHA结构图

WQWKWV为定义的可训练投影矩阵,通过这三个矩阵对输入样本X进行线性变换:

式中,h=1,2,…,Hh为MHA的头索引,Qh为查询矩阵,Kh为键矩阵,Vh为值矩阵。

针对MHA的第h个头,计算QhKh缩放的点积,并通过SoftMax激活函数归一化计算注意力权重,后与Vh相乘得到加权后第h个头的注意力得分Headh

式中,dk为注意力缩放因子,可以防止点积值过大时梯度消失的发生,WO为随机初始化得到的权重矩阵。将H个头的注意力得分拼接,并进行线性变换,得到MHA的最终得分:

式中,contact为通道维度拼接。

3) MLP

MLP是Transformer编码器的另一关键部分,由两个全连接层和一个高斯误差线性单元(Gaussian Error Linear Unit,GeLU)激活函数构成。通过对MHA获得的向量进行非线性变换,整合多个注意力的输出信息,有效增强模型的数据拟合能力。GeLU激活函数结合了ReLU和Sigmoid激活函数的优点,是一种既有非线性特性又易于优化的激活函数,具有良好的泛化性。

3.2 支持-查询样本的连接

为了衡量支持集和查询集样本之间的相似度,首先对特征提取模块fθ的输出进行拼接。对于C-way 1-shot任务可以表示为

式中,θ为可训练参数,si表示支持集中第i(i=1,2,…,C)个样本,qj表示查询集的第j(j=1,2,…,C×V)个样本,Li, j为第i个支持样本和第j个查询样本拼接后的特征对向量。

而对于C-way K-shot(K>1)的任务,需对来自支持集中同一类的K个向量进行平均。这是一种常规处理K-shot任务的方法,以较小的偏差提供查询样本与某类支持样本之间的比较结果,有效增强网络的鲁棒性。C-way K-shot(K>1)任务中,拼接后的特征对向量可以表示为

式中,si,k表示支持集中第i类中第k个样本。

3.3 比较模块

经上述连接操作,特征维度由144×128变为144×256。相对于常规利用欧氏距离[16]衡量样本的相似度的方法,本文采用神经网络的方法。神经网络作为非线性分类器的一种,可以更好地捕获手势深层特征,更适合于手势分类任务。

Transformer擅长深层次全局特征的提取,序列池化对Transformer的潜在空间顺序进行嵌入加权,使向量维度由p×d变为1×d,计算量略有减少。比较模块rθ利用Transformer编码器和序列池化,从Li, j中获得特征级比较结果。Li, j经过Transformer编码器可以表示为

式中,e表示Transformer编码器函数,ri, jLi, j经过Transformer编码器的输出,p为序列长度,d为嵌入维数。将ri, j送入到序列池化层,步骤如下所示。

首先将ri, j被输入到全连接层降维,并对输出进行SoftMax激活:

式中,FC为全连接层,wi, j为重要性权重。

然后将wi, jri, j相乘,得到序列池化的输出:

式中,zi, j为特征级比较向量。

3.4 分类模块

为了利用不同“支持-查询”特征对之间的关系,将不同zi, j连接成一维向量输入分类模块gθ。分类模块gθ利用全连接层将网络提取的特征空间映射到标签空间,并通过SoftMax激活函数计算关系得分,预测手势类别。C-way K-shot任务下分类过程可以表示为

式中,为最终预测的概率。

4 实验结果与分析

4.1 雷达硬件系统

本文搭建的动态手势识别系统是由德州仪器公司研发的AWR1642BOOST毫米波雷达传感器评估板组成,包括AWR1642 EVM射频板和DCA1000 EVM数据采集板,如图4所示。其中,AWR1642 EVM射频板主要负责Chirp信号的生成、发射,以及经过目标物体反射后的雷达回波信号的接收、解调。DCA1000 EVM数据采集板主要负责回波信号经解调后得到的差拍信号的存储与转发。

图4 雷达传感器实物图

本文的手势识别任务中,详细的雷达参数配置如表2所示。雷达具有2个发射天线和4个接收天线,共8个通道的数据,本文仅使用第一个通道的数据。

表2 FMCW雷达系统参数

参数起始频率扫频带宽ADC采样数ADC采样频率帧周期帧数每帧的Chirp数参数值77 GHz 3 999.07 MHz 128 2 000 kS/s 80 ms 32 128

4.2 数据集构建

实验设计了8种常见的动态手势动作:前推、后扇、抬手、左右晃手、前扇、后拉、拳头双击和画圆圈,分别编号为(a)~(h),如图5所示。考虑到个体性差异,邀请3男2女作为测试人员参与手势数据的采集。数据采集时,测试人员位于雷达正前方30 cm处,测量时长为2.56 s,每类手势动作测试人员重复30次。

图5 8种动态手势动作示意图

对雷达采集的手势回波信号采用第1节中的预处理方法,生成不同手势动作的时变运动特征,每类动作对应的DTFM如图6所示。其中横轴表示手势动作持续的时间,纵轴表示手势动作的多普勒频率。图6中动作(a)前推和(e)前扇的手势目标靠近雷达运动,产生正向多普勒频移;(b)后扇和(f)后拉远离雷达,产生负向多普勒频移;(c)抬手和(g)拳头双击动作幅度小,对应的多普勒频移变化范围较小;(d)左右晃手和(h)画圆圈有朝向雷达和远离雷达的过程,对应的图像包含正向和负向的多普勒频移。

图6 8种手势动作的DTFM图像

4.3 实验结果

4.3.1 实验设置

本文对4-way 1-shot和4-way 5-shot的手势分类任务进行实验来评估模型的性能。对于4-way 1-shot和4-way 5-shot任务,首先从整个数据集D中划分4类手势作为Dtrain,为了保证模型一致性,Dtest的构造方式和Dtrain类似,将D中其他4类作为Dtest。每类随机抽取1和5个样本构造支持集,支持集中分别有4和20个支持样本,再将每类剩余的样本作为查询样本分配给查询集。支持集和查询集构成任务并输入到元学习网络,查询集中样本的标签作为真实标签进行训练。上述过程重复多轮,生成的不同任务进行多轮训练,每一轮称为一个episode[17]。此外,Dtrain中每类手势有150个样本,在Dtest中每类手势有20个样本。

为了充分提取手势信息,将输入尺寸统一为128×128×3,并进行归一化操作将像素值范围限制在[0,1]。网络模型采用AdamW优化器,以更好地处理权重衰减,学习率设为固定值0.000 1,并通过交叉熵函数定义损失函数。元训练持续10 000个episodes,元测试持续1 000个episodes。本文搭建的网络基于Pytorch框架,所有实验均在配备Intel(R)Xeon RGold 6132的中央处理器和NVIDA RTX3090的图形处理器的工作站上进行。

4.3.2 性能分析

为了验证各个模块的有效性,将8种DTFM输入网络进行消融实验,表3记录了元测试阶段不同分类任务下的识别准确率。其中Base表示骨架网络,包括特征提取模块中的CNN、比较模块中的Transformer编码器以及分类模块。SeqPool代表序列池化操作,Transformer指在特征提取模块添加Transformer编码器的操作。

表3 消融实验的识别准确率

网络模型Base Base+SeqPool Base+Transformer Base+Transformer+SeqPool 4-way 1-shot 82.51%94.14%90.55%95.51%4-way 5-shot 87.70%95.75%95.12%97.13%

在4-way 1-shot和4-way 5-shot分类任务下,相较于Base,Base+SeqPool的识别准确率分别提高11.63%和8.05%,证明序列池化的有效性。序列池化是一种基于注意力的方法,可以对Transformer处理后序列的潜在空间顺序进行嵌入,并为序列中分配重要性权重。相较于Base,Base+Transformer在两种任务下的识别准确率分别提高8.04%和7.42%。这是因为Transformer模块能够捕捉经由CNN缩减后特征的全局依赖关系,并整合局部和全局信息,使得模型在任务中表现出更强的泛化能力和准确性。Base+SeqPool的识别准确率高于Base+Transformer,相较于Base+SeqPool,Base+Transformer+SeqPool在两种任务下的识别准确率分别提高了1.37%和1.38%。

4.3.3 不同网络模型识别性能对比

为了验证所提方法在动态手势识别的优越性,将不同的手势动作的DTFM作为网络输入,在数据集相同的情况下,将本文所提基于Transformer元学习网络与CNN-Transformer[10]、Vision Transformer[15]、关系网络[11]和加权网络[12]的识别准确率进行对比,结果如表4所示。实验过程中,文献[10]中的CNN-Transformer采用了相同结构的双分支网络模型,本文仅取其中一个分支进行实验对比。本文所提网络、关系网络和加权网络都属于元学习方法,训练时使用Dtrain中所有样本训练模型,测试时则使用Dtest中所有样本进行评估。最终,通过对测试过程中所有episodes的准确率取平均值来计算测试准确率。对于CNN-Transformer和Vision Transformer网络模型,进行五折交叉验证实验得到测试准确率。

表4 不同网络的识别准确率

识别准确率36.03%57.35%92.53%93.90%95.53%94.67%96.15%97.18%网络模型CNN-Transformer[10]Vision Transformer[15]关系网络[11],4-way 1-shot加权网络[12]4-way 1-shot本文网络,4-way 1-shot关系网络[11],4-way 5-shot加权网络[12],4-way 5-shot本文网络,4-way 5-shot

从表4可以看出,基于CNN-Transformer方法的表现最差。尽管该方法在Vision Transformer基础上进行了修改,但其本质上仍属于大模型架构,难以适应小样本数据集。相比之下,基于Vision Transformer方法的识别准确率有所提升,这得益于预训练权重的导入,提高了模型的泛化能力,但也未达到理想的效果。总体来看,上述两种模型在小样本数据集性能表现不佳。相对而言,关系网络和加权网络在小样本场景下表现比较优异。与基于CNN-Transformer和基于Vision Transformer方法相比,基于关系网络和基于加权网络的元学习方法的识别准确率显著提高,在4-way 1-shot任务中识别准确率分别达到92.53%和93.90%。所提基于Transformer元学习网络的表现更为出色,相较于加权网络,所提网络模型在4-way 1-shot和4-way 5-shot实验中的识别准确率分别提升1.63%和1.03%,识别准确率最高。

此外,为了进一步证明所提网络在小样本手势识别的优越性,将所提网络与关系网络和加权网络的性能进行比较。将处理后的8类DTFM作为3种的网络输入,图7分别绘制了元测试阶段3种网络模型在4-way 1-shot和4-way 5-shot分类任务下,episodes数量与测试准确率的关系曲线。

图7 不同元学习网络的episodes数量与测试准确率关系曲线对比

从图7可以看出,对于相同方法的两种分类任务,4-way 5-shot任务的识别准确率高于4-way 1-shot任务。这是因为随着每个类别支持样本的增加,模型鲁棒性得到加强,从而提升模型的识别准确率。对于不同方法的两种分类任务,本文所提模型的识别准确率均高于关系网络和加权网络的识别准确率。这是由于Transformer的引入增加了模型的表达能力,更好地提取到手势间的深层次的全局特征。此外,序列池化将Transformer生成的序列嵌入聚合成固定长度的全局表示,并根据注意力权重对序列中的各个元素赋予不同的重要性,捕捉序列间相关联的信息,有效提升模型处理复杂序列的能力。

4.3.4 模型复杂度和测试时间

为了进一步比较不同网络的模型复杂度和测试时间,在相同参数设置下计算了本文所提模型与CNN-Transformer、Vision Transformer、关系网络和加权网络的参数量、浮点运算次数(Floating Point Operations,FLOPs)及测试时间,并将结果记录于表5。

表5 不同网络的模型复杂度和测试时间

网络模型CNN-Transformer[10]Vision Transformer[15]关系网络[11],4-way 1-shot加权网络[12],4-way 1-shot本文网络,4-way 1-shot关系网络[11],4-way 5-shot加权网络[12],4-way 5-shot本文网络,4-way 5-shot参数量(×106)6.73 85.81 0.23 0.23 2.45 0.23 0.23 2.45 FLOPs(×109)0.94 1.61 3.45 4.08 2.24 13.81 16.93 10.71测试时间/ms 33.6 49.7 65.5 75.7 81.2 82.8 91.1 102.7

从表5中可以观察到,CNN-Transformer模型的参数量、FLOPs和测试时间均低于Vision Transformer模型,这是因为CNN-Transformer中Transformer编码器数量和注意力头数的减少,降低了模型的复杂度和测试时间。对于4-way 1-shot任务,由于小样本学习模型需要多次执行提取查询集样本特征的卷积操作。相较于CNN-Transformer和Vision Transformer模型,关系网络、加权网络和所提网络这三种元学习网络的模型复杂度和测试时间有所增加。与关系网络和加权网络相比,所提网络模型的参数量和测试时间略高,但具有更少的FLOPs和更高的识别准确率。这是因为Transformer中的MHA和MLP引入了大量参数,导致整体参数量增加。同时,由于所提网络模型涉及到更多的非线性操作如ReLU等,虽然这些操作不直接增加FLOPs,但提高了计算复杂度,从而导致测试时间略有增加。然而,得益于Transformer的自注意力机制对数据序列的并行处理能力,所提模型的FLOPs显著降低。4-way1-shot任务下,所提模型的FLOPs约为加权网络的一半。

4-way 5-shot任务中,所提网络模型的FLOPs显著增加,识别准确率也获得了提升。相比于4-way 1-shot任务,4-way 5-shot任务下的FLOPs和测试平均耗时分别增至原来的5倍和1.25倍,识别准确率提高了1.65%。这是因为4-way 5-shot任务的比较模块需要进行额外的操作,从而导致所提模型FLOPs和测试时间的增加。总体而言,本文所提网络模型在手势分类任务中表现优异,降低FLOPs的同时实现了更高识别准确率,显示出良好的性能。

5 结束语

本文提出一种基于Transformer元学习网络的毫米波雷达手势识别方法,在小样本数据的情况下提升了手势动作识别性能。所提方法首先对每类手势样本的回波数据进行预处理生成DTFM。然后,将生成的DTFM输入到构建的网络模型中提取手势特征、衡量不同手势样本的相似度,最后输出手势分类结果。为提高模型的特征提取能力,在特征提取模块和比较模块中分别引入堆叠的Transformer编码块,并在比较模块中加入序列池化机制。实验结果表明,本文所提方法提升了小样本场景下的手势动作识别准确率,在实际的小样本应用场景下具有一定的参考意义。

参考文献:

[1] JIN Can, MENG Xiangzhu, LI Xuanheng, et al.Rodar: Robust Gesture Recognition Based on mmWave Radar Under Human Activity Interference[J].IEEE Trans on Mobile Computing, 2024, 23(12):11735-11749.

[2] CHEN Jingxuan, GUO Shisheng, LV Shuo, et al.A Lightweight Hand-Gesture Recognition Network with Feature Fusion Prefiltering and FMCW Radar Spatial Angle Estimation[J].IEEE Sensors Journal, 2024, 24(17):27926-27936.

[3] 董连飞,马志雄,朱西产.基于车载毫米波雷达动态手势识别网络[J].北京理工大学学报,2023,43(5):493-498.

[4] ZERROUKI N,HARROU F,HOUACINE A, et al.Deep Learning for Hand Gesture Recognition in Virtual Museum Using Wearable Vision Sensors[J].IEEE Sensors Journal, 2024, 24(6):8857-8869.

[5] DAHIYA A, WADHWA D, KATTI R, et al.Efficient Hand Gesture Recognition Using Artificial Intelligence and IMU-Based Wearable Device[J].IEEE Sensors Letters, 2024, 8(12):1-4.

[6] 刘熠辰,徐丰.基于雷达技术的手势识别[J].中国电子科学研究院学报,2016,11(6):609-613.

[7] 韩崇,韩磊,孙力娟,等.基于时空压缩特征表示学习的毫米波雷达手势识别算法[J].电子与信息学报,2022,44(4):1274-1283.

[8] WU Jingmiao, WANG Jie, GAO Qinghua, et al.Toward Robust Device-Free Gesture Recognition Based on Intrinsic Spectrogram of mmWave Signals[J].IEEE Internet of Things Journal, 2022, 9(19):19318-19329.

[9] 郭剑,张姝,王书轩,等.基于Vision Transformer的毫米波雷达手势识别算法[J].现代雷达,2023,45(12):79-86.

[10] JIN Biao, MA Xiao, ZHANG Zhenkai, et al.Interference-Robust Millimeter-Wave Radar-Based Dynamic Hand Gesture Recognition Using 2-D CNN-Transformer Networks[J].IEEE Internet of Things Journal, 2023, 11(2):2741-2752.

[11] SUNG F, YANG Yongxin, ZHANG Li, et al.Learning to Compare: Relation Network for Few-Shot Learning[C]//IEEE/CVF Conference on Computer Vision and Pattern Recognition, Salt Lake City, UT, USA:IEEE, 2018:1199-1208.

[12] ZENG Xianglong, WU Chaoyang, YE Wenbin.User-Definable Dynamic Hand Gesture Recognition Based on Doppler Radar and Few-Shot Learning[J].IEEE Sensors Journal, 2021, 21(20):23224-23233.

[13] HASSANI A, WALTON S, SHAH N, et al.Escaping the Big Data Paradigm with Compact Transformers[J/OL].Arxiv, 2021.https://doi.org/10.48550/arXiv.2104.05704.

[14] SNELL J, SWERSKY K, ZEMEL R.Prototypical Networks for Few-Shot Learning[C]// the 31st International Conference on Neural Information Processing Systems,Long Beach California USA:Curran Associates Inc, 2017:4080-4090.

[15] DOSOVITSKIY A, BEYER L, KOLESNIKOV A, et al.An Image is Worth 16×16 Words: Transformers for Image Recognition at Scale[J/OL].Arxiv, 2020.https://doi.org/10.48550/arXiv.2010.11929.

[16] DOKMANIC I, PARHIZKAR R, RANIERI R, et al.Euclidean Distance Matrices: Essential Theory, Algorithms,and Applications[J].IEEE Signal Processing Magazine,2015, 32(6):12-30.

[17] 刘旗,刘永祥,张新禹.基于特征注意力融合元残差网络的小样本SAR目标识别[J].电子学报,2023,51(9):2367-2378.

Millimeter-Wave Radar Gesture Recognition Method Based on Transformer Meta-Learning Network

QU Lele, HONG Yuyun
College of Electronic and Information Engineering, Shenyang Aerospace University, Shenyang 110136, China

Abstract: Traditional deep learning require a large amount of training data, but the collection of radar data is timeconsuming and laborious, and it is difficult to cover all gesture categories.To address this challenge, this paper proposes a millimeter-wave radar gesture recognition method based on a Transformer meta-learning network.Firstly, the gesture echoes collected by millimeter-wave radar are preprocessed to generate Doppler time-frequency maps (DTFM), and the DTFM are fed into a feature extraction module, which combines the local feature extraction capability of the convolutional neural network (CNN) with the global context modeling strength of Transformer, enabling it to accurately extract the DTFM features of different gesture actions.Then, a nonlinear classifier based on Transformer and sequence pooling is designed to perform feature-level comparisons, measuring the similarity between different gesture samples.Finally, the comparison results are sent into the classification module to predict and output the final gesture categories.The experimental results indicate that the proposed method can effectively enhance the gesture recognition accuracy under the condition of limited samples.

Key words: gesture recognition; millimeter-wave radar; Transformer network; meta-learning

中图分类号:TN951;TN958

文献标志码:A

文章编号:1672-2337(2025)04-0407-10

引用格式:屈乐乐,洪雨云.基于Transformer元学习网络的毫米波雷达手势识别方法[J].雷达科学与技术,2025,23(4):407-416.

QU Lele, HONG Yuyun.Millimeter-Wave Radar Gesture Recognition Method Based on Transformer Meta-Learning Network[J].Radar Science and Technology, 2025, 23(4):407-416.

DOI: 10.3969/j.issn.1672-2337.2025.04.006

收稿日期:2024-11-18;修回日期:2025-01-15

基金项目:国家自然科学基金(No.61671310);航空科学基金(No.2019ZC054004);辽宁省高校基本科研业务费资助项目(No.LJ222410143071)

作者简介:

屈乐乐 男,博士,教授,主要研究方向为超宽带雷达信号处理技术、稀疏微波成像技术、人体行为雷达识别技术。

洪雨云 女,硕士研究生,主要研究方向为雷达信号处理技术、小样本学习。