近年来,手势交互凭借高效、简单等优点,成为了人机交互领域的重要方式,展现出了广阔的应用前景。例如,在智能家居系统中,用户通过简单的手势控制家用设备,实现非接触交互[1]。在虚拟现实和增强现实应用中,手势识别技术能够让用户与虚拟对象进行自然互动[2]。在汽车驾驶辅助系统中,它用于控制导航和安全功能,从而提升驾驶安全性和便捷性[3]。
在手势识别领域,传感器的选择至关重要,常用的传感器包括摄像机[4]、穿戴式传感器[5]和雷达[6]。与前两者相比,基于雷达的手势识别技术具有显著优势:无需穿戴设备;不受光线影响;保护隐私;功耗低。因此,这项技术逐渐引起了广泛关注。
而在众多雷达技术中,毫米波雷达、超宽带雷达和调频连续波(Frequency Modulated Continuous Wave, FMCW)雷达因其在手势识别领域的卓越表现而备受青睐。特别是FMCW雷达,凭借其高精度、低功耗和强抗干扰能力等优势,逐渐成为手势识别系统的首选方案。因此,本文选择FMCW雷达作为搭建手势识别系统的基础设备。
传统的基于雷达的手势识别方法通常采用支持向量机[7]和隐马尔可夫模型[8]。尽管深度学习的发展为手势识别技术带来了新机遇,但其高精度分类能力依赖于大规模标记数据的迭代训练。由于雷达数据采集成本高,限制了样本规模,进而影响了深度学习在该领域的进一步发展。为解决此问题,研究者提出了多种方案,如扩展训练数据集,具体包括传统数据增强[9],生成对抗网络(Generative Adversarial Network, GAN)[10]和扩散(Diffusion)模型[11]等。GAN虽然能生成新数据,但训练过程不稳定,可能会导致样本质量低。Diffusion模型能够通过逐步引导噪声生成高质量样本,克服了GAN的缺陷,但其训练过程复杂且计算开销大。此外,迁移学习作为另一种可行方法,通过利用源域的先验知识和充足数据来缓解目标域中的样本限制问题[12]。尽管这些方法能在一定程度上减少模型对大量训练样本的依赖,但实现理想的识别性能仍需确保每个类别至少具备几十个训练样本。
少样本学习作为深度学习领域的热门研究焦点,主要侧重于研究如何使模型从少量训练样本中学习并泛化到新数据,从而降低数据收集和计算成本。Zeng等提出了加权网络来实现用户可定义的动态手势识别,该网络通过比较输入手势与用户定义的手势来确定类别[13]。Shen等提出了一种三维卷积神经网络,充分利用多个特征的相关性,并通过关系模块来衡量样本之间的相似性[14]。Gong等用处理过的微多普勒特征训练出残差块原型网络进行识别[15]。然而,这些手势识别方法存在以下问题:在元测试过程中,即使面对不同的任务,模型中特征提取器参数通常也保持不变,限制了模型的适应性和通用性;此外,现有的少样本手势识别算法主要依赖归纳学习,容易导致过拟合问题,尤其是在模型复杂度较高时,问题更为明显。
为了解决上述问题,本文提出了一种基于元学习的少样本手势识别模型,称为转导条件神经自适应网络(Transductive Conditional Neural Adaptive Network, TCNAN)。该网络采用一种条件神经自适应特征提取模块,并结合元学习的思想,学习如何根据不同的输入数据来动态调整模型的关键参数,从而增强模型适应性。为缓解少样本中的过拟合问题,本文还提出一种转导学习算法,利用流形结构有效地捕获实例之间的关系,并在整个任务数据中采用迭代标签传播,以增强模型的泛化能力。
基于FMCW雷达的手势识别技术首先要将采集到的原始雷达信号进行预处理以提取人体手势的多普勒特征图,这些特征图将作为后续模型的输入。预处理流程步骤如图1所示。
图1 FMCW雷达数据预处理流程
首先,将采集到的原始雷达信号重新排列成二维矩阵Nf×Ns,Ns表示采集一个手势的调频信号(Chirp)总数,Nf表示一个Chirp的采样点数。然后对这个数据矩阵的每一列做快速傅里叶变换(Fast Fourier Transform, FFT),以提取到目标的距离信息,公式可表示为
式中,S(n,m)表示重新排列好的二维矩阵S中的第n行第m列元素,其中n=[0,1,…,Nf-1],m=[0,1,…,Ns-1];T(k, m)表示计算得到的时间-距离矩阵T中第k行第m列元素,其中k=[0,1,…,Nf-1] ,表示距离范围仓(range bin)对应的频率索引。
接着采用截止频率设置为0.007 5 Hz的4阶高通巴特沃斯高通无限脉冲响应(Infinite Impulse Response, IIR)滤波器来对T的每一行进行滤波操作,以去除空间中静止物体在频域中接近0 Hz的分量。在此基础上可以得到只含运动目标的时间-距离矩阵R。然后选择被检测到的有用range bin x,来抽取时间-距离矩阵的部分行数据进行短时傅里叶变换(Short-Time Fourier Transform, STFT),公式为
式中,R(x,m)为R中第x个距离门的第m个时间采样值,w(m-t)为在时间偏移t处的窗函数,D为多普勒频率总点数,d=[0,1,…,D-1],x=[a,b]为选取的范围。
然后,将其进行非相干叠加来获取时间-多普勒(Time-Doppler, T-D)特征图,T-D映射表示为
针对少样本问题,传统训练分类器的方法并不适用,因为样本数量的稀缺会导致模型的泛化能力不足。在这种情况下,元学习提供了一种解决方案,其核心目的是使模型具备掌握调整参数的能力,以便能够利用先验知识快速适应新任务[16]。因此,元学习被认为是解决少样本问题的一个重要途径。
元学习过程通常分为两个阶段:元训练阶段和元测试阶段。在元训练阶段中,训练数据被拆分成不同的任务以训练出一个元学习器。进入元测试阶段后,利用训练好的元学习器来调整不同任务下基础学习器中的参数,以提高模型泛化性能。
元学习的数据集D一般划分为元训练集Dtr和元测试集Dte,需要注意的是元训练集和元测试集的数据类别是不重叠的。元学习的基本单位是任务:一般分为元训练任务和元测试任务。其中,元训练任务的数据从Dtr中抽取,元测试任务数据从Dte中采样。而每个任务都有自己的训练集和测试集,分别称为支持集S和查询集Q。一般定义为
,其中,xi和
是矢量化图像,而yi和
是图像对应的标签。如果任务中的支持集S都包含着n个类别的数据,而每个类有k个带标签的样本,则这样的任务被称为n-way k-shot任务。
我们提出了一个基于元学习的手势识别模型。该模型由3个步骤组成:分别是特征嵌入、标签传播和损失函数。图2中展示了所提出模型的整体架构。
图2 提出模型的整体架构图
预训练模型之所以能在未见过的数据上表现良好,是因为能通过大量的训练数据学习到更泛化的特征表示,从而避免了过拟合问题。基于这一优势,本文选择了在大型数据集ImageNet上预训练过的ResNet18作为基础的模型架构。本文认为,虽然可以通过微调的方法对预训练模型中所有参数进行无限制调整,但是训练速度会大大降低。因此,以参数高效的方式调整模型是至关重要的。本文选择在基础网络中添加特征线性调制(Feature-wise Linear Modulation, FiLM)层,通过学习如何调整FiLM层中的参数来适应不同任务,从而在灵活性和适应性实现有效平衡。整个自适应特征提取器模块的架构如图3所示。
图3 条件神经自适应特征提取器的结构框图
该模块包括两个阶段:支持集编码和生成FiLM层参数。任务编码器ℎϕ(·)通过深度神经网络参数化,产生排列不变任务表示ℎϕ(Sτ),其中Sτ是指基于任务τ中的支持集图像。然后模型将该任务表达式传递给自适应的网络
(j=1,2,3,4),来产生ResNet18中每层每个区块的FiLM层参数
而这些参数决定了对输入特征的缩放和偏移程度。一旦FiLM层的参数得以确定,整个特征提取器即可适应新的任务需求,这意味着针对不同的任务,FiLM层的参数会相应地进行调整。本文使用fτθ来表示适应任务τ的特征提取器。
为了在元学习中获得合适的邻域图,本文构建了一个基于支持集和查询集的并集S∪Q的图模块。该模块由一个卷积神经网络gϕ组成,其结构如图4所示。
图4 图模块结构框图
该模块采用上述中的特征映射fτθ(zi),其中zi∈S∪Q表示并集中第i个输入样本。基于该特征表示,模块进一步通过卷积神经网络gϕ生成示例长度尺度参数σi=gϕ(fτθ(zi))。请注意,尺度参数是在元训练过程中学习计算得出的,能很好地适应不同的任务,使其适合于少样本问题。然后,根据尺度参数,计算任意两个样本zi与zj之间的权重距离的公式如下:
式中,Wij表示样本之间的相似度,所有样本对之间的相似度构成相似度矩阵W∈ℝm×m,m表示整个任务中样本的数量,d(·)表示距离度量函数,具体采用欧氏距离作为度量方法。然后根据上式来构造样本之间的概率转移矩阵,即
式中,D为对角矩阵,其对角元素Dii=∑j=1Wij,其余元素为0;L是标准化后的拉普拉斯矩阵。这个步骤是为了保证后续迭代收敛的必要条件。
设ℱ表示m×n的非负元素矩阵的集合,其中,n表示任务所包含的类别数量。首先,我们定义一个标记矩阵Y∈ℱ,如果zi来自支持集且它的标签为yi=j,则令Yij=1,否则标记为Yij=0。即它的每一行数据代表了每个样本对应各个类别的概率分布情况。
然后根据图结构迭代确定并集S∪Q中实例的未知标签,公式如下:
式中,Ft∈ℱ表示不同迭代次数t对数据的预测标签,α∈(0,1)用来平衡模型在迭代过程中对于初始标签矩阵的依赖程度,α越大则表示模型更加依赖于样本的分布情况。
只要不断迭代上述公式就能预测出支持集数据的标签,但是考虑到迭代的效率慢,因此将公式进一步化简以提高模型的训练效率。根据式(6)可以得到
由于0<α<1
然后可以得出
由于在分类任务中,Ft表示样本所属类别的概率分布,因此
整个迭代过程将会等价地收敛于式(6)中的结果,因此可以通过式(11)来直接计算得到标签概率矩阵,使整个训练过程在实践中更加高效。
本文计算预测分数F*和真实标签之间的交叉熵损失,并通过端到端的方式更新网络中的部分参数,其中F*使用softmax函数转化为概率分数:
式中,
表示支持集和查询集中实例i的最终预测标签矩阵,
表示标签j的预测结果。则损失函数计算为
其中:yi表示xi的真值标号;Π(·)是一个指标函数,如果它为真,则数值等于1,否则为0。
本实验选取德州仪器公司(Texas Instruments,TI)的IWR1642BOOST的雷达芯片和DCA1000 EVM的数据采集模块来构建实验硬件平台,如图5所示,而其参数配置如表1所示。
表1 FMCW雷达参数设置
雷达参数发射天线接收天线起始频率调频斜率帧时间帧总数Chirp总数采样点数参数值2根4根77 GHz 64.985 MHz/µs 40 ms 50 255 256
图5 FMCW雷达硬件系统
由表1可知,FMCW雷达的起始频率为77 GHz,调频斜率是64.985 MHz/µs,每个Chirp采256个点。由于手势动作幅度微小,为了使后续采集到的特征更加明显,本文设置了每帧255个Chirp,每帧的持续时间为40 ms。考虑到动作的时间短,帧数选取50帧,每个动作时长2 s。
本文的实验环境如图6所示。
图6 实验环境图
测试者坐在雷达正前方的1.2 m处位置,雷达距离地面1 m。本实验共招募了13名志愿者,其中男生5名,女生8名。实验设计了35种不同的手势,每种手势有78个样本,总共有2 730个手势。
图7展示了其中6种手势的示意图,而图8则展现了与这6种手势分别对应的多普勒特征图。
图7 部分手势示意图
图8 对应手势的多普勒特征图
本实验首先将上述采集到的手势数据集拆分成元测试集和元训练集,其中元训练集涵盖25种手势,而元测试集中包含了另外10种手势。然后,针对此数据集,本实验设置了5 000个训练任务,并设定每完成100个训练任务后对模型进行元测试。而在元测试阶段,我们设置了200个测试任务来评估模型的性能。此外,元训练阶段和元测试阶段中的支持集和查询集图像的详细设置如表2所示。
表2 不同n-way k-shot情况下的元学习任务参数设置
任务设置5-way 1-shot 5-way 3-shot 8-way 1-shot 8-way 3-shot元训练阶段元测试阶段支持集图像5×1=5 5×3=15 8×1=8 8×3=24查询集图像5×8=40 5×8=40 8×8=64 8×8=64支持集图像5×1=5 5×3=15 8×1=8 8×3=24查询集图像5×8=40 5×8=40 8×8=64 8×8=64
在5-way 1-shot任务中,元训练任务的构建方式是在元训练数据集的25类手势中随机选取5类,然后从这5类的每一类中随机抽取一张图像组成支持集,因此支持集中的图像总数为5张。随后,在这5类手势各自剩余的图像中随机抽取8张,一起构成查询集,所以查询集中的图像总数为40张。为了保持模型在元测试阶段的一致性,测试任务的构造方式遵循相同的规则,但是要注意的是图像是从元测试集中的10类进行抽取的。同理,5-way 3-shot,8-way 1-shot,8-way 3-shot任务中的图像设置也是如此构造的,即根据任务类型确定抽取的手势类别数和每类的图像数,然后分别从元训练集和元测试集中随机抽取相应数量的图像来构成任务的支持集和查询集。
为了证明本文提出的模型在少样本手势识别任务中的优良性能,我们将所提出的TCNAN模型与基于归纳学习的模型包括:少样本嵌入自适应变压器(Few-shot Embedding Adaptation with Transformer, FEAT)[17]、双向长短期记忆(Bidirectional Long Short Term Memory, BILSTM)、关系网络(RelationNet)[18]、简单条件神经自适应过程(Simple Conditional Neural Adaptive Processes, Simple CNAPS)[19],以及基于转导式学习的模型:转导条件神经自适应过程(Transductive Conditional Neural Adaptive Processes, Transductive CNAPS)[20]进行对比,结果如表3所示。要注意的是,准确率为各任务的平均值,误差范围表示95%的置信区间。
表3 不同网络模型在不同任务下的识别精度
模型FEAT BILSTM RelationNet Simple CNAPS Transductive CNAPS TCNAN 5-way 1-shot 75.47±0.22 74.61±0.24 77.49±1.51 78.11±1.63 81.96±1.58 83.08±1.67 5-way 3-shot 83.82±0.18 84.09±0.17 86.12±1.23 88.00±1.24 88.98±1.05 90.94±1.08 8-way 1-shot 67.45±0.16 68.38±0.16 68.95±0.93 70.69±1.06 73.31±1.16 77.83±1.24 8-way 3-shot 78.19±0.13 76.97±0.13 81.95±0.78 82.72±0.84 85.73±0.81 87.67±0.78
根据表3的数据对比分析结果,可以发现所有模型在8-way任务中的识别精度均低于5-way分类任务,这是因为随着要区分的类别数量的增加,误判的概率也会提高。此外,由于可以使用更多的样本信息,所有方法在3-shot任务中的识别精度均高于1-shot任务。
通过分析表3的数据,我们还可以进一步观察到,在不同任务中,TCNAN的识别精度均优于其他基于归纳学习的竞争算法,精度提升了约2.9%~10.3%。这一结果验证了本文的模型通过学习构建标签扩展的图关系,能够有效地识别样本的流形结构。同时,与先进的转导学习模型Transductive CNAPS相比,TCNAN的精度提高了约2%。
综上所述,TCNAN能有效地解决基于FMCW雷达手势识别中的少样本问题。
本文进行了一系列实验,以验证所提出模型中各个关键组件的有效性。实验首先对比了特征提取器改进前后模型的识别精度,以评估所提特征提取器的性能,具体结果如表4所示。
表4 条件神经自适应特征提取模块消融实验评估
任务设置5-way 1-shot 5-way 3-shot 8-way 1-shot 8-way 3-shot TCNAN(不添加FiLM)66.79±1.77 76.99±1.77 58.45±1.23 68.22±0.99 TCNAN 83.08±1.67 90.94±1.08 77.83±1.24 87.67±0.78
由表4可知,在4种情况下,添加FiLM层的模型识别精度比不添加FiLM层的模型要高出14%~19%。这是因为本文提出的算法依赖于FiLM层,能将条件预测分布适应于新的数据集,从而有效地提高手势识别精度。
其次,本研究将所提出的模型与归纳式模型Simple CNAPS进行对比以评估转导推理算法的性能。需要注意的是,本文提出的模型和Simple CNAPS的特征提取器结构是一致的。然而,在分类方法上,Simple CNAPS模型采用的是马氏距离度量,而本文模型则采用了标签传播方法来推理待测图像的标签。对比结果如表5所示。
表5 TCNAN和Simple CNAPS对比结果
任务设置5-way 1-shot 5-way 3-shot 8-way 1-shot 8-way 3-shot Simple CNAPS 78.11±1.63 88.00±1.24 70.69±1.06 82.72±0.84 TCNAN 83.08±1.67 90.94±1.08 77.83±1.24 87.67±0.78
从表5可以观察到,在3-shot任务中,TCNAN比Simple CNAPS高出约2.9%~4.9%,而在1-shot任务下,TCNAN比Simple CNAPS高出4.9%~7.1%。这是因为,减少shot数量会导致标记数据的信息量减少,从而使得转导学习的优势在一定程度上会增加,因为它能充分利用支持集和查询集之间的关系从而进行标签推理。因此,相较于1-shot条件下,TCNAN在3-shot任务下的识别精度提升幅度相对较小。
此外,本实验还绘制了这两种模型在元测试阶段的准确率曲线,如图9所示。
图9 元测试阶段中不同模型在不同情况下的准确率曲线图
从图9中可以分析出,本文提出的模型相较于Simple CNAPS展现出更高的精确度,并且其收敛速度基本都超过Simple CNAPS。这一发现表明,基于转导式学习的手势识别方法在处理手势识别任务中的少样本问题时具有更显著的优势。
本文介绍了一种基于元学习框架的网络,旨在解决手势识别中的样本稀缺问题。为了更有效地从手势的时间多普勒特征图中提取有用信息,本文提出了一种条件自适应特征提取模块。该模块可以根据不同的任务需求来调整特征提取器的关键参数。此外,该网络还结合了一种转导学习算法来实现目标的标签推理,降低了过拟合的风险,并进一步提高了识别精度。实验结果表明,在4种不同的任务设置下,本文所提模型的识别准确率均优于其他少样本学习模型,显著增强了模型的适用性和泛化能力。在未来的研究工作中,我们将着重研究如何高效地实时抓取雷达数据,并引入轻量化模型对手势进行识别,从而同时满足实际应用中对实时性和可靠性的需求。此外,我们还将探索Diffusion模型在少样本手势识别中的潜力,通过引入其生成能力进一步提升模型的性能和适应性,从而应对数据不足的挑战。
[1] LI Anna, BODANESE E, POSLAD S, et al.A Trajectory-Based Gesture Recognition in Smart Homes Based on the Ultrawideband Communication System[J].IEEE Internet of Things Journal, 2022, 9(22):22861-22873.
[2] ZERROUKI N, HARROU F, HOUACINE A, et al.Deep Learning for Hand Gesture Recognition in Virtual Museum Using Wearable Vision Sensors[J].IEEE Sensors Journal, 2024,24(6):8857-8869.
[3] QAZI T, KUMAR M R, MUKHERJEE P, et al.EgoFormer: Ego-Gesture Classification in Context of Autonomous Driving[J].IEEE Sensors Journal, 2024,24(11):18133-18140.
[4] GUO Lin, LU Zongxing, YAO Ligang.Human-Machine Interaction Sensing Technology Based on Hand Gesture Recognition: A Review[J].IEEE Trans on Human-Machine Systems, 2021, 51(4):300-309.
[5] CHEN Chen, YU Yang, SHENG Xinjun, et al.Real-Time Hand Gesture Recognition by Decoding Motor Unit Discharges Across Multiple Motor Tasks from Surface Electromyography[J].IEEE Trans on Biomedical Engineering,2023, 70(7):2058-2068.
[6] 陈君毅,蒋德琛,王智铭,等.一种基于双维度滤波和自适应定长化的FMCW雷达手势识别算法研究[J].电子学报,2023,51(8):2179-2187.
[7] ZHANG Shimeng, LI Gang, RITCHIE M, et al.Dynamic Hand Gesture Classification Based on Radar Micro-Doppler Signatures[C]//2016 CIE International Conference on Radar, Guangzhou, China: IEEE, 2016:1-4.
[8] MALYSA G, WANG Dan, NETSCH L, et al.Hidden Markov Model-Based Gesture Recognition with FMCW Radar[C]//2016 IEEE Global Conference on Signal and Information Processing, Washington, DC, USA: IEEE, 2016:1017-1021.
[9] WANG Yong, SHU Yuhong, JIA Xiuqian, et al.Multifeature Fusion-Based Hand Gesture Sensing and Recognition System[J].IEEE Geoscience and Remote Sensing Letters, 2021, 19:1-5.
[10] WANG Jie, ZHANG Liang, WANG Changcheng, et al.Device-Free Human Gesture Recognition with Generative Adversarial Networks[J].IEEE Internet of Things Journal, 2020, 7(8):7678-7688.
[11] CAO Hanqun, TAN Cheng, GAO Zhangyang, et al.A Survey on Generative Diffusion Models[J].IEEE Trans on Knowledge and Data Engineering, 2024,36(7):2814-2830.
[12] JUNG J, LIM S, KIM J, et al.Digit Recognition Using FMCW and UWB Radar Sensors: A Transfer Learning Approach[J].IEEE Sensors Journal, 2023,23(16):18776-18784.
[13] ZENG Xianglong, WU Chaoyang, YE Wenbin.User-Definable Dynamic Hand Gesture Recognition Based on Doppler Radar and Few-Shot Learning[J].IEEE Sensors Journal, 2021, 21(20):23224-23233.
[14] SHEN Xiangyu, ZHENG Haifeng, FENG Xinxin, et al.ML-HGR-Net: A Meta-Learning Network for FMCW Radar Based Hand Gesture Recognition[J].IEEE Sensors Journal, 2022, 22(11):10808-10817.
[15] GONG Shufeng, SHI Hanyin, YAN Xinyue, et al.Human Activity Recognition with FMCW Radar Using Few-Shot Learning[J].IEEE Sensors Journal, 2023,23(15):17815-17824.
[16] REN Haohao, YU Xuelian, LIU Sen, et al.Adaptive Convolutional Subspace Reasoning Network for Few-Shot SAR Target Recognition[J].IEEE Trans on Geoscience and Remote Sensing, 2023, 61:1-13.
[17] YE Hanjia, HU Hexiang, ZHAN Dechuan, et al.Few-Shot Learning via Embedding Adaptation with Set-to-Set Functions[C]//Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA: IEEE, 2020:8805-8814.
[18] SUNG F, YANG Yongxin, ZHANG Li, et al.Learning to Compare: Relation Network for Few-Shot Learning[C]//Proceedings of the IEEE Conference on Computer Vision and Pattern Recognition, Salt Lake City, UT, USA:IEEE, 2018:1199-1208.
[19] BATENI P, GOYAL R, MASRANI V, et al.Improved Few-Shot Visual Classification[C]// Proceedings of the IEEE/CVF Conference on Computer Vision and Pattern Recognition, Seattle, WA, USA: IEEE, 2020:14493-14502.
[20] BATENI P, BARBER J, VAN DE MEENT J W, et al.Enhancing Few-Shot Image Classification with Unlabelled Examples[C]//Proceedings of the IEEE/CVF Winter Conference on Applications of Computer Vision,Waikoloa, HI, USA: IEEE, 2022:1597-1606.
Few-Shot Hand Gesture Recognition with Radar Based on Transductive Conditional Neural Adaptive Network
ZHANG Yunan, YU Hongwen, SHI Ye, et al.Few-Shot Hand Gesture Recognition with Radar Based on Transductive Conditional Neural Adaptive Network[J].Radar Science and Technology, 2025, 23(4):387-395.
张雨楠 女,硕士研究生,主要研究方向为雷达信号处理、深度学习。
余鸿文 男,博士,副教授,主要研究方向为智能超表面、毫米波通信。
石 野 男,博士,研究员,主要研究方向为计算机视觉。
谭冠南 男,博士,工程师,主要研究方向为电磁场与微波。
盛志超 男,博士,副教授,主要研究方向为雷达信号处理和无线通信技术。
方 勇 男,博士,教授,主要研究方向为通信信号处理、盲信号处理和智能信息系统。