可解释混合深度学习框架结合Grad-CAM用于心跳级别心律失常分类

  行业动态     |      2026-08-06 13:44

  

可解释混合深度学习框架结合Grad-CAM用于心跳级别心律失常分类(图1)

  心脏心律失常(Cardiac arrhythmia)是心血管疾病(cardiovascular disease, CVD)的常见表现,也是全球死亡率和发病率的首要原因之一。及时准确地检测心电图(electrocardiogram, ECG)心脏心律失常对于有效的临床干预至关重要。在此,研究人员提出了一种可解释混合深度学习(deep learning, DL)框架,用于自动化ECG心脏心律失常分类。所提出的模型整合了一维卷积神经网络(one-dimensional convolutional neural network, 1D-CNN)用于提取局部形态特征,门控循环单元(gated recurrent unit, GRU)用于提取时序ECG信号中的时间依赖性,以及通道注意力(channel attention, CA)技术用于强调临床重要模式。此外,还集成了梯度加权类激活映射(gradient-weighted class activation mapping, Grad-CAM)模块,通过突出影响模型决策的ECG信号关键部分来增强可解释性。该框架在三个基准数据集上进行了评估:麻省理工学院-贝斯以色列医院(Massachusetts Institute of Technology–Beth Israel Hospital, MIT-BIH)心律失常数据库、圣彼得堡INCART数据库以及MIT-BIH室上性心律失常数据库(Supraventricular Arrhythmia Database, SVDB)。该模型在三个数据集上分别实现了99.69%、99.73%和98.77%的分类准确率,以及95.75%、97.21%和94.58%的宏F1分数(macro-F1 score),以及99.53%、99.54%和98.63%的特异性。实验结果表明,在关键性能指标上,该模型的性能相比近期最先进技术提升了约2%–5%。这些发现表明,所提出的框架有效整合了局部形态特征提取与时序建模,为ECG心律失常分类提供了一种稳健且可扩展的解决方案。此外,其计算效率以及使用单导联ECG信号的优势,使其适用于可穿戴设备、远程监测系统和资源有限的临床环境中的实时部署。

  心脏心律失常(Cardiac arrhythmia)是心血管疾病(cardiovascular disease, CVD)的常见表现,以心房颤动、心室颤动、心动过缓等异常心律为特征,是全球发病率和死亡率的主要诱因,每年约导致1790万人死亡。及时准确的心电图(electrocardiogram, ECG)心律失常检测对于预防中风、心力衰竭和心脏骤停等致命后果至关重要。尽管ECG因其无创、经济且诊断可靠而成为最广泛使用的诊断工具,但临床医生的人工解读耗时且存在观察者间差异。传统机器学习(machine learning, ML)方法如决策树、支持向量机等虽在特定场景有效,但依赖手工特征且在大规模或不平衡数据集上可扩展性有限。近年来,深度学习(deep learning, DL)的发展推动了ECG分析的自动化,卷积神经网络(convolutional neural network, CNN)擅长提取局部形态特征,循环神经网络(recurrent neural network, RNN)如长短期记忆网络(long short-term memory, LSTM)和门控循环单元(gated recurrent unit, GRU)善于捕捉时序依赖。然而,现有方法仍面临ECG信号质量变异、模型复杂度高、跨数据集泛化能力不足、可解释性差等问题,限制了其在临床实践中的采纳。为此,研究人员提出了一种可解释的基于注意力的混合深度学习框架,用于多类ECG心律失常分类,旨在整合局部形态特征提取与时序建模,并增强模型可解释性。

  研究人员开发了一个集成一维卷积神经网络(one-dimensional convolutional neural network, 1D-CNN)、通道注意力(channel attention, CA)和门控循环单元(GRU)的混合深度学习框架,并加入梯度加权类激活映射(gradient-weighted class activation mapping, Grad-CAM)模块以增强可解释性。该模型在三个基准数据集(麻省理工学院-贝斯以色列医院(MIT-BIH)心律失常数据库、圣彼得堡INCART数据库和MIT-BIH室上性心律失常数据库(SVDB))上进行了评估,分别实现了99.69%、99.73%和98.77%的分类准确率,以及95.75%、97.21%和94.58%的宏F1分数。实验结果表明,该框架有效整合了局部形态特征与时序建模,为ECG心律失常分类提供了稳健且可扩展的解决方案。其计算效率和使用单导联ECG信号的特点使其适用于可穿戴设备、远程监测系统和资源有限的临床环境中的实时部署。该论文发表在《Frontiers in Physiology》。

  研究人员使用了离散小波变换(discrete wavelet transform, DWT)对原始ECG信号进行去噪,消除基线漂移、工频干扰和肌电伪迹。基于R峰位置(来自数据集注释)采用固定窗口(300个样本,R峰前99个样本、后201个样本)进行心跳分割。采用SMOTE–Tomek技术(结合合成少数过采样技术(SMOTE)和Tomek链接)处理类别不平衡,应用于训练集。模型架构包括四个1D卷积层(滤波器数16、32、64、128,核大小递增),每个卷积层后接批量归一化和通道注意力模块,随后是两个GRU层(128和64隐层单元)和全连接层,最后使用softmax激活函数进行多类分类。Grad-CAM模块用于生成可解释性热图。训练使用Adamax优化器,50轮,批量128,15%训练数据用于验证。样本队列来源:MIT-BIH数据库(47名受试者,23-89岁,360 Hz采样),INCART数据库(32名受试者,18-80岁,257 Hz采样),SVDB数据库(78名受试者,128 Hz采样)。

  **3.2 分类性能(Classification performance)**:在MIT-BIH数据集上,模型对正常(N)、室性异位(V)、室上性异位(S)、融合(F)和未知(Q)五类心跳进行分类,混淆矩阵显示S类与N类存在少量误分(31个S误分为N,40个N误分为S),Q类仅8个误分。各类准确率均高于99.33%,灵敏度分别为99.58%(N)、92.51%(S)、98.45%(V)、88.67%(F)和99.50%(Q),曲线下面积(AUC)值均超过99.63%,其中V和Q类达到99.99%。总体准确率99.69%,宏F1分数95.14%,灵敏度95.75%,特异性99.53%。

  **3.5 计算复杂度分析(Computational complexity analysis)**:1D卷积层计算复杂度为O(k·n·d2),支持并行;GRU层复杂度为O(n·d2),需顺序处理,但整体模型在计算效率和表示能力间取得平衡。

  **3.9 统计显著性(Statistical significance)**:两尾配对t检验表明,所提模型与所有基线模型(CNN、CNN+CA、CNN+LSTM、CNN+GRU)在灵敏度、特异性、F1分数和准确率上的p值均小于0.05,差异具有统计学显著性。

  讨论部分主要总结了所提模型在三个数据集上的优越性能,强调了CNN、CA和GRU组件的有效性,以及SMOTE–Tomek对少数类预测的改善。与现有方法相比,模型在准确率、F1分数、计算效率以及可解释性方面均表现出优势。未来方向包括在更大、更多样化的数据集(如PTB-XL、Chapman–Shaoxing、Georgia 12导联数据库)上验证,扩展至多导联分析,以及集成多标签分类等。

  **研究结论翻译**:本研究开发了一种可解释的混合深度学习框架,用于使用单导联ECG信号准确分类心律失常。所提出的模型整合了1D-CNN、CA和GRU,以有效提取局部形态特征和时序依赖。此外,Grad-CAM模块的集成通过强调影响分类决策的ECG信号最重要部分,提高了模型可解释性,从而增强了临床信任和透明度。实验结果表明,所提出的混合网络在三个基准数据集(MIT-BIH、INCART和SVDB)上实现了优越性能,分类准确率分别为99.69%、99.73%和98.77%。该模型还获得了高灵敏度、精确率、特异性和F1分数,证实了其稳健性和可靠性。由于其计算效率和使用单导联ECG信号,所提出的框架在可穿戴设备、远程监测系统和物联网(Internet of Things, IoT)支持的医疗应用中具有强大的实时部署潜力。此外,Grad-CAM提供的可解释性通过将模型注意力与相关ECG波形成分对齐,促进了临床上有意义的洞察,从而支持明智的决策。尽管性能令人鼓舞,但仍存在一些局限性:评估主要基于公开数据集,可能无法完全代表真实临床变异;训练需要中等计算资源,在高度资源受限环境中部署可能面临挑战。未来工作将集中在更大、更多样化的临床数据集上验证模型,优化低功耗设备架构,以及开展前瞻性临床研究以进一步增强其在实际医疗环境中的适用性。