ABAFnet 融合 4 类声学特征,在临床中文朗读语音上达到 AUC 0.85 ± 0.04
COVID-19 后抑郁病例上升,传统量表评估耗时且受回忆偏差影响。语音是一种低负担行为标记——抑郁人群在单调度、语速、韵律等方面可能出现差异,但过去方法多依赖单一维度特征,可能忽略语音"多层次"信息。不同特征的形态与尺寸差异很大,直接拼接并不容易。ABAFnet 试图解决两个问题:如何分别提取不同角度的声音线索,以及如何让模型自己学会给每个角度分配合适的权重。
把一段朗读语音想成一部"电影":它既有随时间变化的剧情,也有不同频率上的"画面纹理"。ABAFnet 从四个角度"截屏",再让模型学会在不同情境下给每个角度分配合适的权重。
Type-Adaptive CNN:对"图像型"与"向量型"特征分别用不同卷积方式处理,像给不同材料选不同刀具
LSTM + Attention:用 LSTM 捕捉长短期依赖,再用注意力对关键时间片段高亮
线性融合 + 动态权重:权重不固定,根据训练评价指标自动调整各通道重要性
只看一种"声音线索"不够稳。融合后 ACC 0.81±0.04、AUC 0.85±0.04;而单一特征中表现最好的 Mel-spectrogram 仅达 ACC 0.75±0.05、AUC 0.80±0.03。不同特征携带互补信息,融合策略更适合真实语音里复杂、异质的抑郁线索。
AUC 对比(CNRAC 二分类,10 折交叉验证均值)
模型不仅能做"有没有抑郁",也能区分一定程度的严重度,但任务难度不一样。"NC vs Moderate" AUC 达到 0.95±0.04;而"Inter-Subtype(如 Mild vs Moderate)" AUC 为 0.79±0.22,标准差更大。语音线索对"健康与中重度差异"更敏感,相邻严重度之间差异更细微、模型更容易波动。
消融实验:去掉 LSTM 后 ACC 从 0.81 降到 0.65,F1 从 0.70 降到 0.48;去掉 DWA 则 Precision 与 F1 降到约 0.5。在 HSFs 的统计检验中,32 个显著差异特征里 MFCC 相关占 43.75 %、Mel 谱相关占 43.75 %,合计 87.5 %。与人耳感知相关的 Mel/MFCC 线索是语音抑郁检测里更稳定的"信号来源"。
32 个显著差异 HSF 特征的类别占比
在 CNRAC 上,融合模型优于多种对比深度模型;迁移验证 ACC 0.89±0.02、F1 0.89±0.03
结合标准化录音流程,ABAFnet 可能用于大规模筛查的初筛环节,但需更多多中心数据与真实流程验证
外部验证受限:CS-NRAC 中抑郁样本较少,PHQ-9 阈值划分本身存在可靠性讨论。
训练耗时更长:需提取并处理四类特征,比端到端模型训练耗时更长。
人群差异仍需关注:不同性别/年龄子群的 Accuracy 存在差异,需更均衡数据验证。
本页面仅用于科研科普与方法解读,不构成医疗建议或诊断依据。若你或身边的人正在经历情绪困扰,请及时联系专业医疗机构或心理健康服务。