语音分析 声学特征 神经网络 ICBT 随访

只用一段朗读,能多快"量出"抑郁程度?

情绪会影响说话的节奏、响度与频谱形状。这项研究让大学生朗读同一段文本,提取声学特征训练模型,用声音预测抑郁量表分数——并在网络 CBT 随访中观察到部分特征随症状改善而变化。

Front. Psychiatry, 2023, 14, 1195276

47
参与者
r=0.68
预测-实际相关
3.14
MAE(分)
4
随访显著变化特征

声音的节奏、响度与频谱——每 10 毫秒一帧,每帧 120 个底层声学特征。

通俗理解

把朗读录音"切片做化验"

传统抑郁评估像"问诊 + 问卷"——需要当事人理解问题、愿意表达,还要完成一整套题目。这项研究换了一种思路:让你朗读一段中性文本,用手机录下来,然后把声音拆成每秒 100 帧、每帧 120 个数字特征,再用神经网络"综合打分"——相当于给声音做一次"数字化验"。
研究流程

五步:从录音到预测

1
招募与筛查

47 名大学生,PHQ-9 初筛(≥5),精神科医生 HAMD-17 电话评分。

2
统一朗读

朗读同一段中性文本,安卓手机录音,转 16 kHz wav,做端点检测与音量归一化。

3
声学特征提取

10 ms/帧 × 120 LLDs → 10 类统计量 → 1,200 个高层特征(HSFs)。

4
特征筛选 + ANN

偏相关选出 30 个显著特征(p < 0.01),4 层 ANN + LOOCV 预测 HAMD。

5
ICBT 随访

18 人完成 4 周网络 CBT,比较治疗前后声学特征变化。

特征漏斗

从 1,200 维到 30 个关键声学特征

底层 LLDs
120/帧
120
高层 HSFs
1,200
1,200
筛选后
30
30

74 COVAREP + 20 MFCC-delta + 20 MFCC-delta² + 5 formants + Peak-to-RMS 等 → 10 类统计量 → 偏相关筛选

核心发现

三条证据链

发现 1|声音中存在与抑郁相关的可计算信号

1,200 个特征中筛出 30 个与 HAMD 显著相关(p < 0.01),涉及 MCEP、MFCC 变化量、HMPDM/HMPDD、creak、Peak-to-RMS 等。

发现 2|ANN 可预测 HAMD 分数

预测-实际相关 r = 0.682(p = 1.3×10⁻⁷),MAE = 3.137 分,63.83% 样本误差 < 4 分。但仅为样本内 LOOCV,无外部验证。

发现 3|ICBT 后 4 个特征显著变化

18 人完成 ICBT,HAMD 从 8.79±5.43 降至 0.52±0.86。Peak2RMS_kurt、MFCC 相关特征治疗后显著降低(p = 0.006–0.043)。

模型性能

预测精度一览

相关系数 r
0.682
0.682
MAE
3.137
3.14 分
误差 <4 分占比
63.83%
63.83%

HAMD-17 总分 0–52 分,MAE ≈ 6% 量程;但 47 人 LOOCV,无外部独立验证

治疗反应

ICBT 4 周后:症状与声学特征同步变化

HAMD 治疗前
8.79
8.79
HAMD 治疗后
0.52
0.52

18 名完成 ICBT 者中,4 个声音特征(Peak2RMS_kurt、MFCC_deltas_10_intercept、MFCC_delta_deltas_4_kurt、MFCC_delta_deltas_9_kurt)治疗后显著降低。这些指标可能更适合做"疗效跟踪信号"——但仍为单组前后对比,无法推断因果。

🎤

声音能提供抑郁评估的客观线索,但仍需更大样本与对照验证

这是一个"录音→数字化验→预测分数"的可行性展示。距离真正用于筛查或辅助诊断,还需健康对照、更大样本、自然对话场景与外部验证。

局限性

需要注意什么

无健康对照组

47 人全部为 PHQ-9 ≥ 5 的抑郁症状人群,缺少健康对照基线。

样本小且性别不均

47 人中 42 女 5 男;纵向 18 人中 16 女 2 男——性别泛化能力有限。

纵向完成率低

47 人中仅 18 人完成 ICBT 随访;7 人拒绝,22 人未完成。

仅限统一朗读

真实自然对话场景尚未验证;作者计划加入更多语音任务与更长随访。

常见问题

FAQ

我自己录音发给 AI 就能测抑郁吗?
不能。本研究在严格控制条件下(统一文本、统一设备处理、精神科医生评分)训练模型,且仅为 47 人 LOOCV。消费级 App 环境与本研究完全不同,不能直接套用。
为什么让所有人读同一段文字?
统一朗读内容消除了"说什么"带来的差异,让模型只关注"怎么说"——即声学特征本身,提高可比性。
MAE = 3.14 分意味着什么?
HAMD-17 总分 0–52,3.14 分约占量程 6%。在该样本内表现尚可,但 47 人的泛化能力未知。HAMD 临床分级通常以 7 分为界,3 分误差可能影响分类判断。
ICBT 后特征变化能说明声音是"因果指标"吗?
不能。这是单组前后对比(无对照组),不排除自然缓解、安慰剂效应等混杂。只能说"两者同步变化"。
术语速查

关键概念

HAMD-17
汉密尔顿抑郁量表 17 项版,由临床医生评定,总分 0–52,≥7 提示存在抑郁症状。
LLD(底层声学特征)
每帧(10 ms)计算的声学指标,如 MFCC、基频、频谱包络等。
HSF(高层统计特征)
将 LLD 在整段录音上的分布汇总为统计量(均值、方差、峰度等)。
LOOCV
留一交叉验证——每次留 1 人测试、其余训练,重复 n 次,适用于小样本。
ICBT
网络认知行为治疗,通过线上模块完成的 CBT,本研究为 4 周 12 模块。
COVAREP
一套开源语音分析工具箱,提取基频、频谱、声门脉冲等 74 个声学特征。

本页面用于科研科普与方法解读,不构成医疗建议或诊断/治疗依据。论文为小样本探索性研究,无健康对照与外部验证。任何心理健康问题请咨询专业医生。