情绪会影响说话的节奏、响度与频谱形状。这项研究让大学生朗读同一段文本,提取声学特征训练模型,用声音预测抑郁量表分数——并在网络 CBT 随访中观察到部分特征随症状改善而变化。
声音的节奏、响度与频谱——每 10 毫秒一帧,每帧 120 个底层声学特征。
47 名大学生,PHQ-9 初筛(≥5),精神科医生 HAMD-17 电话评分。
朗读同一段中性文本,安卓手机录音,转 16 kHz wav,做端点检测与音量归一化。
10 ms/帧 × 120 LLDs → 10 类统计量 → 1,200 个高层特征(HSFs)。
偏相关选出 30 个显著特征(p < 0.01),4 层 ANN + LOOCV 预测 HAMD。
18 人完成 4 周网络 CBT,比较治疗前后声学特征变化。
74 COVAREP + 20 MFCC-delta + 20 MFCC-delta² + 5 formants + Peak-to-RMS 等 → 10 类统计量 → 偏相关筛选
1,200 个特征中筛出 30 个与 HAMD 显著相关(p < 0.01),涉及 MCEP、MFCC 变化量、HMPDM/HMPDD、creak、Peak-to-RMS 等。
预测-实际相关 r = 0.682(p = 1.3×10⁻⁷),MAE = 3.137 分,63.83% 样本误差 < 4 分。但仅为样本内 LOOCV,无外部验证。
18 人完成 ICBT,HAMD 从 8.79±5.43 降至 0.52±0.86。Peak2RMS_kurt、MFCC 相关特征治疗后显著降低(p = 0.006–0.043)。
HAMD-17 总分 0–52 分,MAE ≈ 6% 量程;但 47 人 LOOCV,无外部独立验证
18 名完成 ICBT 者中,4 个声音特征(Peak2RMS_kurt、MFCC_deltas_10_intercept、MFCC_delta_deltas_4_kurt、MFCC_delta_deltas_9_kurt)治疗后显著降低。这些指标可能更适合做"疗效跟踪信号"——但仍为单组前后对比,无法推断因果。
47 人全部为 PHQ-9 ≥ 5 的抑郁症状人群,缺少健康对照基线。
47 人中 42 女 5 男;纵向 18 人中 16 女 2 男——性别泛化能力有限。
47 人中仅 18 人完成 ICBT 随访;7 人拒绝,22 人未完成。
真实自然对话场景尚未验证;作者计划加入更多语音任务与更长随访。
本页面用于科研科普与方法解读,不构成医疗建议或诊断/治疗依据。论文为小样本探索性研究,无健康对照与外部验证。任何心理健康问题请咨询专业医生。