Molecular Psychiatry 通讯回应 聚类 vs 分类 方法论澄清

给主要精神障碍找"亚型":聚类不是分类

当机器学习用于精神障碍分型时,一个常见误读是把"聚类"(无标签分群)当成"分类"(有答案判别),从而错误地套用交叉验证和过拟合等评估框架。这篇通讯回应正是为了澄清这一概念。

Mol. Psychiatry, 2022, 27, 3569-3570

文章性质

这篇论文是什么

这是一篇对评论文章的回应(correspondence),作者回应 Winter & Hahn 对其 2021 年分型研究的质疑。全文仅两页,重点在于机器学习概念澄清与聚类评估思路,而非呈现新的实验结果或具体数字。
核心区别

分类 vs. 聚类——两种完全不同的任务

分类(Classification)

有标签 · 监督学习

学规则把新样本归入已知类别

可用交叉验证评估泛化

过拟合有明确定义

聚类(Clustering)

无标签 · 无监督学习

按相似性把个体"分堆"

交叉验证在此"不相关"

过拟合"很难评估"

疾病分型属于聚类问题——没有预先定义好的"正确亚型标签"。

通俗理解

"整理"不是"考试"

分类像有答案本的考试:做完对答案,看错了多少。聚类像整理一筐混合纽扣:按大小、颜色、孔数分成几盒——没人事先告诉你"正确"分法,评价标准是"分出来的组有没有实际意义"和"换一种方式整理结果变不变"。
三条核心主张

作者的回应要点

1

分型是聚类,别用"答案本逻辑"评估

交叉验证/泛化/过拟合等概念依赖"预测标签 vs 真实标签"的比较——聚类没有标签,因此这些概念不能直接套用。

2

聚类没有通用"裁判";空模型会左右结论

为聚类定义统计"空模型"非常困难——"no structure"的概念不清晰。强行假设单一高斯分布会引入未经证实的前提。

3

可信度建立在"稳不稳"和"证据链"上

用扰动数据检验分群稳定性(自编码器做多次投影);用独立数据源(影像、遗传、基因表达、临床)交叉印证。

评估思路

聚类可信度的两根"支柱"

支柱 1:稳定性 / 鲁棒性

对数据做合理的小扰动(随机子集或自编码器多次投影),看分群结构是否大体一致。如果轻轻摇一摇拼图,图案还能保持,就更"稳"。

支柱 2:外部证据链

用不同来源的数据验证分群:结构影像(皮层厚度/白质)、遗传(多基因风险评分)、基因表达(组织表达谱)、临床(用药-症状关系)。信息来源越独立,证据越强。

🔬

聚类先看"稳不稳",再看"证据链"

疾病分型没有"标准答案"可对照,因此交叉验证等分类工具不适用。更合理的路径:检验分群在扰动下是否稳定,再用多模态独立数据交叉印证。

意义与局限

能做什么 & 还不能做什么

概念澄清

最直接的贡献:厘清"分型 = 聚类"的问题属性,避免把分类评估框架错误套用于聚类。

评估框架

提出稳定性/鲁棒性 + 外部多模态验证的可信度思路,适用于无标签分型研究。

信息粒度有限

全文仅两页通讯,未给出样本量、模型细节、分型数量或效应量。

需临床复现

亚型发现需要在独立人群中复现,并证明与治疗反应/预后等临床结局相关。

常见问题

FAQ

"聚类不需要验证"吗?
恰恰相反——作者强调聚类缺少标签参照,更需要用不同数据源的外部证据验证其意义。
为什么不能像分类一样做交叉验证?
交叉验证依赖真实标签来比较预测对错。聚类没有标签,无法按同样方式定义"泛化误差"。
"过拟合不适用于聚类"——聚类永远不会错?
不是"不会错",而是在无标签场景下很难用分类式的"过拟合"定义来量化错误。更合适的做法是看稳定性/鲁棒性。
自编码器在这里做什么?
生成多次"扰动投影",用于检验分群在不同低维表示下是否稳定,提取更鲁棒的潜在特征。
亚型能用于个人诊断或指导用药吗?
本文未给出可用于个人层面的诊断阈值或用药建议。作者明确强调需要进一步临床研究复现。
术语速查

关键概念

聚类(Clustering)
无标签时按相似性把个体"分堆"——像整理纽扣,没有预设的正确分法。
分类(Classification)
有标签时学规则把新样本归到已知类别——像有答案本的考试。
交叉验证
分类任务中用于评估泛化能力的技术;在聚类中因缺少标签而"不相关"。
自编码器
将高维数据压缩到低维再还原的神经网络;本文用于生成扰动表示以检验分群稳定性。
稳定性/鲁棒性
对数据做小扰动后,分群结构是否仍大体一致——聚类可信度的核心指标。
正交模态验证
用不同来源的独立数据(影像、遗传、基因表达、临床)交叉印证分群结果。

本页面用于科研科普与方法解读,不构成医疗建议。原文为 CC BY 4.0 许可的通讯短文,未报告具体数值或效应量。任何健康决策请咨询专业医生。